같은 기능이 서로 다른 칩 아키텍처에서 실행됩니다. 위쪽의 사용법은 같고, 달라지는 것은 하드웨어를 얼마나 충분히 활용하느냐입니다.
llama.cpp, ONNX Runtime, MLX를 기반으로 하며, 칩에 따라 백엔드와 양자화 방식을 정합니다. 직접 설정할 필요가 없습니다.
기기 모델별로 하나씩 적용하고 있습니다. 가지고 계신 기기 모델과 하고 싶은 일을 알려 주세요.