同一套能力運行在不同架構的晶片上。上層用法一致,差別在於底層如何充分利用各類硬體。
使用 llama.cpp、ONNX Runtime、MLX,按晶片選擇後端與量化方式,無需手動設定。
我們在逐款適配。歡迎說明你的裝置型號與使用場景。