同じ機能が、アーキテクチャの異なるチップの上で動きます。上のレイヤーの使い方は同じで、違いは下のレイヤーがハードウェアをどこまで使い切るかです。
llama.cpp・ONNX Runtime・MLX を使い、チップに応じてバックエンドと量子化方式を選びます。手動での設定は不要です。
機種ごとに順次対応しています。お使いのデバイスと用途をお知らせください。