Одни и те же возможности работают на чипах разных архитектур. Способ использования выше одинаков; различается то, насколько полно используется каждый вид оборудования под капотом.
Основана на llama.cpp, ONNX Runtime и MLX, с бэкендом и квантизацией, подобранными под каждый чип. Ручная настройка не нужна.
Мы добавляем поддержку модель за моделью. Расскажите, какое у вас устройство и что вы хотели бы с ним делать.