Les mêmes capacités fonctionnent sur différentes architectures de puces. L'usage ci-dessus est identique ; ce qui change, c'est la façon dont chaque type de matériel est exploité à fond en dessous.
Repose sur llama.cpp, ONNX Runtime et MLX, avec le backend et la quantification choisis selon la puce. Aucune configuration manuelle nécessaire.
Nous ajoutons la prise en charge modèle par modèle. Dites-nous quel est votre appareil et ce que vous voulez en faire.