Las mismas capacidades funcionan en chips de distintas arquitecturas. El uso es idéntico; lo que cambia es cuánto se aprovecha cada tipo de hardware por debajo.
Basado en llama.cpp, ONNX Runtime y MLX, con el backend y la cuantización elegidos según el chip. No requiere configuración manual.
Vamos agregando compatibilidad modelo por modelo. Cuéntenos qué dispositivo tiene y qué le gustaría hacer con él.