As mesmas capacidades rodam em chips de arquiteturas diferentes. O uso descrito acima é idêntico; o que muda é como cada tipo de hardware é aproveitado por baixo.
Baseado em llama.cpp, ONNX Runtime e MLX, com o backend e a quantização escolhidos para cada chip. Sem configuração manual.
Estamos dando suporte modelo a modelo. Conte qual é o seu dispositivo e o que gostaria de fazer com ele.