同一套能力运行在不同架构的芯片上。上层用法一致,差别在于底层如何充分利用各类硬件。
使用 llama.cpp、ONNX Runtime、MLX,按芯片选择后端与量化方式,无需手动配置。
我们在逐款适配。欢迎说明你的设备型号与使用场景。