एक ही क्षमता अलग-अलग चिप आर्किटेक्चर पर चलती है। ऊपर का इस्तेमाल एक जैसा रहता है; बदलता यह है कि नीचे हर तरह के हार्डवेयर का कितना पूरा उपयोग होता है।
llama.cpp, ONNX Runtime और MLX पर बना, जिसमें हर चिप के हिसाब से बैकएंड और क्वांटाइज़ेशन चुना जाता है। हाथ से कुछ कॉन्फ़िगर करने की ज़रूरत नहीं।
हम एक-एक मॉडल के लिए समर्थन जोड़ रहे हैं। हमें अपना डिवाइस और उससे आप क्या करना चाहते हैं, बताइए।