Android पर MLC Chat द्वारा क्वांटाइज्ड LLM चलाया जा रहा है

Android में ऑन-डिवाइस क्वांटाइज्ड LLMs चलाने के लिए सर्वश्रेष्ठ ऐप्स 2026 में

Q4_K_M, Q5_K_S, Q8_0। अगर ये टैग अभी तक कुछ मायने नहीं रखते, तो ये वही कारण हैं कि एक 7-बिलियन-पैरामीटर मॉडल अब एक 6 GB फोन में फिट हो जाता है। क्वांटाइजेशन मॉडल वेट्स को 16-बिट फ्लोट से 4-बिट पूर्णांक में बदल देता है, जो एक चैट मॉडल को 14 GB से 5 GB से कम कर देता है और आपके फोन को क्लाउड API बिल के बिना इसे चलाने देता है।

हमने Pixel 8 और एक Snapdragon 8 Gen 2 टैबलेट पर सात ऐप्स का परीक्षण किया। हमने जो परवाह की: कौन से ऐप्स बिना लैपटॉप के GGUF और MLC क्वांटाइज्ड वेट्स लोड करते हैं, कौन से ऑफलाइन एयरप्लेन मोड में चलते हैं, और कौन से बिना थर्मल-थ्रॉटलिंग के बातचीत रख सकते हैं।

ऑन-डिवाइस LLM ऐप में क्या देखें

त्वरित तुलना

ऐप सर्वश्रेष्ठ के लिए मुक्त योजना शुरुआती मूल्य/महीना रेटिंग
MLC Chat संकलित MLC कर्नेल, सर्वश्रेष्ठ थ्रूपुट हाँ (ओपन सोर्स) मुक्त 4.4
PocketPal AI GGUF मॉडल्स दोस्ताना कैटलॉग के साथ हाँ (ओपन सोर्स) मुक्त 4.6
Layla रोलप्ले और लंबे-संदर्भ चैट मुक्त स्तर $9.99 एक बार 4.5
Sherpa न्यूनतम llama.cpp शेल हाँ (ओपन सोर्स) मुक्त 4.2
LLMFarm Companion क्रॉस-डिवाइस मॉडल सिंक हाँ $4.99 एक बार 4.3
ChatterUI मल्टी-मॉडल चैट फ्रंटएंड हाँ (ओपन सोर्स) मुक्त 4.5
Enchanted होम Ollama सर्वर के लिए फ्रंटएंड हाँ (ओपन सोर्स) मुक्त 4.4

ऐप्स

1. MLC Chat — संकलित MLC कर्नेल और शीर्ष थ्रूपुट के लिए सर्वश्रेष्ठ

MLC Chat पूर्व-संकलित मॉडल के साथ आता है जो आपके फोन में सटीक Adreno या Mali GPU के लिए ट्यून किए गए हैं। यह संकलन चरण ही वह है जो एक 3-बिलियन पैरामीटर Phi मॉडल को Pixel 8 पर 15+ टोकन/सेकंड में चलने देता है, जो एक सामान्य GGUF रनटाइम का लगभग दोगुना है। ऐप के अंदर कैटलॉग कम है लेकिन क्यूरेटेड है: Llama, Phi, Gemma, Mistral, RedPajama।

जहां यह कम पड़ता है: मनमानी GGUF फाइलों के लिए कोई समर्थन नहीं। अगर आपके पास पहले से डाउनलोड किया गया मॉडल है, तो आप इसे MLC के लिए पुनः संकलन किए बिना यहाँ लोड नहीं कर सकते।

मूल्य निर्धारण:

प्लेटफॉर्म: Android 8.0 और ऊपर।

डाउनलोड: Aptoide

निचली पंक्ति: MLC Chat प्राप्त करें जब अधिकतम टोकन-प्रति-सेकंड महत्वपूर्ण हो और आप निश्चित कैटलॉग के साथ रह सकते हों।

2. PocketPal AI — GGUF मॉडल्स दोस्ताना कैटलॉग के साथ सर्वश्रेष्ठ

PocketPal AI किसी भी GGUF को लोड करता है जिसे आप इसकी ओर इशारा करते हैं। इन-ऐप खोज ब्राउज़र पर स्विच किए बिना Hugging Face को ब्राउज़ करता है, और डाउनलोड स्क्रीन क्वांट स्तर, आकार और आपकी डिवाइस के लिए एक मोटे टोकन-प्रति-सेकंड अनुमान दिखाती है इससे पहले कि आप 4 GB डिस्क को प्रतिबद्ध करें। चैट इतिहास डिवाइस पर रहता है।

जहां यह कम पड़ता है: MLC की तुलना में GPU त्वरण समान फोन पर पिछड़ता है। लंबे-संदर्भ बातचीत 6 GB डिवाइसों पर RAM को तेजी से खाती है।

मूल्य निर्धारण:

प्लेटफॉर्म: Android 9.0 और ऊपर।

डाउनलोड: Google Play

निचली पंक्ति: Android पर GGUF क्वांटाइजेशन के लिए नए किसी के लिए सबसे अनुकूल तरीका।

3. Layla — रोलप्ले और लंबे-संदर्भ चैट के लिए सर्वश्रेष्ठ

Layla रोलप्ले और लंबी-कहानी-लेखन भीड़ को लक्षित करता है। यह प्रॉम्प्ट टेम्प्लेट, चरित्र-कार्ड आयात और बड़ी डिफ़ॉल्ट संदर्भ विंडो के साथ आता है जो कई मोड़ों में कहानी की निरंतरता रखने के लिए ट्यून किए गए हैं। GGUF स्थानीय रूप से चलाता है; एक सशुल्क स्तर वॉइस इनपुट और प्रीमियम मॉडल जोड़ता है।

जहां यह कम पड़ता है: UI व्यस्त है। कुछ पूर्वनिर्मित चरित्र वयस्क-थीमयुक्त होते हैं; सुरक्षा फ़िल्टर को पारिवारिक उपयोग के लिए मैनुअल ट्यूनिंग की आवश्यकता होती है।

मूल्य निर्धारण:

प्लेटफॉर्म: Android 9.0 और ऊपर।

डाउनलोड: Google Play

निचली पंक्ति: Layla चुनें अगर आप स्थानीय मॉडल चाहते हैं कि कारण काल्पनिक लेखन है जो एक क्लाउड मॉडल मना करेगा।

4. Sherpa — न्यूनतम llama.cpp शेल के लिए सर्वश्रेष्ठ

Sherpa उन लोगों के लिए ऐप है जो पहले से जानते हैं कि वे क्या चाहते हैं। इसे SD कार्ड पर एक GGUF फाइल की ओर इशारा करें, अपनी संदर्भ लंबाई और थ्रेड काउंट सेट करें, और जाएं। कोई कैटलॉग नहीं, कोई सिंक नहीं, कोई अनावश्यक चीज़ नहीं।

जहां यह कम पड़ता है: कोई हाथ पकड़ना नहीं। पहली बार आने वाले एक मॉडल लोड कर सकते हैं जो फिट नहीं होगा और ऐप को क्रैश करेगा।

मूल्य निर्धारण:

प्लेटफॉर्म: Android 8.0 और ऊपर।

डाउनलोड: F-Droid

निचली पंक्ति: उन शक्तिशाली उपयोगकर्ताओं के लिए जो एक चैट-ऐप रैपर के बिना llama.cpp रनटाइम चाहते हैं।

5. LLMFarm Companion — क्रॉस-डिवाइस मॉडल सिंक के लिए सर्वश्रेष्ठ

LLMFarm iOS पर शुरू हुआ और एक Android साथी है जो समान कैटलॉग और प्रॉम्प्ट लाइब्रेरी को मिरर करता है। उपयोगी अगर आप iPad और Android टैबलेट के बीच समय विभाजित करते हैं और दोनों पर समान चरित्र और सिस्टम प्रॉम्प्ट चाहते हैं।

जहां यह कम पड़ता है: PocketPal से कम फॉर्मेट टॉगल। Adreno पर GPU समर्थन अभी भी पकड़ में है।

मूल्य निर्धारण:

प्लेटफॉर्म: Android 10 और ऊपर।

डाउनलोड: Google Play

निचली पंक्ति: यह चुनें अगर आप पहले से iOS पर LLMFarm का उपयोग करते हैं और प्रॉम्प्ट समानता चाहते हैं।

6. ChatterUI — सर्वश्रेष्ठ मल्टी-मॉडल चैट फ्रंटएंड

ChatterUI प्रत्येक बैकएंड को समान मानता है, चाहे आप फोन पर llama.cpp, लैपटॉप पर KoboldCpp, या घर के सर्वर पर Ollama चला रहे हों। बातचीत के बीच एक छोटे स्थानीय मॉडल से एक बड़े दूरस्थ मॉडल में स्विच करें बिना धागा खोए।

जहां यह कम पड़ता है: पहली लॉन्च पर कॉन्फ़िगरेशन भारी है। कौन सा मॉडल चुनना है, इस बारे में कोई विचार नहीं है, इसलिए नए लोग चयनकर्ता पर रुक जाते हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Android 8.0 और ऊपर।

डाउनलोड: GitHub Releases

निचली पंक्ति: सही चुनाव जब फोन अनुमान चलाने के लिए कई स्थानों में से एक है।

7. Enchanted — घर के Ollama सर्वर के लिए सर्वश्रेष्ठ फ्रंटएंड

Enchanted स्वयं एक ऑन-डिवाइस इंजन नहीं है। यह एक पॉलिश किया गया चैट ऐप है जो आपके लैपटॉप या घर के सर्वर पर चलने वाले Ollama उदाहरण से बात करता है। चलते-फिरते, ऊपर दिए गए ऐप्स में से एक में एक स्थानीय क्वांटाइज्ड मॉडल का उपयोग करें; घर पर, एक बड़े मॉडल के लिए Enchanted में कूदें जो आपका फोन होस्ट नहीं कर सकता।

जहां यह कम पड़ता है: कहीं भी Ollama चलाने वाली एक मशीन की आवश्यकता होती है। दूरस्थ उपयोग के लिए सुरंग या LAN पहुँच की आवश्यकता होती है।

मूल्य निर्धारण:

प्लेटफॉर्म: Android 9.0 और ऊपर।

डाउनलोड: GitHub Releases

निचली पंक्ति: किसी भी ऑन-डिवाइस ऐप के साथ इसे जोड़ी करें उन दिनों के लिए जब आपका फोन आप जो मॉडल चाहते हैं वह फिट नहीं कर सकता।

सही एक कैसे चुनें

संक्षेपणों को उपयोग करने के बाद कम डरावने हो जाते हैं। Llama 3.1 8B का Q4_K_M क्वांट 8 GB वाले किसी भी फोन पर आराम से फिट हो जाता है; Phi-3 Mini का Q8_0 6 GB फोन पर आश्चर्यजनक रूप से अच्छा चलता है। वहां से शुरू करें, टोकन/सेकंड को देखें, और ऊपर या नीचे जाएं।

FAQ

Q4_K_M वास्तव में क्या मायने रखता है?

Q4 का अर्थ है मॉडल वेट्स का 4-बिट क्वांटाइजेशन। K k-क्वांट को संदर्भित करता है, llama.cpp द्वारा पेश किया गया एक स्मार्ट समूहीकरण। M मध्यम संस्करण है, जो गुणवत्ता के लिए कुछ 5-बिट टेंसर मिश्रण करता है। व्यावहारिक रूप से: Q4_K_M “डिफ़ॉल्ट काफी अच्छा” स्तर है।

एक ऑन-डिवाइस मॉडल को कितने RAM की आवश्यकता है?

नियम: मॉडल फाइल आकार प्लस रनटाइम और संदर्भ कैश के लिए 30%। एक 4 GB मॉडल को लगभग 5.5 GB मुक्त की आवश्यकता होती है। 8 GB या अधिक RAM वाले फोन Q4 पर 7B-पैरामीटर मॉडल को संभालते हैं; 6 GB फोन 3B तक रहते हैं।

क्या मेरा फोन ज्यादा गर्म हो जाएगा?

एक मध्य-स्तर के फोन पर निरंतर अनुमान कुछ मिनटों के भीतर थर्मल-थ्रॉटल करेगा। नए Snapdragon 8 Gen 2/3 या Tensor G4 डिवाइस को पसंद करें, और जब यह चलता है तो फोन को नरम सतह से दूर रखें।

क्या ये ऐप्स मेरे प्रॉम्प्ट कहीं भेजते हैं?

ऑन-डिवाइस अनुमान डिवाइस पर रहता है। Enchanted और ChatterUI दूरस्थ बैकएंड से बात करने के लिए कॉन्फ़िगर किए जाने पर अपवाद हैं। पहली लॉन्च पर प्रत्येक ऐप के नेटवर्क प्रॉम्प्ट पढ़ें।

मुझे किस मॉडल के साथ शुरू करना चाहिए?

Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, या Gemma 2 2B एक आधुनिक Android फोन के लिए सुरक्षित शुरुआती बिंदु हैं। अगर डिवाइस में 12 GB या अधिक RAM है तो Llama 3.1 8B तक बढ़ाएं।