
Android में ऑन-डिवाइस क्वांटाइज्ड LLMs चलाने के लिए सर्वश्रेष्ठ ऐप्स 2026 में
Q4_K_M, Q5_K_S, Q8_0। अगर ये टैग अभी तक कुछ मायने नहीं रखते, तो ये वही कारण हैं कि एक 7-बिलियन-पैरामीटर मॉडल अब एक 6 GB फोन में फिट हो जाता है। क्वांटाइजेशन मॉडल वेट्स को 16-बिट फ्लोट से 4-बिट पूर्णांक में बदल देता है, जो एक चैट मॉडल को 14 GB से 5 GB से कम कर देता है और आपके फोन को क्लाउड API बिल के बिना इसे चलाने देता है।
हमने Pixel 8 और एक Snapdragon 8 Gen 2 टैबलेट पर सात ऐप्स का परीक्षण किया। हमने जो परवाह की: कौन से ऐप्स बिना लैपटॉप के GGUF और MLC क्वांटाइज्ड वेट्स लोड करते हैं, कौन से ऑफलाइन एयरप्लेन मोड में चलते हैं, और कौन से बिना थर्मल-थ्रॉटलिंग के बातचीत रख सकते हैं।
ऑन-डिवाइस LLM ऐप में क्या देखें
- सामान्य क्वांटाइजेशन फॉर्मेट के लिए समर्थन: GGUF (llama.cpp शैली) या MLC (संकलित कर्नेल)।
- एक मॉडल कैटलॉग जिसे आप Hugging Face URLs पेस्ट किए बिना ब्राउज कर सकते हैं।
- स्थायी चैट इतिहास जो स्थानीय रूप से सहेजा गया है, किसी सर्वर को स्ट्रीम नहीं किया गया।
- टोकन-प्रति-सेकंड रीडआउट, ताकि आप जान सकें कि कब कोई मॉडल फोन के लिए बहुत भारी है।
- CPU बनाम GPU बनाम NPU अनुमान टॉगल, क्योंकि एक Snapdragon 8-सीरीज़ NPU थ्रूपुट को दोगुना कर सकता है।
- एयरप्लेन-मोड ऑपरेशन। अगर इसे “नमस्ते” का जवाब देने के लिए Wi-Fi की आवश्यकता है, तो यह ऑन-डिवाइस नहीं है।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ के लिए | मुक्त योजना | शुरुआती मूल्य/महीना | रेटिंग |
|---|---|---|---|---|
| MLC Chat | संकलित MLC कर्नेल, सर्वश्रेष्ठ थ्रूपुट | हाँ (ओपन सोर्स) | मुक्त | 4.4 |
| PocketPal AI | GGUF मॉडल्स दोस्ताना कैटलॉग के साथ | हाँ (ओपन सोर्स) | मुक्त | 4.6 |
| Layla | रोलप्ले और लंबे-संदर्भ चैट | मुक्त स्तर | $9.99 एक बार | 4.5 |
| Sherpa | न्यूनतम llama.cpp शेल | हाँ (ओपन सोर्स) | मुक्त | 4.2 |
| LLMFarm Companion | क्रॉस-डिवाइस मॉडल सिंक | हाँ | $4.99 एक बार | 4.3 |
| ChatterUI | मल्टी-मॉडल चैट फ्रंटएंड | हाँ (ओपन सोर्स) | मुक्त | 4.5 |
| Enchanted | होम Ollama सर्वर के लिए फ्रंटएंड | हाँ (ओपन सोर्स) | मुक्त | 4.4 |
ऐप्स
1. MLC Chat — संकलित MLC कर्नेल और शीर्ष थ्रूपुट के लिए सर्वश्रेष्ठ
MLC Chat पूर्व-संकलित मॉडल के साथ आता है जो आपके फोन में सटीक Adreno या Mali GPU के लिए ट्यून किए गए हैं। यह संकलन चरण ही वह है जो एक 3-बिलियन पैरामीटर Phi मॉडल को Pixel 8 पर 15+ टोकन/सेकंड में चलने देता है, जो एक सामान्य GGUF रनटाइम का लगभग दोगुना है। ऐप के अंदर कैटलॉग कम है लेकिन क्यूरेटेड है: Llama, Phi, Gemma, Mistral, RedPajama।
जहां यह कम पड़ता है: मनमानी GGUF फाइलों के लिए कोई समर्थन नहीं। अगर आपके पास पहले से डाउनलोड किया गया मॉडल है, तो आप इसे MLC के लिए पुनः संकलन किए बिना यहाँ लोड नहीं कर सकते।
मूल्य निर्धारण:
- मुक्त: Apache 2.0 ओपन सोर्स।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Android 8.0 और ऊपर।
निचली पंक्ति: MLC Chat प्राप्त करें जब अधिकतम टोकन-प्रति-सेकंड महत्वपूर्ण हो और आप निश्चित कैटलॉग के साथ रह सकते हों।
2. PocketPal AI — GGUF मॉडल्स दोस्ताना कैटलॉग के साथ सर्वश्रेष्ठ
PocketPal AI किसी भी GGUF को लोड करता है जिसे आप इसकी ओर इशारा करते हैं। इन-ऐप खोज ब्राउज़र पर स्विच किए बिना Hugging Face को ब्राउज़ करता है, और डाउनलोड स्क्रीन क्वांट स्तर, आकार और आपकी डिवाइस के लिए एक मोटे टोकन-प्रति-सेकंड अनुमान दिखाती है इससे पहले कि आप 4 GB डिस्क को प्रतिबद्ध करें। चैट इतिहास डिवाइस पर रहता है।
जहां यह कम पड़ता है: MLC की तुलना में GPU त्वरण समान फोन पर पिछड़ता है। लंबे-संदर्भ बातचीत 6 GB डिवाइसों पर RAM को तेजी से खाती है।
मूल्य निर्धारण:
- मुक्त: MIT-लाइसेंस प्राप्त ओपन सोर्स।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Android 9.0 और ऊपर।
निचली पंक्ति: Android पर GGUF क्वांटाइजेशन के लिए नए किसी के लिए सबसे अनुकूल तरीका।
3. Layla — रोलप्ले और लंबे-संदर्भ चैट के लिए सर्वश्रेष्ठ
Layla रोलप्ले और लंबी-कहानी-लेखन भीड़ को लक्षित करता है। यह प्रॉम्प्ट टेम्प्लेट, चरित्र-कार्ड आयात और बड़ी डिफ़ॉल्ट संदर्भ विंडो के साथ आता है जो कई मोड़ों में कहानी की निरंतरता रखने के लिए ट्यून किए गए हैं। GGUF स्थानीय रूप से चलाता है; एक सशुल्क स्तर वॉइस इनपुट और प्रीमियम मॉडल जोड़ता है।
जहां यह कम पड़ता है: UI व्यस्त है। कुछ पूर्वनिर्मित चरित्र वयस्क-थीमयुक्त होते हैं; सुरक्षा फ़िल्टर को पारिवारिक उपयोग के लिए मैनुअल ट्यूनिंग की आवश्यकता होती है।
मूल्य निर्धारण:
- मुक्त: कुछ पूर्वनिर्धारित मॉडल्स के साथ आधार चैट।
- सशुल्क: $9.99 एक बार (Pro) वॉइस, बड़े मॉडल्स और क्लाउड सिंक को अनलॉक करता है।
प्लेटफॉर्म: Android 9.0 और ऊपर।
निचली पंक्ति: Layla चुनें अगर आप स्थानीय मॉडल चाहते हैं कि कारण काल्पनिक लेखन है जो एक क्लाउड मॉडल मना करेगा।
4. Sherpa — न्यूनतम llama.cpp शेल के लिए सर्वश्रेष्ठ
Sherpa उन लोगों के लिए ऐप है जो पहले से जानते हैं कि वे क्या चाहते हैं। इसे SD कार्ड पर एक GGUF फाइल की ओर इशारा करें, अपनी संदर्भ लंबाई और थ्रेड काउंट सेट करें, और जाएं। कोई कैटलॉग नहीं, कोई सिंक नहीं, कोई अनावश्यक चीज़ नहीं।
जहां यह कम पड़ता है: कोई हाथ पकड़ना नहीं। पहली बार आने वाले एक मॉडल लोड कर सकते हैं जो फिट नहीं होगा और ऐप को क्रैश करेगा।
मूल्य निर्धारण:
- मुक्त: MIT लाइसेंस।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Android 8.0 और ऊपर।
निचली पंक्ति: उन शक्तिशाली उपयोगकर्ताओं के लिए जो एक चैट-ऐप रैपर के बिना llama.cpp रनटाइम चाहते हैं।
5. LLMFarm Companion — क्रॉस-डिवाइस मॉडल सिंक के लिए सर्वश्रेष्ठ
LLMFarm iOS पर शुरू हुआ और एक Android साथी है जो समान कैटलॉग और प्रॉम्प्ट लाइब्रेरी को मिरर करता है। उपयोगी अगर आप iPad और Android टैबलेट के बीच समय विभाजित करते हैं और दोनों पर समान चरित्र और सिस्टम प्रॉम्प्ट चाहते हैं।
जहां यह कम पड़ता है: PocketPal से कम फॉर्मेट टॉगल। Adreno पर GPU समर्थन अभी भी पकड़ में है।
मूल्य निर्धारण:
- मुक्त: आधार चैट।
- सशुल्क: $4.99 एक बार मॉडल-आकार प्रतिबंधों को हटाता है।
प्लेटफॉर्म: Android 10 और ऊपर।
निचली पंक्ति: यह चुनें अगर आप पहले से iOS पर LLMFarm का उपयोग करते हैं और प्रॉम्प्ट समानता चाहते हैं।
6. ChatterUI — सर्वश्रेष्ठ मल्टी-मॉडल चैट फ्रंटएंड
ChatterUI प्रत्येक बैकएंड को समान मानता है, चाहे आप फोन पर llama.cpp, लैपटॉप पर KoboldCpp, या घर के सर्वर पर Ollama चला रहे हों। बातचीत के बीच एक छोटे स्थानीय मॉडल से एक बड़े दूरस्थ मॉडल में स्विच करें बिना धागा खोए।
जहां यह कम पड़ता है: पहली लॉन्च पर कॉन्फ़िगरेशन भारी है। कौन सा मॉडल चुनना है, इस बारे में कोई विचार नहीं है, इसलिए नए लोग चयनकर्ता पर रुक जाते हैं।
मूल्य निर्धारण:
- मुक्त: GPLv3 ओपन सोर्स।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Android 8.0 और ऊपर।
डाउनलोड: GitHub Releases
निचली पंक्ति: सही चुनाव जब फोन अनुमान चलाने के लिए कई स्थानों में से एक है।
7. Enchanted — घर के Ollama सर्वर के लिए सर्वश्रेष्ठ फ्रंटएंड
Enchanted स्वयं एक ऑन-डिवाइस इंजन नहीं है। यह एक पॉलिश किया गया चैट ऐप है जो आपके लैपटॉप या घर के सर्वर पर चलने वाले Ollama उदाहरण से बात करता है। चलते-फिरते, ऊपर दिए गए ऐप्स में से एक में एक स्थानीय क्वांटाइज्ड मॉडल का उपयोग करें; घर पर, एक बड़े मॉडल के लिए Enchanted में कूदें जो आपका फोन होस्ट नहीं कर सकता।
जहां यह कम पड़ता है: कहीं भी Ollama चलाने वाली एक मशीन की आवश्यकता होती है। दूरस्थ उपयोग के लिए सुरंग या LAN पहुँच की आवश्यकता होती है।
मूल्य निर्धारण:
- मुक्त: MIT ओपन सोर्स।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Android 9.0 और ऊपर।
डाउनलोड: GitHub Releases
निचली पंक्ति: किसी भी ऑन-डिवाइस ऐप के साथ इसे जोड़ी करें उन दिनों के लिए जब आपका फोन आप जो मॉडल चाहते हैं वह फिट नहीं कर सकता।
सही एक कैसे चुनें
- अगर आप सबसे तेज़ टोकन/सेकंड चाहते हैं और निश्चित कैटलॉग के साथ रह सकते हैं: MLC Chat चुनें।
- अगर आप ऐप के अंदर Hugging Face से GGUF मॉडल्स ब्राउज़ और डाउनलोड करना चाहते हैं: PocketPal AI चुनें।
- अगर आपका लक्ष्य लंबे-संदर्भ चैट के साथ काल्पनिक लेखन है: Layla चुनें।
- अगर आप पहले से llama.cpp जानते हैं और न्यूनतम शेल चाहते हैं: Sherpa चुनें।
- अगर आप iOS और Android के बीच समय विभाजित करते हैं: LLMFarm Companion चुनें।
- अगर आप चैट के बीच स्थानीय और दूरस्थ बैकएंड के बीच स्विच करना चाहते हैं: ChatterUI चुनें।
- अगर घर का Ollama सर्वर आपका मुख्य मॉडल होस्ट है: ऑफलाइन दिनों के लिए ऊपर दिए गए किसी एक के साथ Enchanted को जोड़ी करें।
संक्षेपणों को उपयोग करने के बाद कम डरावने हो जाते हैं। Llama 3.1 8B का Q4_K_M क्वांट 8 GB वाले किसी भी फोन पर आराम से फिट हो जाता है; Phi-3 Mini का Q8_0 6 GB फोन पर आश्चर्यजनक रूप से अच्छा चलता है। वहां से शुरू करें, टोकन/सेकंड को देखें, और ऊपर या नीचे जाएं।
FAQ
Q4_K_M वास्तव में क्या मायने रखता है?
Q4 का अर्थ है मॉडल वेट्स का 4-बिट क्वांटाइजेशन। K k-क्वांट को संदर्भित करता है, llama.cpp द्वारा पेश किया गया एक स्मार्ट समूहीकरण। M मध्यम संस्करण है, जो गुणवत्ता के लिए कुछ 5-बिट टेंसर मिश्रण करता है। व्यावहारिक रूप से: Q4_K_M “डिफ़ॉल्ट काफी अच्छा” स्तर है।
एक ऑन-डिवाइस मॉडल को कितने RAM की आवश्यकता है?
नियम: मॉडल फाइल आकार प्लस रनटाइम और संदर्भ कैश के लिए 30%। एक 4 GB मॉडल को लगभग 5.5 GB मुक्त की आवश्यकता होती है। 8 GB या अधिक RAM वाले फोन Q4 पर 7B-पैरामीटर मॉडल को संभालते हैं; 6 GB फोन 3B तक रहते हैं।
क्या मेरा फोन ज्यादा गर्म हो जाएगा?
एक मध्य-स्तर के फोन पर निरंतर अनुमान कुछ मिनटों के भीतर थर्मल-थ्रॉटल करेगा। नए Snapdragon 8 Gen 2/3 या Tensor G4 डिवाइस को पसंद करें, और जब यह चलता है तो फोन को नरम सतह से दूर रखें।
क्या ये ऐप्स मेरे प्रॉम्प्ट कहीं भेजते हैं?
ऑन-डिवाइस अनुमान डिवाइस पर रहता है। Enchanted और ChatterUI दूरस्थ बैकएंड से बात करने के लिए कॉन्फ़िगर किए जाने पर अपवाद हैं। पहली लॉन्च पर प्रत्येक ऐप के नेटवर्क प्रॉम्प्ट पढ़ें।
मुझे किस मॉडल के साथ शुरू करना चाहिए?
Phi-3 Mini Q4_K_M, Llama 3.2 3B Q4_K_M, या Gemma 2 2B एक आधुनिक Android फोन के लिए सुरक्षित शुरुआती बिंदु हैं। अगर डिवाइस में 12 GB या अधिक RAM है तो Llama 3.1 8B तक बढ़ाएं।