8 GB RAM वाला एक आधुनिक Android फोन कुछ सेकंड में 3B मॉडल को मेमोरी में रख सकता है और प्रश्नों का उत्तर दे सकता है, ऑफलाइन। यह बिंदु GPT या Claude को कठिन समस्याओं के लिए प्रतिस्थापित करना नहीं है। यह बिंदु एक निजी, नेटवर्क-रहित चैट है जो उड़ान, सीमा पार करने या खराब होटल Wi-Fi को सहन करता है। Android पर डिवाइस पर LLM चलाने के लिए सर्वश्रेष्ठ ऐप्स तीन तरीकों से भिन्न होते हैं: वे कौन सी परिमाणित मॉडल प्रारूप लोड करते हैं, स्थिर रहने के लिए उन्हें कितने RAM की आवश्यकता है, और छोटी स्क्रीन पर चैट इंटरफेस कितना उपयोग करने योग्य है। हमने सात को एक महीने की दैनिक उपयोग के माध्यम से रखा।
डिवाइस पर LLM ऐप में क्या देखें
छह चीजें एक चैट ऐप को अलग करती हैं जो स्थापित रहता है उससे जो एक सप्ताह में अनइंस्टॉल हो जाता है:
- मॉडल प्रारूप समर्थन। GGUF सबसे आम है; MLC और ONNX अगले हैं। ऐप जो भी प्रारूप समर्थन करता है, यह तय करता है कि कौन से मॉडल उपलब्ध हैं।
- परिमाणीकरण विकल्प। Q4_K_M 8 GB पर 3B मॉडल के लिए甘い स्पॉट है; Q3 छोटा है लेकिन ध्यान से खराब है।
- संदर्भ विंडो हैंडलिंग। क्या ऐप एक चलती हुई इतिहास रखता है या प्रत्येक मोड़ पर रीसेट करता है।
- मामूली हार्डवेयर पर प्रति सेकंड टोकन। Snapdragon 8 Gen 2 फोन लगभग 15 से 25 tok/s पर 3B Q4 चलाता है।
- बैटरी व्यवहार। लंबी पीढ़ी फोन को गर्म करती है। एक पृष्ठभूमि झंडा या एक टाइमर जो सत्र को सीमित करता है मदद करता है।
- लागत और बंद-स्रोत स्थिति। कुछ विकल्प freemium हैं क्लाउड फॉलबैक के साथ जिन्हें बंद करने की आवश्यकता है।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ के लिए | मॉडल प्रारूप | निःशुल्क स्तर | उल्लेखनीय |
|---|---|---|---|---|
| PocketPal AI | सामान्य डिवाइस पर चैट | GGUF | निःशुल्क, ओपन-सोर्स | GGUF मॉडल के लिए सर्वश्रेष्ठ डाउनलोड UX |
| MLC Chat | Snapdragon 8 पर गति | MLC | निःशुल्क, ओपन-सोर्स | यहां सब कुछ में सबसे तेज़ tok/s |
| Layla | चरित्र चैट और रोलप्ले | GGUF | निःशुल्क स्तर, सदस्यता | पॉलिश्ड UI, चरित्र पुस्तकालय |
| MyDeviceAI | उपकरण के साथ सहायक | GGUF, ONNX | निःशुल्क, ओपन-सोर्स | वेब-सर्च ग्राउंडिंग, डिवाइस पर रहता है |
| SmolChat | छोटे फोन (4 से 6 GB) | GGUF (small) | निःशुल्क, ओपन-सोर्स | 1B और 1.5B मॉडल को स्वच्छ रूप से चलाता है |
| Private AI Chat | कोई खाता नहीं, कोई टेलीमेट्री नहीं | GGUF | निःशुल्क | क्यूरेटेड मॉडल सूची के साथ दिया गया है |
| Enchanted | होम सर्वर पर Ollama | Ollama को रिमोट | निःशुल्क, ओपन-सोर्स | सर्वश्रेष्ठ जब फोन होम LLM से बात करता है |
ऐप्स
1. PocketPal AI, सर्वश्रेष्ठ सामान्य डिवाइस पर चैट
PocketPal AI Hugging Face से ऐप के अंदर GGUF मॉडल डाउनलोड करता है और उन्हें एक लाइब्रेरी में प्रबंधित करता है। Phi-3.5, Gemma 3, Llama 3.2 और Qwen 2.5 के लिए प्रीसेट समझदारी भरी शुरुआत परिमाणीकरण प्रदान करते हैं। चैट UI प्रति मॉडल सिस्टम प्रॉम्प्ट, तापमान, top-p और दोहराने की सजा का समर्थन करता है, जो यहां अधिकांश ऐप्स से अधिक नियंत्रण है।
जहां यह कम पड़ता है: पहली बार उपयोगकर्ताओं को यह अनुमानित विचार होना चाहिए कि कौन सा मॉडल चुनना है। कोई इन-ऐप सिफारिश नहीं है।
मूल्य: निःशुल्क, ओपन-सोर्स (MIT)।
प्लेटफॉर्म: Android, iOS।
डाउनलोड: GitHub · Google Play
तल की पंक्ति: यहां शुरू करें। यह सबसे पूर्ण निःशुल्क विकल्प है और एक भुगतान किए गए स्तर को नहीं धकेलता है।
2. MLC Chat, Snapdragon 8 पर सर्वश्रेष्ठ कच्चा गति
MLC Chat अग्रिम रूप से MLC प्रारूप में मॉडल संकलित करता है और उन्हें TVM के माध्यम से चलाता है। Snapdragon 8 Gen 2 फोन पर, MLC की Gemma 2B लगभग दो बार llama.cpp पर GGUF में समान मॉडल की tok/s पर चलती है। मॉडल विकल्प संकीर्ण हैं क्योंकि प्रत्येक मॉडल पूर्व-निर्मित है।
जहां यह कम पड़ता है: एक नया मॉडल जोड़ने के लिए लैपटॉप पर MLC टूलचेन की आवश्यकता होती है। “डाउनलोड और जाओ” वर्कफ़्लो नहीं।
मूल्य: निःशुल्क, Apache लाइसेंस।
प्लेटफॉर्म: Android, iOS।
डाउनलोड: MLC Chat · Google Play
तल की पंक्ति: पिक अगर फोन हाल की फ्लैगशिप है और लक्ष्य सबसे तेजी से संभव डिवाइस प्रतिक्रिया है।
3. Layla, चरित्र चैट और रोलप्ले के लिए सर्वश्रेष्ठ
Layla llama.cpp को चरित्र, वॉयस इनपुट और सामुदायिक व्यक्तित्व की लाइब्रेरी के साथ एक पॉलिश चैट UI में लपेटता है। निःशुल्क स्तर स्थानीय मॉडल डाउनलोड शामिल है; सदस्यता क्लाउड-होस्ट किए गए मॉडल और छवि पीढ़ी जोड़ता है, दोनों ऐच्छिक। क्योंकि ऐप डिफ़ॉल्ट रूप से डिवाइस पर है, चरित्र पुस्तकालय ऑफलाइन काम करता है।
जहां यह कम पड़ता है: RP फोकस डिफ़ॉल्ट प्रॉम्प्ट में दिखाया जाता है। इसे एक सामान्य सहायक में बदलना प्रत्येक सत्र में सिस्टम प्रॉम्प्ट को अधिलेखित करना मतलब है।
मूल्य:
- निःशुल्क स्तर: केवल स्थानीय मॉडल
- Pro: एक मामूली मासिक शुल्क से होस्ट किए गए मॉडल और छवियां जोड़ता है
प्लेटफॉर्म: Android, iOS।
डाउनलोड: Layla
तल की पंक्ति: किसी के लिए जो चैट चाहता है जो उपयोगिता की तुलना में अधिक रचनात्मक झुकता हो।
4. MyDeviceAI, उपकरण के साथ सर्वश्रेष्ठ सहायक
MyDeviceAI एक स्थानीय GGUF मॉडल चलाता है, फिर एक वेब-सर्च चरण जोड़ता है जो स्निपेट पढ़ता है और उन्हें संदर्भ के रूप में मॉडल को वापस कर देता है। यह निजी रहता है क्योंकि सर्च क्वेरी एकमात्र चीज है जो फोन छोड़ता है। यह स्थानीय तर्क के साथ Perplexity-शैली सहायक के सबसे करीब है।
जहां यह कम पड़ता है: वेब-सर्च एकीकरण एक सर्च बैकएंड पर निर्भर करता है जो बदलता है। कभी-कभी टूल कॉल ऑपरेटर को ध्यान देने के लिए हैं।
मूल्य: निःशुल्क, ओपन-सोर्स।
प्लेटफॉर्म: Android।
डाउनलोड: GitHub
तल की पंक्ति: पिक जब सहायक को वर्तमान जानकारी की जरूरत होती है, न कि केवल जो मॉडल वजन में फिट बैठता है।
5. SmolChat, छोटे फोन के लिए सर्वश्रेष्ठ
SmolChat 4 से 6 GB RAM वाले फोन को लक्षित करता है। यह 1B और 1.5B मॉडल (Phi-3-mini, Gemma 2 2B, Llama 3.2 1B) के लिए ट्यून किए गए सेटिंग्स के साथ आता है और बड़े लोगों को खोलने से इनकार करता है। परिणाम एक चैट ऐप है जो दो साल पुराने मिड-रेंज फोन पर प्रतिक्रियाशील रहता है।
जहां यह कम पड़ता है: जानबूझकर सीमित। अगर फोन 3B मॉडल चला सकता है, तो बजाय इसके PocketPal AI का उपयोग करें।
मूल्य: निःशुल्क, ओपन-सोर्स।
प्लेटफॉर्म: Android।
डाउनलोड: GitHub · Google Play
तल की पंक्ति: मिड-रेंज फोन के लिए जो 7B मॉडल पर फ्रीज होंगे।
6. Private AI Chat, सर्वश्रेष्ठ “कोई खाता नहीं, कोई टेलीमेट्री नहीं”
Private AI Chat पशु GGUF मॉडल की एक छोटी सूची दिया जाता है, पहली रन पर उन्हें डाउनलोड करता है, और कभी खाता नहीं मांगता है। चैट इतिहास एक डिवाइस पर डेटाबेस में रहता है। गोपनीयता नीति एक स्क्रीन पर फिट बैठती है क्योंकि ऐप डेटा एकत्र नहीं करता है।
जहां यह कम पड़ता है: कोई क्लाउड फॉलबैक नहीं अगर मॉडल कठिन प्रश्न के लिए पर्याप्त नहीं है। क्यूरेटेड सूची के परे कोई उपयोगकर्ता-जोड़ा मॉडल नहीं।
मूल्य: निःशुल्क।
प्लेटफॉर्म: Android।
डाउनलोड: Google Play
तल की पंक्ति: पिक जब पूरा बिंदु “कोई डेटा फोन नहीं छोड़ता है” और मॉडल चुनना मजेदार हिस्सा नहीं है।
7. Enchanted, सर्वश्रेष्ठ अगर आप पहले से ही होम पर Ollama चलाते हैं
Enchanted होम सर्वर पर चल रहे Ollama के लिए एक फोन क्लाइंट है। यह पूरी तरह से डिवाइस पर नहीं है (मॉडल होम मशीन पर चलता है, जो कंप्यूटिंग को संभालता है), लेकिन चैट LAN पर या Tailscale सुरंग के माध्यम से रहता है। किसी के लिए जिसके पास पहले से ही Ollama की मेजबानी करने वाला शक्तिशाली होम बॉक्स है, यह फोन से 70B मॉडल तक सबसे छोटा रास्ता है।
जहां यह कम पड़ता है: होम Ollama इंस्टेंस की आवश्यकता है। सेलुलर उपयोग सर्वर तक पहुंचने के लिए Tailscale जैसी सुरंग की आवश्यकता है।
मूल्य: निःशुल्क, ओपन-सोर्स।
प्लेटफॉर्म: Android, iOS।
डाउनलोड: GitHub
तल की पंक्ति: पिक जब फोन बहुत बड़े स्थानीय मॉडल के लिए एक पतला क्लाइंट है।
सही चुनने का तरीका
अगर फोन में 8 GB RAM या अधिक है, तो PocketPal AI और एक 3B Q4 मॉडल से शुरू करें। UI सबसे दोस्ताना है और मॉडल पुस्तकालय सबसे व्यापक है।
अगर फोन एक हाल की फ्लैगशिप है और मॉडल पसंद से अधिक गति है, तो MLC Chat पर स्विच करें।
अगर फोन में 4 से 6 GB RAM है, तो 1.5B या 2B मॉडल के साथ SmolChat का उपयोग करें।
अगर लक्ष्य एक निजी सहायक है जो चीजों को देख सकता है, तो MyDeviceAI का उपयोग करें।
अगर दिन रचनात्मक चैट या रोलप्ले में शामिल है, तो Layla का उपयोग करें।
अगर एक शक्तिशाली होम सर्वर पहले से Ollama चला रहा है, तो Enchanted का उपयोग करें और फोन को एक पतला क्लाइंट मानें।
FAQ
कौन से Android फोन 7B मॉडल चला सकते हैं? कम से कम 12 GB RAM वाले फोन (Pixel 9 Pro XL, Galaxy S25 Ultra, OnePlus 13)। एक 7B Q4 मॉडल प्लस OS 12 GB पर अच्छी तरह फिट बैठता है और चलता है। 8 GB पर फोन स्वैप करता है और ऐप मिनटों में क्रैश होता है।
क्या ये ऐप बैटरी को निकालते हैं? हाँ, पीढ़ी के दौरान। आधुनिक SoC पर 20 tok/s पर 3B मॉडल 4 से 6 W खींचता है। दस मिनट की बातचीत लगभग एक प्रतिशत बैटरी है। लंबी पीढ़ी फोन को गर्म करती है।
क्या मैं इन्हें ऑफलाइन उपयोग कर सकता हूं? हाँ, वह बिंदु है। PocketPal AI, MLC Chat, SmolChat, Layla और Private AI Chat मॉडल डाउनलोड होने के बाद पूरी तरह से डिवाइस पर चलते हैं। हवाई जहाज मोड उन्हें प्रभावित नहीं करता है।
क्या मेरा डेटा निजी है? छह डिवाइस पर ऐप्स पर, हाँ। Enchanted अपने स्वयं के Ollama सर्वर को चैट भेजता है। उनमें से कोई भी डिफ़ॉल्ट मोड में तीसरे पक्ष के क्लाउड को प्रॉम्प्ट नहीं भेजता है।
मुझे किस मॉडल से शुरू करना चाहिए? Phi-3.5-mini Q4_K_M पर सबसे सुरक्षित डिफ़ॉल्ट 8 GB पर है। यह सामान्य प्रश्नों का अच्छी तरह उत्तर देता है और लगभग 2.5 GB RAM में फिट बैठता है। Gemma 2 2B या Llama 3.2 3B पर जाएं अगर फोन इसे संभाल सकता है।
क्या ये ChatGPT को प्रतिस्थापित कर सकते हैं? तेजी से सवालों, छोटी पाठ मसौदा और 200 लाइन के तहत कोड स्निपेट के लिए, हाँ। लंबे तर्क, वर्तमान घटनाओं और जटिल कोड के लिए, नहीं। डिवाइस पर निजी, ऑफलाइन परत के रूप में व्यवहार करें, पूरे टूलबॉक्स नहीं।