Android पर डिवाइस पर LLM चलाने के लिए सर्वश्रेष्ठ ऐप्स

8 GB RAM वाला एक आधुनिक Android फोन कुछ सेकंड में 3B मॉडल को मेमोरी में रख सकता है और प्रश्नों का उत्तर दे सकता है, ऑफलाइन। यह बिंदु GPT या Claude को कठिन समस्याओं के लिए प्रतिस्थापित करना नहीं है। यह बिंदु एक निजी, नेटवर्क-रहित चैट है जो उड़ान, सीमा पार करने या खराब होटल Wi-Fi को सहन करता है। Android पर डिवाइस पर LLM चलाने के लिए सर्वश्रेष्ठ ऐप्स तीन तरीकों से भिन्न होते हैं: वे कौन सी परिमाणित मॉडल प्रारूप लोड करते हैं, स्थिर रहने के लिए उन्हें कितने RAM की आवश्यकता है, और छोटी स्क्रीन पर चैट इंटरफेस कितना उपयोग करने योग्य है। हमने सात को एक महीने की दैनिक उपयोग के माध्यम से रखा।

डिवाइस पर LLM ऐप में क्या देखें

छह चीजें एक चैट ऐप को अलग करती हैं जो स्थापित रहता है उससे जो एक सप्ताह में अनइंस्टॉल हो जाता है:

त्वरित तुलना

ऐप सर्वश्रेष्ठ के लिए मॉडल प्रारूप निःशुल्क स्तर उल्लेखनीय
PocketPal AI सामान्य डिवाइस पर चैट GGUF निःशुल्क, ओपन-सोर्स GGUF मॉडल के लिए सर्वश्रेष्ठ डाउनलोड UX
MLC Chat Snapdragon 8 पर गति MLC निःशुल्क, ओपन-सोर्स यहां सब कुछ में सबसे तेज़ tok/s
Layla चरित्र चैट और रोलप्ले GGUF निःशुल्क स्तर, सदस्यता पॉलिश्ड UI, चरित्र पुस्तकालय
MyDeviceAI उपकरण के साथ सहायक GGUF, ONNX निःशुल्क, ओपन-सोर्स वेब-सर्च ग्राउंडिंग, डिवाइस पर रहता है
SmolChat छोटे फोन (4 से 6 GB) GGUF (small) निःशुल्क, ओपन-सोर्स 1B और 1.5B मॉडल को स्वच्छ रूप से चलाता है
Private AI Chat कोई खाता नहीं, कोई टेलीमेट्री नहीं GGUF निःशुल्क क्यूरेटेड मॉडल सूची के साथ दिया गया है
Enchanted होम सर्वर पर Ollama Ollama को रिमोट निःशुल्क, ओपन-सोर्स सर्वश्रेष्ठ जब फोन होम LLM से बात करता है

ऐप्स

1. PocketPal AI, सर्वश्रेष्ठ सामान्य डिवाइस पर चैट

PocketPal AI Hugging Face से ऐप के अंदर GGUF मॉडल डाउनलोड करता है और उन्हें एक लाइब्रेरी में प्रबंधित करता है। Phi-3.5, Gemma 3, Llama 3.2 और Qwen 2.5 के लिए प्रीसेट समझदारी भरी शुरुआत परिमाणीकरण प्रदान करते हैं। चैट UI प्रति मॉडल सिस्टम प्रॉम्प्ट, तापमान, top-p और दोहराने की सजा का समर्थन करता है, जो यहां अधिकांश ऐप्स से अधिक नियंत्रण है।

जहां यह कम पड़ता है: पहली बार उपयोगकर्ताओं को यह अनुमानित विचार होना चाहिए कि कौन सा मॉडल चुनना है। कोई इन-ऐप सिफारिश नहीं है।

मूल्य: निःशुल्क, ओपन-सोर्स (MIT)।

प्लेटफॉर्म: Android, iOS।

डाउनलोड: GitHub · Google Play

तल की पंक्ति: यहां शुरू करें। यह सबसे पूर्ण निःशुल्क विकल्प है और एक भुगतान किए गए स्तर को नहीं धकेलता है।

2. MLC Chat, Snapdragon 8 पर सर्वश्रेष्ठ कच्चा गति

MLC Chat अग्रिम रूप से MLC प्रारूप में मॉडल संकलित करता है और उन्हें TVM के माध्यम से चलाता है। Snapdragon 8 Gen 2 फोन पर, MLC की Gemma 2B लगभग दो बार llama.cpp पर GGUF में समान मॉडल की tok/s पर चलती है। मॉडल विकल्प संकीर्ण हैं क्योंकि प्रत्येक मॉडल पूर्व-निर्मित है।

जहां यह कम पड़ता है: एक नया मॉडल जोड़ने के लिए लैपटॉप पर MLC टूलचेन की आवश्यकता होती है। “डाउनलोड और जाओ” वर्कफ़्लो नहीं।

मूल्य: निःशुल्क, Apache लाइसेंस।

प्लेटफॉर्म: Android, iOS।

डाउनलोड: MLC Chat · Google Play

तल की पंक्ति: पिक अगर फोन हाल की फ्लैगशिप है और लक्ष्य सबसे तेजी से संभव डिवाइस प्रतिक्रिया है।

3. Layla, चरित्र चैट और रोलप्ले के लिए सर्वश्रेष्ठ

Layla llama.cpp को चरित्र, वॉयस इनपुट और सामुदायिक व्यक्तित्व की लाइब्रेरी के साथ एक पॉलिश चैट UI में लपेटता है। निःशुल्क स्तर स्थानीय मॉडल डाउनलोड शामिल है; सदस्यता क्लाउड-होस्ट किए गए मॉडल और छवि पीढ़ी जोड़ता है, दोनों ऐच्छिक। क्योंकि ऐप डिफ़ॉल्ट रूप से डिवाइस पर है, चरित्र पुस्तकालय ऑफलाइन काम करता है।

जहां यह कम पड़ता है: RP फोकस डिफ़ॉल्ट प्रॉम्प्ट में दिखाया जाता है। इसे एक सामान्य सहायक में बदलना प्रत्येक सत्र में सिस्टम प्रॉम्प्ट को अधिलेखित करना मतलब है।

मूल्य:

प्लेटफॉर्म: Android, iOS।

डाउनलोड: Layla

तल की पंक्ति: किसी के लिए जो चैट चाहता है जो उपयोगिता की तुलना में अधिक रचनात्मक झुकता हो।

4. MyDeviceAI, उपकरण के साथ सर्वश्रेष्ठ सहायक

MyDeviceAI एक स्थानीय GGUF मॉडल चलाता है, फिर एक वेब-सर्च चरण जोड़ता है जो स्निपेट पढ़ता है और उन्हें संदर्भ के रूप में मॉडल को वापस कर देता है। यह निजी रहता है क्योंकि सर्च क्वेरी एकमात्र चीज है जो फोन छोड़ता है। यह स्थानीय तर्क के साथ Perplexity-शैली सहायक के सबसे करीब है।

जहां यह कम पड़ता है: वेब-सर्च एकीकरण एक सर्च बैकएंड पर निर्भर करता है जो बदलता है। कभी-कभी टूल कॉल ऑपरेटर को ध्यान देने के लिए हैं।

मूल्य: निःशुल्क, ओपन-सोर्स।

प्लेटफॉर्म: Android।

डाउनलोड: GitHub

तल की पंक्ति: पिक जब सहायक को वर्तमान जानकारी की जरूरत होती है, न कि केवल जो मॉडल वजन में फिट बैठता है।

5. SmolChat, छोटे फोन के लिए सर्वश्रेष्ठ

SmolChat 4 से 6 GB RAM वाले फोन को लक्षित करता है। यह 1B और 1.5B मॉडल (Phi-3-mini, Gemma 2 2B, Llama 3.2 1B) के लिए ट्यून किए गए सेटिंग्स के साथ आता है और बड़े लोगों को खोलने से इनकार करता है। परिणाम एक चैट ऐप है जो दो साल पुराने मिड-रेंज फोन पर प्रतिक्रियाशील रहता है।

जहां यह कम पड़ता है: जानबूझकर सीमित। अगर फोन 3B मॉडल चला सकता है, तो बजाय इसके PocketPal AI का उपयोग करें।

मूल्य: निःशुल्क, ओपन-सोर्स।

प्लेटफॉर्म: Android।

डाउनलोड: GitHub · Google Play

तल की पंक्ति: मिड-रेंज फोन के लिए जो 7B मॉडल पर फ्रीज होंगे।

6. Private AI Chat, सर्वश्रेष्ठ “कोई खाता नहीं, कोई टेलीमेट्री नहीं”

Private AI Chat पशु GGUF मॉडल की एक छोटी सूची दिया जाता है, पहली रन पर उन्हें डाउनलोड करता है, और कभी खाता नहीं मांगता है। चैट इतिहास एक डिवाइस पर डेटाबेस में रहता है। गोपनीयता नीति एक स्क्रीन पर फिट बैठती है क्योंकि ऐप डेटा एकत्र नहीं करता है।

जहां यह कम पड़ता है: कोई क्लाउड फॉलबैक नहीं अगर मॉडल कठिन प्रश्न के लिए पर्याप्त नहीं है। क्यूरेटेड सूची के परे कोई उपयोगकर्ता-जोड़ा मॉडल नहीं।

मूल्य: निःशुल्क।

प्लेटफॉर्म: Android।

डाउनलोड: Google Play

तल की पंक्ति: पिक जब पूरा बिंदु “कोई डेटा फोन नहीं छोड़ता है” और मॉडल चुनना मजेदार हिस्सा नहीं है।

7. Enchanted, सर्वश्रेष्ठ अगर आप पहले से ही होम पर Ollama चलाते हैं

Enchanted होम सर्वर पर चल रहे Ollama के लिए एक फोन क्लाइंट है। यह पूरी तरह से डिवाइस पर नहीं है (मॉडल होम मशीन पर चलता है, जो कंप्यूटिंग को संभालता है), लेकिन चैट LAN पर या Tailscale सुरंग के माध्यम से रहता है। किसी के लिए जिसके पास पहले से ही Ollama की मेजबानी करने वाला शक्तिशाली होम बॉक्स है, यह फोन से 70B मॉडल तक सबसे छोटा रास्ता है।

जहां यह कम पड़ता है: होम Ollama इंस्टेंस की आवश्यकता है। सेलुलर उपयोग सर्वर तक पहुंचने के लिए Tailscale जैसी सुरंग की आवश्यकता है।

मूल्य: निःशुल्क, ओपन-सोर्स।

प्लेटफॉर्म: Android, iOS।

डाउनलोड: GitHub

तल की पंक्ति: पिक जब फोन बहुत बड़े स्थानीय मॉडल के लिए एक पतला क्लाइंट है।

सही चुनने का तरीका

अगर फोन में 8 GB RAM या अधिक है, तो PocketPal AI और एक 3B Q4 मॉडल से शुरू करें। UI सबसे दोस्ताना है और मॉडल पुस्तकालय सबसे व्यापक है।

अगर फोन एक हाल की फ्लैगशिप है और मॉडल पसंद से अधिक गति है, तो MLC Chat पर स्विच करें।

अगर फोन में 4 से 6 GB RAM है, तो 1.5B या 2B मॉडल के साथ SmolChat का उपयोग करें।

अगर लक्ष्य एक निजी सहायक है जो चीजों को देख सकता है, तो MyDeviceAI का उपयोग करें।

अगर दिन रचनात्मक चैट या रोलप्ले में शामिल है, तो Layla का उपयोग करें।

अगर एक शक्तिशाली होम सर्वर पहले से Ollama चला रहा है, तो Enchanted का उपयोग करें और फोन को एक पतला क्लाइंट मानें।

FAQ

कौन से Android फोन 7B मॉडल चला सकते हैं? कम से कम 12 GB RAM वाले फोन (Pixel 9 Pro XL, Galaxy S25 Ultra, OnePlus 13)। एक 7B Q4 मॉडल प्लस OS 12 GB पर अच्छी तरह फिट बैठता है और चलता है। 8 GB पर फोन स्वैप करता है और ऐप मिनटों में क्रैश होता है।

क्या ये ऐप बैटरी को निकालते हैं? हाँ, पीढ़ी के दौरान। आधुनिक SoC पर 20 tok/s पर 3B मॉडल 4 से 6 W खींचता है। दस मिनट की बातचीत लगभग एक प्रतिशत बैटरी है। लंबी पीढ़ी फोन को गर्म करती है।

क्या मैं इन्हें ऑफलाइन उपयोग कर सकता हूं? हाँ, वह बिंदु है। PocketPal AI, MLC Chat, SmolChat, Layla और Private AI Chat मॉडल डाउनलोड होने के बाद पूरी तरह से डिवाइस पर चलते हैं। हवाई जहाज मोड उन्हें प्रभावित नहीं करता है।

क्या मेरा डेटा निजी है? छह डिवाइस पर ऐप्स पर, हाँ। Enchanted अपने स्वयं के Ollama सर्वर को चैट भेजता है। उनमें से कोई भी डिफ़ॉल्ट मोड में तीसरे पक्ष के क्लाउड को प्रॉम्प्ट नहीं भेजता है।

मुझे किस मॉडल से शुरू करना चाहिए? Phi-3.5-mini Q4_K_M पर सबसे सुरक्षित डिफ़ॉल्ट 8 GB पर है। यह सामान्य प्रश्नों का अच्छी तरह उत्तर देता है और लगभग 2.5 GB RAM में फिट बैठता है। Gemma 2 2B या Llama 3.2 3B पर जाएं अगर फोन इसे संभाल सकता है।

क्या ये ChatGPT को प्रतिस्थापित कर सकते हैं? तेजी से सवालों, छोटी पाठ मसौदा और 200 लाइन के तहत कोड स्निपेट के लिए, हाँ। लंबे तर्क, वर्तमान घटनाओं और जटिल कोड के लिए, नहीं। डिवाइस पर निजी, ऑफलाइन परत के रूप में व्यवहार करें, पूरे टूलबॉक्स नहीं।