
XDA ने एक पुरानी फोन को स्थानीय LLM सर्वर में बदल दिया और Gemma 4 को वास्तविक उत्पादकता कार्य के लिए पर्याप्त अच्छी तरह चला गया। यह एक पुरानी Android के लिए एक बहुत अच्छा उपयोग है जो एक ड्रॉअर में बैठी है, और llama.cpp के ARM अनुकूलन के लिए धन्यवाद, एक Snapdragon 8 Gen 1 या नई हो सकती है जो 3B से 7B तक क्वांटाइज्ड मॉडल को होस्ट कर सकती है जो आपके Wi-Fi पर अन्य उपकरणों को जवाब देता है। सात ऐप्स जमीन को संभालते हैं, कुछ चैट क्लाइंट हैं जो OpenAI-संगत API को भी उजागर करते हैं, कुछ टर्मिनल हैं जो आपको llama.cpp या ollama को सीधे चलाने देते हैं।
स्थानीय LLM Android ऐप में क्या देखें
- API सर्वर मोड। “पुराने फोन को LLM सर्वर के रूप में” के लिए, ऐप को HTTP एंडपॉइंट को उजागर करना चाहिए जिसे अन्य उपकरण कॉल कर सकें, आदर्श रूप से OpenAI-संगत।
- मॉडल प्रारूप समर्थन। GGUF llama.cpp के माध्यम से मानक है, MLC का अपना प्रारूप एक और विकल्प है।
- GPU ऑफलोड। Vulkan या OpenCL बैकएंड जो आपकी फोन के Adreno या Mali GPU का उपयोग करता है प्रति सेकंड टोकन को 3x से 5x बदल देता है।
- बैटरी और थर्मल नियंत्रण। निरंतर अनुमान एक फोन को पकाता है। अग्रभूमि सेवा नियंत्रण और थर्मल थ्रॉटलिंग देखें।
- RAM पदचिह्न। 4 से 6 GB RAM वाली पुरानी फोन भी आक्रामक क्वांटीकरण के साथ बड़े मॉडल में फिट नहीं हो सकती।
- पृष्ठभूमि दृढ़ता। ऐप को सस्ते OEMs पर Android की आक्रामक मेमोरी मैनेजर से बचना चाहिए।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ | मुफ़्त | API सर्वर | रेटिंग |
|---|---|---|---|---|
| Termux | टर्मिनल में पूर्ण llama.cpp या ollama | हाँ | हाँ, llama-server के माध्यम से | 4.7 |
| PocketPal AI | GUI चैट सर्वर टॉगल के साथ | हाँ | हाँ, प्रयोगात्मक | 4.5 |
| Layla | पॉलिशड चैट प्लस रोल-प्ले | हाँ | Trial Pro API | 4.4 |
| MLC Chat | MLC-अनुकूलित मॉडल | हाँ | स्थिर में केवल स्थानीय | 4.3 |
| ChatterUI | SillyTavern जैसा इंटरफ़ेस | हाँ | हाँ, बिल्ट-इन सर्वर के माध्यम से | 4.4 |
| SmolChat | न्यूनतम चैट क्लाइंट | हाँ | नहीं | 4.3 |
| llama.cpp Android | संदर्भ निर्माण | हाँ | हाँ, llama-server के माध्यम से | 4.5 |
सात ऐप्स
1. Termux, सर्वश्रेष्ठ पूर्ण llama.cpp या टर्मिनल में ollama
Termux Linux-in-your-pocket टूलकिट है जो आपको llama.cpp या ollama को सीधे बनाने और चलाने देता है। pkg install cmake python git, llama.cpp को क्लोन करें, LLAMA_VULKAN=1 के साथ संकलित करें और llama-server को अपने LAN IP से जुड़ा शुरू करें। पुरानी फोन अब Wi-Fi पर किसी भी डिवाइस के लिए OpenAI-संगत API परोसती है।
जहां यह कम पड़ता है: टर्मिनल से डरने वाले के लिए नहीं। पहले सेटअप में पैकेज प्रबंधन का एक घंटा लगता है।
मूल्य निर्धारण:
- मुफ़्त: पूर्ण टूलकिट
- भुगतान: कोई नहीं
प्लेटफॉर्म: Android
डाउनलोड करें: F-Droid · Aptoide
स्थानीय LLM होस्टिंग के लिए Termux लचीलेपन में जीतता है। जो कुछ भी llama.cpp समर्थन करता है, Termux समर्थन करता है।
निचली लाइन: पाठकों के लिए पिक जो टर्मिनल में आरामदायक हैं। इस सूची में किसी भी GUI से छत बहुत अधिक है।
2. PocketPal AI, सर्वश्रेष्ठ GUI सर्वर टॉगल के साथ
PocketPal AI एक खुला स्रोत Android चैट क्लाइंट है जो Hugging Face से GGUF मॉडल लोड करता है और उन्हें डिवाइस पर चलाता है। हाल ही के निर्माण एक प्रायोगिक सर्वर टॉगल जोड़ते हैं जो OpenAI-संगत एंडपॉइंट के माध्यम से आपके LAN पर एक ही मॉडल को उजागर करता है।
जहां यह कम पड़ता है: सर्वर टॉगल अभी भी प्रायोगिक के रूप में चिह्नित है और TLS की कमी है।
मूल्य निर्धारण:
- मुफ़्त: MIT के तहत खुला स्रोत
- भुगतान: कोई नहीं
प्लेटफॉर्म: Android, iOS
डाउनलोड करें: Google Play · F-Droid
स्थानीय LLM होस्टिंग के लिए PocketPal AI GUI सरलता में जीतता है। Hugging Face से एक मॉडल चुनें, लोड को टैप करें, बातचीत शुरू करें।
निचली लाइन: पाठकों के लिए पिक जो पहले GUI चाहते हैं और दूसरा API चाहते हैं।
3. Layla, सर्वश्रेष्ठ पॉलिशड चैट प्लस रोल-प्ले
Layla एक भुगतान-अनुकूल Android चैट क्लाइंट है जो क्वांटाइज्ड मॉडल को डिवाइस पर एक चिकनी UI के साथ चलाता है। चरित्र रोल-प्ले, स्थायी मेमोरी और वॉयस मोड शामिल हैं। Pro स्तर एक API सर्वर मोड जोड़ता है जो लोड किए गए मॉडल को उजागर करता है।
जहां यह कम पड़ता है: मुफ़्त स्तर संदर्भ लंबाई को सीमित करता है। चरित्र सुविधाएँ UI जटिलता जोड़ती हैं।
मूल्य निर्धारण:
- मुफ़्त: बुनियादी चैट
- भुगतान: विस्तारित संदर्भ और API मोड के लिए Pro सदस्यता
प्लेटफॉर्म: Android
डाउनलोड करें: Google Play
स्थानीय LLM होस्टिंग के लिए Layla चैट पॉलिश और रोल-प्ले टूलिंग में जीतता है।
निचली लाइन: पाठकों के लिए पिक जो चैट-केंद्रित UI चाहते हैं, dev टूल नहीं।
4. MLC Chat, सर्वश्रेष्ठ MLC-अनुकूलित मॉडल
MLC Chat MLC टीम द्वारा Qualcomm Adreno और MediaTek GPUs के लिए ट्यून किए गए प्री-कंपाइल मॉडल के साथ आता है। प्रति सेकंड टोकन इस सूची में सर्वश्रेष्ठ हैं फोन के लिए जो ऐप आधिकारिक रूप से समर्थन करता है, llama.cpp की तुलना में एक छोटे मॉडल पुस्तकालय की कीमत पर।
जहां यह कम पड़ता है: API सर्वर मोड रोडमैप पर है, अभी तक स्थिर रिलीज़ में नहीं।
मूल्य निर्धारण:
- मुफ़्त: खुला स्रोत
- भुगतान: कोई नहीं
प्लेटफॉर्म: Android, iOS
डाउनलोड करें: GitHub · Aptoide
स्थानीय LLM होस्टिंग के लिए MLC Chat कच्ची अनुमान गति में जीतता है जब आपकी फोन समर्थित सूची पर हो।
निचली लाइन: पाठकों के लिए पिक जिनका डिवाइस MLC की समर्थित सूची पर है और स्थानीय रूप से अधिकतम टोकन प्रति सेकंड चाहते हैं।
5. ChatterUI, सर्वश्रेष्ठ SillyTavern जैसा इंटरफ़ेस
ChatterUI एक Android चैट क्लाइंट है जो SillyTavern पर मॉडल किया गया है। चरित्र कार्ड, चैट शाखाएं और एक बिल्ट-इन सर्वर जो आपके LAN पर अन्य डिवाइस OpenAI-संगत एंडपॉइंट के रूप में हिट कर सकते हैं।
जहां यह कम पड़ता है: चरित्र कार्ड प्रारूप बिंदु है, लेकिन यह सीधे Q&A के लिए ChatterUI को PocketPal की तुलना में भारी बनाता है।
मूल्य निर्धारण:
- मुफ़्त: खुला स्रोत
- भुगतान: कोई नहीं
प्लेटफॉर्म: Android
डाउनलोड करें: GitHub
स्थानीय LLM होस्टिंग के लिए ChatterUI जीतता है यदि आपका मौजूदा चैट स्टैक SillyTavern के आकार का हो।
निचली लाइन: पाठकों के लिए पिक जो पहले से ही SillyTavern का उपयोग करते हैं।
6. SmolChat, सर्वश्रेष्ठ न्यूनतम चैट क्लाइंट
SmolChat llama.cpp GGUF मॉडल के लिए एक minimalist Android क्लाइंट है। यह API परोसता नहीं है, लेकिन इसका पदचिह्न पुरानी फोन के साथ 4 GB RAM के साथ एक क्वांटाइज्ड 3B मॉडल में फिट करने के लिए काफी छोटा है।
जहां यह कम पड़ता है: स्थानीय चैट केवल, कोई सर्वर मोड नहीं।
मूल्य निर्धारण:
- मुफ़्त: खुला स्रोत
- भुगतान: कोई नहीं
प्लेटफॉर्म: Android
डाउनलोड करें: GitHub
स्थानीय LLM होस्टिंग के लिए SmolChat 4 GB डिवाइस के लिए सबसे हल्का विकल्प के रूप में जीतता है।
निचली लाइन: जब लक्ष्य फोन वास्तव में पुरानी है और RAM-विवश हो तो पिक करें।
7. llama.cpp Android, सर्वश्रेष्ठ संदर्भ निर्माण
llama.cpp Android ggerganov से आधिकारिक संदर्भ निर्माण है। किसी भी दुकान में नहीं, आप GitHub रिलीज़ से APK को साइडलोड करते हैं। llama-server को सीधे Linux पर उपयोग करने वाले ध्वजों के साथ चलाता है।
जहां यह कम पड़ता है: शून्य UI पॉलिश, और आपको शुरू करने से पहले llama.cpp के ध्वजों को जानना चाहिए।
मूल्य निर्धारण:
- मुफ़्त: MIT के तहत खुला स्रोत
- भुगतान: कोई नहीं
प्लेटफॉर्म: Android
डाउनलोड करें: GitHub
स्थानीय LLM होस्टिंग के लिए llama.cpp Android संदर्भ कार्यान्वयन के रूप में जीतता है।
निचली लाइन: पाठकों के लिए पिक जो Android पर एक लैपटॉप पर चलाते हैं, एक ही उपकरण चाहते हैं।
सही को कैसे चुनें
- टर्मिनल में आरामदायक, अधिकतम लचीलेपन चाहते हैं: Termux
- GUI प्लस API टॉगल चाहते हैं: PocketPal AI
- चैट पॉलिश रोल-प्ले के साथ चाहते हैं: Layla
- फोन MLC की समर्थित सूची पर है और अधिकतम गति चाहते हैं: MLC Chat
- पहले से ही SillyTavern चलाएं: ChatterUI
- फोन में केवल 4 GB RAM है: SmolChat
- संदर्भ llama.cpp निर्माण चाहते हैं: llama.cpp Android
FAQ
क्या एक पुरानी Android फोन वाकई एक LLM चला सकती है?
हाँ, Snapdragon 855 और बाद में, 6 GB या अधिक RAM के साथ। पुरानी हार्डवेयर पर क्वांटाइज्ड 3B मॉडल पर 3 से 5 टोकन प्रति सेकंड की अपेक्षा करें, और नई फोन पर 10 से 20 टोकन प्रति सेकंड।
कौन सा मॉडल Android पर सर्वश्रेष्ठ चलता है?
Gemma 2B, Phi-3 Mini, Llama 3.2 3B, और Qwen 2.5 3B सभी Q4_K_M क्वांटीकरण में आरामदायक फिट। Gemma 4 8 GB या अधिक RAM के साथ नई फोन पर चलता है।
क्या मैं अपनी फोन को अपने लैपटॉप के लिए LLM API सर्वर के रूप में उपयोग कर सकता हूं?
हाँ। Termux चल रहा है llama-server अपने LAN IP से जुड़ा काम करता है। अपने लैपटॉप की चैट क्लाइंट को OpenAI-संगत एंडपॉइंट के लिए http://<phone-ip>:8080/v1 पर इंगित करें।
क्या LLM चलाना मेरी फोन की बैटरी को मार देगा?
निरंतर अनुमान तेजी से नाली, दीवार की शक्ति की योजना बनाएँ। यह भी उम्मीद है कि फोन गर्म हो जाए, वायु प्रवाह के लिए इसे ऊंचा करें।
क्या llama.cpp मुफ़्त है?
हाँ, MIT लाइसेंस प्राप्त। इस सूची में प्रत्येक ऐप जो इसका उपयोग करता है वह या तो खुला स्रोत है या मुफ़्त llama.cpp आधार के ऊपर भुगतान किया जाता है।