Termux और Android पर स्थानीय LLM चलाने के लिए अन्य उपकरण

XDA ने एक पुरानी फोन को स्थानीय LLM सर्वर में बदल दिया और Gemma 4 को वास्तविक उत्पादकता कार्य के लिए पर्याप्त अच्छी तरह चला गया। यह एक पुरानी Android के लिए एक बहुत अच्छा उपयोग है जो एक ड्रॉअर में बैठी है, और llama.cpp के ARM अनुकूलन के लिए धन्यवाद, एक Snapdragon 8 Gen 1 या नई हो सकती है जो 3B से 7B तक क्वांटाइज्ड मॉडल को होस्ट कर सकती है जो आपके Wi-Fi पर अन्य उपकरणों को जवाब देता है। सात ऐप्स जमीन को संभालते हैं, कुछ चैट क्लाइंट हैं जो OpenAI-संगत API को भी उजागर करते हैं, कुछ टर्मिनल हैं जो आपको llama.cpp या ollama को सीधे चलाने देते हैं।

स्थानीय LLM Android ऐप में क्या देखें

त्वरित तुलना

ऐप सर्वश्रेष्ठ मुफ़्त API सर्वर रेटिंग
Termux टर्मिनल में पूर्ण llama.cpp या ollama हाँ हाँ, llama-server के माध्यम से 4.7
PocketPal AI GUI चैट सर्वर टॉगल के साथ हाँ हाँ, प्रयोगात्मक 4.5
Layla पॉलिशड चैट प्लस रोल-प्ले हाँ Trial Pro API 4.4
MLC Chat MLC-अनुकूलित मॉडल हाँ स्थिर में केवल स्थानीय 4.3
ChatterUI SillyTavern जैसा इंटरफ़ेस हाँ हाँ, बिल्ट-इन सर्वर के माध्यम से 4.4
SmolChat न्यूनतम चैट क्लाइंट हाँ नहीं 4.3
llama.cpp Android संदर्भ निर्माण हाँ हाँ, llama-server के माध्यम से 4.5

सात ऐप्स

1. Termux, सर्वश्रेष्ठ पूर्ण llama.cpp या टर्मिनल में ollama

Termux Linux-in-your-pocket टूलकिट है जो आपको llama.cpp या ollama को सीधे बनाने और चलाने देता है। pkg install cmake python git, llama.cpp को क्लोन करें, LLAMA_VULKAN=1 के साथ संकलित करें और llama-server को अपने LAN IP से जुड़ा शुरू करें। पुरानी फोन अब Wi-Fi पर किसी भी डिवाइस के लिए OpenAI-संगत API परोसती है।

जहां यह कम पड़ता है: टर्मिनल से डरने वाले के लिए नहीं। पहले सेटअप में पैकेज प्रबंधन का एक घंटा लगता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Android

डाउनलोड करें: F-Droid · Aptoide

स्थानीय LLM होस्टिंग के लिए Termux लचीलेपन में जीतता है। जो कुछ भी llama.cpp समर्थन करता है, Termux समर्थन करता है।

निचली लाइन: पाठकों के लिए पिक जो टर्मिनल में आरामदायक हैं। इस सूची में किसी भी GUI से छत बहुत अधिक है।

2. PocketPal AI, सर्वश्रेष्ठ GUI सर्वर टॉगल के साथ

PocketPal AI एक खुला स्रोत Android चैट क्लाइंट है जो Hugging Face से GGUF मॉडल लोड करता है और उन्हें डिवाइस पर चलाता है। हाल ही के निर्माण एक प्रायोगिक सर्वर टॉगल जोड़ते हैं जो OpenAI-संगत एंडपॉइंट के माध्यम से आपके LAN पर एक ही मॉडल को उजागर करता है।

जहां यह कम पड़ता है: सर्वर टॉगल अभी भी प्रायोगिक के रूप में चिह्नित है और TLS की कमी है।

मूल्य निर्धारण:

प्लेटफॉर्म: Android, iOS

डाउनलोड करें: Google Play · F-Droid

स्थानीय LLM होस्टिंग के लिए PocketPal AI GUI सरलता में जीतता है। Hugging Face से एक मॉडल चुनें, लोड को टैप करें, बातचीत शुरू करें।

निचली लाइन: पाठकों के लिए पिक जो पहले GUI चाहते हैं और दूसरा API चाहते हैं।

3. Layla, सर्वश्रेष्ठ पॉलिशड चैट प्लस रोल-प्ले

Layla एक भुगतान-अनुकूल Android चैट क्लाइंट है जो क्वांटाइज्ड मॉडल को डिवाइस पर एक चिकनी UI के साथ चलाता है। चरित्र रोल-प्ले, स्थायी मेमोरी और वॉयस मोड शामिल हैं। Pro स्तर एक API सर्वर मोड जोड़ता है जो लोड किए गए मॉडल को उजागर करता है।

जहां यह कम पड़ता है: मुफ़्त स्तर संदर्भ लंबाई को सीमित करता है। चरित्र सुविधाएँ UI जटिलता जोड़ती हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Android

डाउनलोड करें: Google Play

स्थानीय LLM होस्टिंग के लिए Layla चैट पॉलिश और रोल-प्ले टूलिंग में जीतता है।

निचली लाइन: पाठकों के लिए पिक जो चैट-केंद्रित UI चाहते हैं, dev टूल नहीं।

4. MLC Chat, सर्वश्रेष्ठ MLC-अनुकूलित मॉडल

MLC Chat MLC टीम द्वारा Qualcomm Adreno और MediaTek GPUs के लिए ट्यून किए गए प्री-कंपाइल मॉडल के साथ आता है। प्रति सेकंड टोकन इस सूची में सर्वश्रेष्ठ हैं फोन के लिए जो ऐप आधिकारिक रूप से समर्थन करता है, llama.cpp की तुलना में एक छोटे मॉडल पुस्तकालय की कीमत पर।

जहां यह कम पड़ता है: API सर्वर मोड रोडमैप पर है, अभी तक स्थिर रिलीज़ में नहीं।

मूल्य निर्धारण:

प्लेटफॉर्म: Android, iOS

डाउनलोड करें: GitHub · Aptoide

स्थानीय LLM होस्टिंग के लिए MLC Chat कच्ची अनुमान गति में जीतता है जब आपकी फोन समर्थित सूची पर हो।

निचली लाइन: पाठकों के लिए पिक जिनका डिवाइस MLC की समर्थित सूची पर है और स्थानीय रूप से अधिकतम टोकन प्रति सेकंड चाहते हैं।

5. ChatterUI, सर्वश्रेष्ठ SillyTavern जैसा इंटरफ़ेस

ChatterUI एक Android चैट क्लाइंट है जो SillyTavern पर मॉडल किया गया है। चरित्र कार्ड, चैट शाखाएं और एक बिल्ट-इन सर्वर जो आपके LAN पर अन्य डिवाइस OpenAI-संगत एंडपॉइंट के रूप में हिट कर सकते हैं।

जहां यह कम पड़ता है: चरित्र कार्ड प्रारूप बिंदु है, लेकिन यह सीधे Q&A के लिए ChatterUI को PocketPal की तुलना में भारी बनाता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Android

डाउनलोड करें: GitHub

स्थानीय LLM होस्टिंग के लिए ChatterUI जीतता है यदि आपका मौजूदा चैट स्टैक SillyTavern के आकार का हो।

निचली लाइन: पाठकों के लिए पिक जो पहले से ही SillyTavern का उपयोग करते हैं।

6. SmolChat, सर्वश्रेष्ठ न्यूनतम चैट क्लाइंट

SmolChat llama.cpp GGUF मॉडल के लिए एक minimalist Android क्लाइंट है। यह API परोसता नहीं है, लेकिन इसका पदचिह्न पुरानी फोन के साथ 4 GB RAM के साथ एक क्वांटाइज्ड 3B मॉडल में फिट करने के लिए काफी छोटा है।

जहां यह कम पड़ता है: स्थानीय चैट केवल, कोई सर्वर मोड नहीं।

मूल्य निर्धारण:

प्लेटफॉर्म: Android

डाउनलोड करें: GitHub

स्थानीय LLM होस्टिंग के लिए SmolChat 4 GB डिवाइस के लिए सबसे हल्का विकल्प के रूप में जीतता है।

निचली लाइन: जब लक्ष्य फोन वास्तव में पुरानी है और RAM-विवश हो तो पिक करें।

7. llama.cpp Android, सर्वश्रेष्ठ संदर्भ निर्माण

llama.cpp Android ggerganov से आधिकारिक संदर्भ निर्माण है। किसी भी दुकान में नहीं, आप GitHub रिलीज़ से APK को साइडलोड करते हैं। llama-server को सीधे Linux पर उपयोग करने वाले ध्वजों के साथ चलाता है।

जहां यह कम पड़ता है: शून्य UI पॉलिश, और आपको शुरू करने से पहले llama.cpp के ध्वजों को जानना चाहिए।

मूल्य निर्धारण:

प्लेटफॉर्म: Android

डाउनलोड करें: GitHub

स्थानीय LLM होस्टिंग के लिए llama.cpp Android संदर्भ कार्यान्वयन के रूप में जीतता है।

निचली लाइन: पाठकों के लिए पिक जो Android पर एक लैपटॉप पर चलाते हैं, एक ही उपकरण चाहते हैं।

सही को कैसे चुनें

FAQ

क्या एक पुरानी Android फोन वाकई एक LLM चला सकती है?

हाँ, Snapdragon 855 और बाद में, 6 GB या अधिक RAM के साथ। पुरानी हार्डवेयर पर क्वांटाइज्ड 3B मॉडल पर 3 से 5 टोकन प्रति सेकंड की अपेक्षा करें, और नई फोन पर 10 से 20 टोकन प्रति सेकंड।

कौन सा मॉडल Android पर सर्वश्रेष्ठ चलता है?

Gemma 2B, Phi-3 Mini, Llama 3.2 3B, और Qwen 2.5 3B सभी Q4_K_M क्वांटीकरण में आरामदायक फिट। Gemma 4 8 GB या अधिक RAM के साथ नई फोन पर चलता है।

क्या मैं अपनी फोन को अपने लैपटॉप के लिए LLM API सर्वर के रूप में उपयोग कर सकता हूं?

हाँ। Termux चल रहा है llama-server अपने LAN IP से जुड़ा काम करता है। अपने लैपटॉप की चैट क्लाइंट को OpenAI-संगत एंडपॉइंट के लिए http://<phone-ip>:8080/v1 पर इंगित करें।

क्या LLM चलाना मेरी फोन की बैटरी को मार देगा?

निरंतर अनुमान तेजी से नाली, दीवार की शक्ति की योजना बनाएँ। यह भी उम्मीद है कि फोन गर्म हो जाए, वायु प्रवाह के लिए इसे ऊंचा करें।

क्या llama.cpp मुफ़्त है?

हाँ, MIT लाइसेंस प्राप्त। इस सूची में प्रत्येक ऐप जो इसका उपयोग करता है वह या तो खुला स्रोत है या मुफ़्त llama.cpp आधार के ऊपर भुगतान किया जाता है।