XDA ने एक सप्ताह तक सामान्य लैपटॉप पर चलने योग्य हर छोटे भाषा मॉडल का परीक्षण किया और तीन विजेता मिले। यह कहानी उसी हफ्ते आई जब Qwen 3, Llama 3.2 और Gemma 3 ने 1B–8B क्वांट को रिलीज़ किया जो अपने वजन से कहीं अधिक कार्य कर रहे हैं। डेस्कटॉप पर छोटे स्थानीय LLM के लिए सर्वश्रेष्ठ ऐप्स अब शोध खिलौने नहीं हैं। ये 4 GB RAM में फिट होते हैं, अलग-अलग GPU के बिना चलते हैं, और रोज़मर्रा के सवालों का जवाब इतनी तेजी से देते हैं कि ChatGPT टैब की जगह ले सकते हैं जिसे आप खुला रखते हैं।
हमने M2 MacBook Air (16 GB), मध्य-श्रेणी Ryzen लैपटॉप (केवल iGPU) और 6 GB NVIDIA कार्ड वाली Fedora वर्कस्टेशन पर आठ ऐप्स का परीक्षण किया। प्रत्येक को इस आधार पर मापा गया कि ताज़ा स्थापन 3B क्वांट को कितनी तेजी से खींच सकता है, चैट, कोड और छोटे दस्तावेज़ सारांशों के मिश्रित कार्यभार को कितनी अच्छी तरह संभाल सकता है, और क्या यह पृष्ठभूमि में वीडियो कॉल के दौरान उपयोगी रहता है।
छोटे स्थानीय LLM ऐप में क्या देखें
- छोटे मॉडल कैटलॉग। Llama 3.2 (1B/3B), Qwen 3 (0.5B–8B), Gemma 3 (2B/4B), Phi-4-mini और SmolLM के लिए सीधा डाउनलोड बिना Hugging Face में खोजे।
- क्वांटाइजेशन प्रीसेट। 4-बिट और 5-बिट GGUF क्वांट 8–16 GB मशीनों पर सर्वोत्तम हैं। ऐप को डिफ़ॉल्ट रूप से कुछ समझदारी भरा चुनना चाहिए।
- CPU-केवल फॉलबैक। हर किसी के पास GPU नहीं है। ऐप को एकीकृत ग्राफ़िक्स या सादे CPU पर भी उपयोगी रहना चाहिए।
- मेमोरी फुटप्रिंट। ऐप स्वयं कितना RAM उपयोग करता है इससे पहले कि आप मॉडल लोड करें। कुछ Electron शेल निष्क्रिय अवस्था में 800 MB लेते हैं।
- OpenAI-संगत API। ताकि कोई कोड संपादक, नोट्स ऐप या शेल स्क्रिप्ट एक ही प्रक्रिया को प्रॉम्प्ट भेज सकें।
- कोल्ड स्टार्ट। डबल-क्लिक से चलती हुई चैट तक का समय महत्वपूर्ण है जब आप स्थानीय चाहते हैं, तो ब्राउज़र टैब छोड़ने के लिए।
त्वरित तुलना
| ऐप | सबसे अच्छा है | प्लेटफ़ॉर्म | निःशुल्क योजना | भुगतान | रेटिंग |
|---|---|---|---|---|---|
| Jan | खुला स्रोत ChatGPT-जैसा क्लाइंट | Windows, macOS, Linux | पूरी तरह निःशुल्क | कोई नहीं | 4.7 |
| Ollama | सबसे सरल CLI + API रनटाइम | Windows, macOS, Linux | पूरी तरह निःशुल्क | कोई नहीं | 4.9 |
| LM Studio | वास्तविक GUI के साथ मॉडल खोज | Windows, macOS, Linux | व्यक्तिगत पूरी तरह निःशुल्क | काम के लिए बिक्रय से संपर्क करें | 4.8 |
| GPT4All | स्थानीय + वैकल्पिक क्लाउड फॉलबैक | Windows, macOS, Linux | पूरी तरह निःशुल्क | कोई नहीं | 4.5 |
| Msty | मॉडल में विभाजित चैट तुलना | Windows, macOS, Linux | पूरी तरह निःशुल्क | Aurum $99 आजीवन | 4.7 |
| llamafile | एकल फ़ाइल पोर्टेबल मॉडल | Windows, macOS, Linux | पूरी तरह निःशुल्क | कोई नहीं | 4.6 |
| Cortex | Ollama-शैली रनटाइम, कम फुटप्रिंट | Windows, macOS, Linux | पूरी तरह निःशुल्क | कोई नहीं | 4.4 |
| KoboldCpp | लंबी संदर्भ रचनात्मक लेखन | Windows, macOS, Linux | पूरी तरह निःशुल्क | कोई नहीं | 4.5 |
ऐप्स
1. Jan छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ खुला स्रोत ChatGPT-जैसा क्लाइंट
Jan एक ChatGPT-शैली डेस्कटॉप ऐप देता है जो खुलने के समय परिचित दिखता है, फिर चुपचाप पृष्ठभूमि में Llama 3.2 3B या Qwen 3 4B खींचता है। सहायक, थ्रेड्स, फ़ाइल अपलोड और OpenAI-संगत सर्वर सभी बनाए हुए हैं। M2 MacBook Air पर, Llama 3.2 3B के साथ पहली चैट स्थापन के तीन मिनट बाद प्रश्नों का उत्तर दे रही थी।
जहाँ यह कमज़ोर है: Windows पर कोल्ड स्टार्ट अभी भी macOS से कुछ सेकंड पिछड़ा है। कुछ Hugging Face आयातों को मैनुअल GGUF ड्रॉप की आवश्यकता है।
मूल्य निर्धारण:
- निःशुल्क: पूरी तरह निःशुल्क, AGPL के तहत खुला स्रोत।
- भुगतान: कोई नहीं।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: jan.ai · github.com/janhq/jan
निष्कर्ष: यदि आप सदस्यता या इंटरनेट कनेक्शन के बिना ChatGPT अनुभव चाहते हैं तो चुनें।
2. Ollama छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ सबसे सरल CLI + API रनटाइम
Ollama वह रनटाइम है जिस पर सब कुछ बनाया जाता है। ollama run llama3.2:3b क्वांट खींचता है, इसे लोड करता है और चैट शुरू करता है। पोर्ट 11434 पर OpenAI-संगत API का मतलब है कि कोई भी संपादक, नोट्स ऐप या OpenAI बोलने वाली स्क्रिप्ट बदलाव के बिना इससे बात कर सकती है।
जहाँ यह कमज़ोर है: कोई नेटिव GUI नहीं। आप चैट विंडो के लिए Open WebUI या Msty के साथ इसे जोड़ेंगे।
मूल्य निर्धारण:
- निःशुल्क: पूरी तरह निःशुल्क, MIT लाइसेंस।
- भुगतान: कोई नहीं।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: ollama.com · github.com/ollama/ollama
निष्कर्ष: यहाँ से शुरू करें यदि आप चैट क्लाइंट भी स्थापित कर रहे हैं। इस सूची में अधिकांश अन्य ऐप्स Ollama की ओर इशारा कर सकते हैं।
3. LM Studio छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ वास्तविक GUI के साथ मॉडल खोज
LM Studio Hugging Face ब्राउज़ करने, क्वांट चुनने और टर्मिनल छुए बिना चैट करने के लिए सर्वांगीण ऐप है। मॉडल ब्राउज़र आकार और लाइसेंस के अनुसार फ़िल्टर करता है, जो तब महत्वपूर्ण है जब आप मॉडल को 6 GB RAM में फिट करने की कोशिश कर रहे हों। स्थानीय API सर्वर एक टॉगल है।
जहाँ यह कमज़ोर है: खुला स्रोत नहीं। Linux समर्थन नई सुविधाओं पर Windows और macOS से पिछड़ा है।
मूल्य निर्धारण:
- निःशुल्क: व्यक्तिगत उपयोग के लिए पूरी तरह निःशुल्क।
- भुगतान: वाणिज्यिक तैनाती के लिए बिक्रय से संपर्क करें।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: lmstudio.ai
निष्कर्ष: छोटे क्वांट ब्राउज़ करने और साइड-बाय-साइड परीक्षण के लिए सबसे आसान GUI।
4. GPT4All छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ स्थानीय और वैकल्पिक क्लाउड फॉलबैक
GPT4All एक नेटिव चैट ऐप देता है जो GGUF क्वांट को स्थानीय रूप से चलाता है और जब भारी मॉडल की आवश्यकता होती है तो OpenAI या Groq को भी रूट कर सकता है। LocalDocs आपको एक फ़ोल्डर की ओर इशारा करने और आधारित उत्तर प्राप्त करने देता है बिना फ़ाइलें कहीं भेजे।
जहाँ यह कमज़ोर है: मॉडल कैटलॉग LM Studio से एक कदम पीछे है। Windows पर GPU ऑफलोड को कुछ ट्यूनिंग की आवश्यकता है।
मूल्य निर्धारण:
- निःशुल्क: पूरी तरह निःशुल्क, खुला स्रोत।
- भुगतान: कोई नहीं।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: gpt4all.io
निष्कर्ष: यह चुनें जब आप एक ऐप चाहते हैं जो स्थानीय रूप से शुरू हो और माँग पर क्लाउड उधार ले सकें।
5. Msty छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ मॉडल में विभाजित चैट तुलना
Msty दो या तीन मॉडल प्रतिक्रियाएँ साइड-बाय-साइड दिखाता है। यह तय करने का सबसे तेज़ तरीका है कि Qwen 3 4B या Gemma 3 4B आपकी प्रॉम्प्ट शैली से मेल खाता है। यह Ollama, LM Studio और क्लाउड API से बात करता है, इसलिए तुलना उसी तक सीमित नहीं है जिसे वह होस्ट करता है।
जहाँ यह कमज़ोर है: कुछ उन्नत सुविधाएँ Aurum स्तर के पीछे हैं। खुला स्रोत नहीं।
मूल्य निर्धारण:
- निःशुल्क: पूरी तरह निःशुल्क चैट और विभाजित दृश्य।
- भुगतान: Aurum $99 आजीवन ज्ञान ढेर और प्रीमियम अतिरिक्त के लिए।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: msty.app
निष्कर्ष: यदि आप बार-बार मॉडल का ऑडिशन देते हैं और उन्हें बहस करते देखना चाहते हैं तो चुनें।
6. llamafile छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ एकल फ़ाइल पोर्टेबल मॉडल
llamafile मॉडल और उसके रनटाइम को एक निष्पादन योग्य में लपेटता है। इसे USB स्टिक पर रखें, किसी भी Windows, macOS या Linux मशीन पर डबल-क्लिक करें और एक ब्राउज़र टैब चैट के साथ खुलता है। यह Cosmopolitan libc के लिए Mozilla का योगदान है, और यह स्थापन चरण को पूरी तरह हटा देता है।
जहाँ यह कमज़ोर है: फ़ाइलें 3–5 GB हो सकती हैं। लॉक की गई कॉर्पोरेट मशीनों पर पहली लॉन्च को राइट-क्लिक ओवरराइड की आवश्यकता हो सकती है।
मूल्य निर्धारण:
- निःशुल्क: पूरी तरह निःशुल्क, Apache 2.0।
- भुगतान: कोई नहीं।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: github.com/Mozilla-Ocho/llamafile
निष्कर्ष: पोर्टेबिलिटी, डेमो के लिए या मशीन के लिए सही जहाँ आप सॉफ़्टवेयर स्थापित नहीं कर सकते।
7. Cortex छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ Ollama-शैली रनटाइम कम फुटप्रिंट के साथ
Cortex वह रनटाइम है जो Jan को हुड के तहत शक्ति देता है, एक स्टैंडअलोन डेमॉन के रूप में प्रकट होता है। यह निष्क्रिय अवस्था में Ollama की तुलना में कम फुटप्रिंट है और llama.cpp को डिफ़ॉल्ट रूप से OpenAI-संगत API के साथ देता है। मॉडल पुल एक ही GGUF इकोसिस्टम का उपयोग करते हैं।
जहाँ यह कमज़ोर है: छोटा समुदाय, इसलिए तीसरे पक्ष के एकीकरण कम हैं। दस्तावेज़ अभी भी पकड़ में आ रहा है।
मूल्य निर्धारण:
- निःशुल्क: पूरी तरह निःशुल्क, खुला स्रोत।
- भुगतान: कोई नहीं।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: cortex.so · github.com/janhq/cortex.cpp
निष्कर्ष: यह चुनें यदि Ollama भारी महसूस होता है और आप एक हल्का डेमॉन चाहते हैं जो अभी भी OpenAI API बोलता है।
8. KoboldCpp छोटे स्थानीय LLM के लिए — सर्वश्रेष्ठ लंबी संदर्भ रचनात्मक लेखन के लिए
KoboldCpp llama.cpp की फोर्क है जो कल्पना, भूमिका निभाने और लंबे संदर्भ लेखन के चारों ओर निर्मित है। निरंतर चरित्र स्मृति, दुनिया की जानकारी और Q&A के बजाय ड्राफ्टिंग पर केंद्रित ब्राउज़र UI इसे इस सूची पर अन्य ऐप्स से अलग करते हैं, एक उपयोगी तरीके से। यह अधिकांश GUI की तुलना में छोटे मॉडल पर 32K–128K संदर्भों को बेहतर तरीके से संभालता है।
जहाँ यह कमज़ोर है: UI घना और स्पष्ट रूप से पावर-यूज़र के लिए। गैर-तकनीकी मित्र को देने के लिए ऐप नहीं।
मूल्य निर्धारण:
- निःशुल्क: पूरी तरह निःशुल्क, AGPL।
- भुगतान: कोई नहीं।
प्लेटफ़ॉर्म: Windows, macOS, Linux.
डाउनलोड: github.com/LostRuins/koboldcpp
निष्कर्ष: यदि आप स्थानीय मॉडल चाहते हैं तो यह चुनें क्योंकि आप लेखन सत्र चाहते हैं जो ChatGPT दर-सीमा लगाएगा।
सही चुनना कैसे करें
यदि आप सबसे सरल कार्य सेटअप चाहते हैं: Ollama plus चैट क्लाइंट। Ollama स्थापित करें, फिर Jan या Open WebUI चुनें।
यदि आप एक पॉलिश डेस्कटॉप ऐप चाहते हैं: GUI के लिए LM Studio या खुला स्रोत गुरुत्वपूर्ण होने पर Jan।
यदि आप बार-बार मॉडल का ऑडिशन देते हैं: विभाजित दृश्य के लिए Msty।
यदि आप किसी को डेमो कर रहे हैं या लॉक की गई मशीन पर काम कर रहे हैं: llamafile।
यदि आप सबसे हल्का डेमॉन चाहते हैं: Cortex।
यदि आप लंबी कल्पना लिखते हैं या भूमिका निभाने वाले अभियान चलाते हैं: KoboldCpp।
यदि छोटा मॉडल किसी विशेष कार्य के लिए पर्याप्त नहीं है, तो इनमें से अधिकांश ऐप्स भी क्लाउड समापन बिंदुओं को रूट करते हैं। स्थानीय रूप से शुरू करें, केवल तब स्केल करें जब स्थानीय उत्तर काफी अच्छा न हो।
अक्सर पूछे जाने वाले प्रश्न
बिना GPU वाले लैपटॉप के लिए सर्वश्रेष्ठ छोटे स्थानीय LLM ऐप कौन सा है? 3B या 4B मॉडल वाली Ollama स्वीकार्य गति के साथ CPU और एकीकृत ग्राफ़िक्स पर चलती है। LM Studio अपने मॉडल पिकर में CPU-केवल प्रीसेट भेजता है।
क्या छोटा स्थानीय LLM ChatGPT की जगह ले सकता है? रोज़मर्रा की चैट, सारांश और शॉर्ट-फॉर्म कोड सहायता के लिए हाँ। भारी तर्क, एजेंट वर्कफ़्लो और लंबे शोध कार्यों के लिए नहीं। जो अधिकांश लोग दोनों को आजमाते हैं वे दैनिक प्रॉम्प्ट के लिए स्थानीय और कठिन के लिए क्लाउड का उपयोग करते हैं।
8 GB RAM पर कौन सा मॉडल आकार चलता है? 3B मॉडल Q4 क्वांटाइजेशन में ऐप के लिए मार्जिन के साथ आराम से फिट होता है। 4B क्वांट काम करता है यदि आप अन्य मेमोरी-भारी ऐप्स बंद करते हैं।
क्या स्थानीय LLM वास्तव में निजी हैं? इस सूची पर ऐप्स डिफ़ॉल्ट रूप से प्रॉम्प्ट अपलोड नहीं करते। GPT4All और Msty वैकल्पिक क्लाउड रूटिंग देते हैं, और यह ऑप्ट-इन है। यदि पूर्ण अलगाव महत्वपूर्ण है तो ऐप के लिए नेटवर्क एक्सेस अक्षम करें।
सर्वश्रेष्ठ निःशुल्क छोटे स्थानीय LLM ऐप कौन सा है? रनटाइम के लिए Ollama और GUI के लिए Jan। दोनों निःशुल्क हैं, दोनों खुला स्रोत हैं, दोनों सक्रिय रूप से बनाए रखे जाते हैं।