XDA ने इस महीने एक लेख प्रकाशित किया जिसमें तर्क दिया गया कि समानांतर में चलने वाले दो 2 GB स्थानीय मॉडल लगभग हर वास्तविक कार्य में एक 8 GB मॉडल को मात देते हैं, और लेखक सही था। कोड के लिए अनुकूलित एक छोटा मॉडल साथ में बातचीत के लिए अनुकूलित एक छोटा मॉडल, एक दूसरे के बगल में चल रहा है, कम VRAM का उपयोग करता है, तेजी से प्रतिक्रिया देता है और आपको सही प्रश्न को सही उपकरण पर निर्देशित करने देता है। घर्षण उपकरण में है: अधिकांश स्थानीय LLM ऐप एक बार में एक मॉडल और एक चैट विंडो मानते हैं। नीचे दिए गए सभी आठ ऐप्लिकेशन डेस्कटॉप पर एकाधिक स्थानीय LLMs को एक साथ चलाने के लिए समवर्ती मॉडल को संभालते हैं, या तो मूल रूप से या OpenAI-संगत समापन बिंदु को उजागर करके जिसे दूसरा ऐप इंगित कर सकता है।
एक बहु-मॉडल LLM रनर में क्या देखें
एक से अधिक मॉडल चलाने के लिए वास्तविक मानदंड:
- मूल बहु-मॉडल लोडिंग। कुछ उपकरण मॉडल को अनुरोध पर स्वैप करते हैं; अन्य वास्तव में दो को RAM में लोड रखते हैं।
- OpenAI-संगत समापन बिंदु। पोर्ट 11434 या 1234 पर चल रहा सर्वर जिसे अन्य उपकरण कॉल कर सकते हैं।
- मॉडल रूटिंग। कोड प्रमुखों को Qwen2.5-Coder, चैट को Llama 3.2 पर भेजें, अनुरोध के आधार पर।
- परत विभाजन के साथ GPU ऑफलोड। एक ही GPU पर दो छोटे मॉडल लोड करें बिना एक दुर्घटनाग्रस्त हुए।
- दूसरे मॉडल के लिए CPU फॉलबैक। यदि GPU भरा है, तो दूसरा मॉडल बिना मरे CPU पर चलता है।
- सत्र अलगाव। दो चैट एक दूसरे के संदर्भ विंडो पर नहीं चलते हैं।
त्वरित तुलना
| ऐप | सर्वोत्तम के लिए | बहु-मॉडल | मुक्त योजना | शुरुआती कीमत | GUI |
|---|---|---|---|---|---|
| Ollama | CLI-first, OpenAI endpoint | हां (समानांतर लोडिंग) | मुक्त | मुक्त | नहीं (CLI) |
| LM Studio | बिंदु-और-क्लिक मॉडल प्रबंधक | हां | मुक्त | मुक्त | हां |
| Jan | पूरी तरह से ऑफलाइन चैट + backend | हां | मुक्त | मुक्त | हां |
| llama.cpp server | कच्चा नियंत्रण, सबसे छोटा पदचिह्न | हां (प्रति-प्रक्रिया) | मुक्त | मुक्त | नहीं |
| LiteLLM | 100+ backends को रूट करें | राउटर | मुक्त | मुक्त (क्लाउड विकल्प) | Web UI |
| Open WebUI | बहु-मॉडल चैट frontend | हां | मुक्त | मुक्त | हां (web) |
| vLLM | उत्पादन-ग्रेड थ्रूपुट | हां (tensor parallel) | मुक्त | मुक्त | नहीं |
| Msty | एक desktop ऐप में स्थानीय + क्लाउड | हां (Split Chat) | मुक्त | 8.99 USD/मास | हां |
ऐप्स
1. Ollama, डिफ़ॉल्ट रनटाइम
Ollama मांग पर मॉडल लोड और अनलोड करता है और पोर्ट 11434 पर OpenAI-संगत API को उजागर करता है। अपने env में OLLAMA_NUM_PARALLEL=2 और OLLAMA_MAX_LOADED_MODELS=3 सेट करें, सेवा को पुनरारंभ करें, और आप किसी भी क्लाइंट से समानांतर में दो मॉडल तक पहुंच सकते हैं। 32 GB एकीकृत मेमोरी वाली M2 Pro पर, हमने Qwen2.5-Coder 3B और Llama 3.2 3B को एक छोटे दृष्टि मॉडल के लिए हेडरूम के साथ एक दूसरे के बगल में चलाया।
जहां यह कम पड़ता है: कोई नेटिव GUI नहीं। डिफ़ॉल्ट संदर्भ लंबाई (2048) वास्तविक कार्य के लिए छोटी है, इसलिए इसे समायोजित करें। ollama serve प्रक्रिया मल्टी-GPU रिग पर स्वचालित रूप से मॉडल को विशिष्ट GPUs पर पिन नहीं करती है।
मूल्य निर्धारण:
- मुक्त: सब कुछ।
प्लेटफॉर्म: macOS, Windows, Linux।
नीचे की पंक्ति: आधार परत। इस सूची में लगभग हर दूसरा उपकरण Ollama को लपेटता है या उसके आर्किटेक्चर को साझा करता है। पहले इसे स्थापित करें।
2. LM Studio, पॉलिश्ड GUI
LM Studio वह ऐप है जो अधिकांश लोग पहले स्थापित करते हैं। यह एक पूर्ण मॉडल ब्राउज़र, एक चैट UI, और 0.3 रिलीज़ के बाद से, एक अंतर्निहित स्थानीय सर्वर के साथ आता है जो कई मॉडलों को समवर्ती रूप से चलाता है। मॉडल कैटलॉग सीधे Hugging Face से खींचा जाता है और आपकी मशीन पर क्या फिट होगा के अनुसार फ़िल्टर किया जाता है। Split Chat मोड आपको एक ही प्रॉम्प्ट पर दो मॉडलों की तुलना रीयल-टाइम में करने देता है।
जहां यह कम पड़ता है: ओपन सोर्स नहीं है (व्यक्तिगत उपयोग के लिए मुक्त, कार्य उपयोग के लिए उनसे संपर्क करें)। बंडल किया गया llama.cpp संस्करण अपस्ट्रीम से पीछे हो सकता है।
मूल्य निर्धारण:
- मुक्त: व्यक्तिगत उपयोग के लिए सभी सुविधाएं।
- सशुल्क: टीम/व्यावसायिक लाइसेंसिंग के लिए बिक्रय से संपर्क करें।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: LM Studio
नीचे की पंक्ति: यदि आप GUI चाहते हैं तो सर्वोत्तम प्रवेश बिंदु। स्क्रिप्टिंग के लिए Ollama के साथ जोड़ी।
3. Jan, ओपन-सोर्स LM Studio
Jan LM Studio का ओपन-सोर्स विकल्प है: एक ही विचार, MIT लाइसेंस, और पूरी तरह से ऑफलाइन चलाने का घोषित लक्ष्य। बहु-मॉडल चैट थ्रेड प्रत्येक थ्रेड को एक अलग मॉडल पर पिन करने देता है। यह अपनी llama.cpp backend चलाता है और जब आप एक बड़ा मॉडल चाहते हैं तो एक दूरस्थ Ollama या OpenAI-संगत API पर प्रॉक्सी कर सकता है।
जहां यह कम पड़ता है: LM Studio की तुलना में युवा परियोजना। कम पैक किए गए एक्सटेंशन।
मूल्य निर्धारण:
- मुक्त: सब कुछ (ओपन सोर्स)।
प्लेटफॉर्म: Windows, macOS, Linux।
नीचे की पंक्ति: यदि ओपन सोर्स महत्वपूर्ण हो तो इसे चुनें। कार्यात्मक रूप से LM Studio के बहुत करीब।
4. llama.cpp server, आधार आदिम
llama.cpp एक राज्यहीन HTTP सर्वर के साथ आता है जिसे आप प्रति मॉडल लॉन्च करते हैं। दो शेल कमांड, दो पोर्ट, दो मॉडल। यह RAM में दो GGUF क्वांटाइजेशन रखने का सबसे कठोर तरीका है: कोई wrapper नहीं, कोई शेड्यूलर नहीं, कोई टेलीमेट्री नहीं, और यहां कुछ भी का सबसे छोटा मेमोरी ओवरहेड।
जहां यह कम पड़ता है: आप अपनी खुद की रूटिंग तार लगाते हैं। कोई GUI नहीं। कोई मॉडल प्रबंधक नहीं। सेटअप के लिए केवल कमांड-लाइन।
मूल्य निर्धारण:
- मुक्त: ओपन सोर्स (MIT)।
प्लेटफॉर्म: Windows, macOS, Linux (Docker भी)।
डाउनलोड: GitHub
नीचे की पंक्ति: उन लोगों के लिए जो समझना चाहते हैं कि अमूर्त परतें क्या छिपा रही हैं। स्क्रिप्टिंग रिग के लिए बिल्कुल सही।
5. LiteLLM, राउटर
LiteLLM मॉडलों को होस्ट नहीं करता; यह उन्हें रूट करता है। अपने Ollama उदाहरण, LM Studio सर्वर, Anthropic API कुंजी और Azure समापन बिंदु की ओर इशारा करें, फिर हर अनुरोध को एक OpenAI-संगत URL के माध्यम से भेजें और राउटर को निर्णय लेने दें। प्रति-मॉडल फॉलबैक और दर सीमा के साथ एक YAML कॉन्फ़िगरेशन फ़ाइल एक कोडिंग सहायक को एक छोटे स्थानीय मॉडल पर वापस आने देती है जब बड़ा व्यस्त हो।
जहां यह कम पड़ता है: प्रबंधित करने के लिए एक अतिरिक्त प्रक्रिया जोड़ता है। रूटिंग निर्णयों को डीबग करने में कुछ लॉग पढ़ना लगता है।
मूल्य निर्धारण:
- मुक्त: ओपन सोर्स (proxy और SDK)।
- सशुल्क: LiteLLM Cloud (वैकल्पिक) अवलोकनशीलता के लिए सदस्यता-आधारित।
प्लेटफॉर्म: Windows, macOS, Linux (Python, Docker)।
डाउनलोड: GitHub
नीचे की पंक्ति: कई runners के बीच गोंद। यदि आप केवल एक backend चलाते हैं तो छोड़ें, तीन चलाते हैं तो अनिवार्य।
6. Open WebUI, ChatGPT-जैसा frontend
Open WebUI स्थानीय मॉडलों के लिए पॉलिश्ड चैट इंटरफेस है। इसे Ollama (या किसी भी OpenAI-संगत समापन बिंदु) से कनेक्ट करें, और यह आपको बहु-उपयोगकर्ता प्रमाणीकरण, चैट इतिहास, कनवर्सेशन के बीच में मॉडल स्विचिंग और एक एकल ब्राउज़र टैब में मॉडलों की साइड-बाय-साइड तुलना देता है। उपयोगी जहां चार लोग एक मशीन साझा करते हैं।
जहां यह कम पड़ता है: सुचारू अनुभव के लिए Docker में चलता है; मूल स्थापना संभव है लेकिन अधिक परिष्कृत है। किसी भी मॉडल के लोड होने से पहले लगभग 500 MB RAM का उपयोग करता है।
मूल्य निर्धारण:
- मुक्त: ओपन सोर्स (BSD-3)।
प्लेटफॉर्म: Windows, macOS, Linux (Docker)।
डाउनलोड: GitHub
नीचे की पंक्ति: यदि आपके पास पहले से Ollama चल रहा है तो सर्वश्रेष्ठ frontend। Split Chat मोड किलर फीचर है।
7. vLLM, थ्रूपुट इंजन
vLLM वह है जो आप स्थापित करते हैं जब desktop उपकरण स्केल करना बंद कर देते हैं। PagedAttention मेमोरी प्रबंधन कई मॉडलों को किसी भी एकल-मॉडल runner की तुलना में बेहतर VRAM उपयोग के साथ रखता है। Tensor parallelism एक मॉडल को GPUs में विभाजित करता है; एक ही सर्वर पर कई deployments अलग-अलग मॉडलों को एक साथ होस्ट करते हैं। लैपटॉप के लिए अत्यधिक, दो GPUs वाले वर्कस्टेशन के लिए आवश्यक।
जहां यह कम पड़ता है: Linux-first (WSL2 के माध्यम से Windows)। Python और CUDA सेटअप की आवश्यकता है। आकस्मिक उपयोगकर्ताओं के लिए नहीं।
मूल्य निर्धारण:
- मुक्त: ओपन सोर्स (Apache 2.0)।
प्लेटफॉर्म: Linux, Windows (WSL2), macOS (Apple Silicon आंशिक)।
डाउनलोड: GitHub
नीचे की पंक्ति: केवल तभी पहुँचें जब आपके पास एक गंभीर GPU हो। एक एकल 4090 पर, Ollama आसान है और लगभग उतना ही तेज़।
8. Msty, स्थानीय-प्लस-क्लाउड desktop ऐप
Msty एक एकल desktop बाइनरी के रूप में आता है जो एक बंडल runtime के माध्यम से स्थानीय मॉडल चलाता है और आपकी खुद की API कुंजियों के माध्यम से क्लाउड मॉडल, एक ही विंडो में बगल में। Split Chat एक prompt के लिए चार तक मॉडलों की तुलना करता है। Knowledge Stacks सुविधा स्थानीय दस्तावेज़ों को अनुक्रमित करती है और मॉडलों में इंडेक्स साझा करती है।
जहां यह कम पड़ता है: मुक्त स्तर उदार है लेकिन split chat को दो मॉडलों तक सीमित करता है। चार-तरफा split के लिए सशुल्क स्तर महंगे हैं।
मूल्य निर्धारण:
- मुक्त: दो-तरफा split chat, सभी स्थानीय मॉडल सुविधाएं।
- सशुल्क: 8.99 USD/माह या 79 USD/वर्ष चार-तरफा split और प्रीमियम sync के लिए।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: Msty
नीचे की पंक्ति: स्थानीय बनाम क्लाउड मॉडलों की तुलना बगल में करने का सबसे आसान तरीका। केवल अगर आपको चार-तरफा split की आवश्यकता है तो इसके लिए भुगतान करें।
सही एक कैसे चुनें
- यदि आप शून्य से शुरू कर रहे हैं, Ollama और Open WebUI स्थापित करें। यह संदर्भ स्टैक है।
- यदि आप Docker को स्पर्श किए बिना GUI चाहते हैं, LM Studio या Jan।
- यदि ओपन सोर्स महत्वपूर्ण है और आप GUI चाहते हैं, Jan।
- यदि आप स्थानीय और क्लाउड APIs के बीच रूट करते हैं, LiteLLM जोड़ें।
- यदि आप लगातार मॉडल आउटपुट की तुलना करते हैं, Msty या LM Studio Split Chat।
- यदि आप सब कुछ स्क्रिप्ट करते हैं, कस्टम पोर्ट पर llama.cpp server।
- यदि आपके rig में दो GPUs हैं और आप एक छोटी टीम को सेवा देते हैं, vLLM।
FAQ
क्या मैं एक GPU पर दो LLMs चला सकता हूं?
हाँ, यदि दोनों क्वांटाइज़्ड संस्करण VRAM में फिट हों। Q4_K_M पर एक 3B मॉडल लगभग 2 GB का उपयोग करता है; इनमें से दो एक 8 GB कार्ड पर आरामदायक रूप से फिट होते हैं। OLLAMA_MAX_LOADED_MODELS को 1 से ऊपर सेट करें उन्हें गर्म रखने के लिए।
क्या छोटे स्थानीय LLMs वास्तव में अच्छे हैं?
Qwen 2.5 और Llama 3.2 के बाद से 3B-7B रेंज में, छोटे मॉडल सारांश, कोड पूरकता, निष्कर्षण और संक्षिप्त-रूप चैट को GPT-3.5 के समीप गुणवत्ता के साथ संभालते हैं। वे लंबी-संदर्भ तर्क और जटिल बहु-चरणीय कार्यों में विफल रहते हैं। कठिन प्रॉम्प्ट के लिए एक बड़े मॉडल के साथ इसके चारों ओर रूट करें।
Ollama और LM Studio में क्या अंतर है?
Ollama एक CLI-first runtime है जिसमें HTTP API है। LM Studio एक GUI-first desktop ऐप है जो एक बंडल llama.cpp सर्वर चलाता है। वे एक ही मशीन पर समानांतर में चल सकते हैं।
क्या मुझे स्थानीय LLMs चलाने के लिए GPU की आवश्यकता है?
नहीं, लेकिन इससे मदद मिलती है। एक 3B मॉडल आधुनिक Apple Silicon CPU या 16 GB RAM वाली Intel/AMD चिप पर पठनीय गति (10 से 20 tokens/सेकंड) पर चलता है। GPUs इसे 60 से 200 tokens/सेकंड तक ले जाते हैं।
कौन सा ऐप सबसे तेजी से चलता है?
प्रति token, आधुनिक NVIDIA GPU पर vLLM। प्रति install, एक अच्छे quant के साथ llama.cpp। सुविधा के लिए, Ollama।