डेस्कटॉप पर कई छोटे स्थानीय LLMs चलाएँ

XDA ने इस महीने एक लेख प्रकाशित किया जिसमें तर्क दिया गया कि समानांतर में चलने वाले दो 2 GB स्थानीय मॉडल लगभग हर वास्तविक कार्य में एक 8 GB मॉडल को मात देते हैं, और लेखक सही था। कोड के लिए अनुकूलित एक छोटा मॉडल साथ में बातचीत के लिए अनुकूलित एक छोटा मॉडल, एक दूसरे के बगल में चल रहा है, कम VRAM का उपयोग करता है, तेजी से प्रतिक्रिया देता है और आपको सही प्रश्न को सही उपकरण पर निर्देशित करने देता है। घर्षण उपकरण में है: अधिकांश स्थानीय LLM ऐप एक बार में एक मॉडल और एक चैट विंडो मानते हैं। नीचे दिए गए सभी आठ ऐप्लिकेशन डेस्कटॉप पर एकाधिक स्थानीय LLMs को एक साथ चलाने के लिए समवर्ती मॉडल को संभालते हैं, या तो मूल रूप से या OpenAI-संगत समापन बिंदु को उजागर करके जिसे दूसरा ऐप इंगित कर सकता है।

एक बहु-मॉडल LLM रनर में क्या देखें

एक से अधिक मॉडल चलाने के लिए वास्तविक मानदंड:

त्वरित तुलना

ऐप सर्वोत्तम के लिए बहु-मॉडल मुक्त योजना शुरुआती कीमत GUI
Ollama CLI-first, OpenAI endpoint हां (समानांतर लोडिंग) मुक्त मुक्त नहीं (CLI)
LM Studio बिंदु-और-क्लिक मॉडल प्रबंधक हां मुक्त मुक्त हां
Jan पूरी तरह से ऑफलाइन चैट + backend हां मुक्त मुक्त हां
llama.cpp server कच्चा नियंत्रण, सबसे छोटा पदचिह्न हां (प्रति-प्रक्रिया) मुक्त मुक्त नहीं
LiteLLM 100+ backends को रूट करें राउटर मुक्त मुक्त (क्लाउड विकल्प) Web UI
Open WebUI बहु-मॉडल चैट frontend हां मुक्त मुक्त हां (web)
vLLM उत्पादन-ग्रेड थ्रूपुट हां (tensor parallel) मुक्त मुक्त नहीं
Msty एक desktop ऐप में स्थानीय + क्लाउड हां (Split Chat) मुक्त 8.99 USD/मास हां

ऐप्स

1. Ollama, डिफ़ॉल्ट रनटाइम

Ollama मांग पर मॉडल लोड और अनलोड करता है और पोर्ट 11434 पर OpenAI-संगत API को उजागर करता है। अपने env में OLLAMA_NUM_PARALLEL=2 और OLLAMA_MAX_LOADED_MODELS=3 सेट करें, सेवा को पुनरारंभ करें, और आप किसी भी क्लाइंट से समानांतर में दो मॉडल तक पहुंच सकते हैं। 32 GB एकीकृत मेमोरी वाली M2 Pro पर, हमने Qwen2.5-Coder 3B और Llama 3.2 3B को एक छोटे दृष्टि मॉडल के लिए हेडरूम के साथ एक दूसरे के बगल में चलाया।

जहां यह कम पड़ता है: कोई नेटिव GUI नहीं। डिफ़ॉल्ट संदर्भ लंबाई (2048) वास्तविक कार्य के लिए छोटी है, इसलिए इसे समायोजित करें। ollama serve प्रक्रिया मल्टी-GPU रिग पर स्वचालित रूप से मॉडल को विशिष्ट GPUs पर पिन नहीं करती है।

मूल्य निर्धारण:

प्लेटफॉर्म: macOS, Windows, Linux।

डाउनलोड: Ollama | GitHub

नीचे की पंक्ति: आधार परत। इस सूची में लगभग हर दूसरा उपकरण Ollama को लपेटता है या उसके आर्किटेक्चर को साझा करता है। पहले इसे स्थापित करें।

2. LM Studio, पॉलिश्ड GUI

LM Studio वह ऐप है जो अधिकांश लोग पहले स्थापित करते हैं। यह एक पूर्ण मॉडल ब्राउज़र, एक चैट UI, और 0.3 रिलीज़ के बाद से, एक अंतर्निहित स्थानीय सर्वर के साथ आता है जो कई मॉडलों को समवर्ती रूप से चलाता है। मॉडल कैटलॉग सीधे Hugging Face से खींचा जाता है और आपकी मशीन पर क्या फिट होगा के अनुसार फ़िल्टर किया जाता है। Split Chat मोड आपको एक ही प्रॉम्प्ट पर दो मॉडलों की तुलना रीयल-टाइम में करने देता है।

जहां यह कम पड़ता है: ओपन सोर्स नहीं है (व्यक्तिगत उपयोग के लिए मुक्त, कार्य उपयोग के लिए उनसे संपर्क करें)। बंडल किया गया llama.cpp संस्करण अपस्ट्रीम से पीछे हो सकता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: LM Studio

नीचे की पंक्ति: यदि आप GUI चाहते हैं तो सर्वोत्तम प्रवेश बिंदु। स्क्रिप्टिंग के लिए Ollama के साथ जोड़ी।

3. Jan, ओपन-सोर्स LM Studio

Jan LM Studio का ओपन-सोर्स विकल्प है: एक ही विचार, MIT लाइसेंस, और पूरी तरह से ऑफलाइन चलाने का घोषित लक्ष्य। बहु-मॉडल चैट थ्रेड प्रत्येक थ्रेड को एक अलग मॉडल पर पिन करने देता है। यह अपनी llama.cpp backend चलाता है और जब आप एक बड़ा मॉडल चाहते हैं तो एक दूरस्थ Ollama या OpenAI-संगत API पर प्रॉक्सी कर सकता है।

जहां यह कम पड़ता है: LM Studio की तुलना में युवा परियोजना। कम पैक किए गए एक्सटेंशन।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: Jan | GitHub

नीचे की पंक्ति: यदि ओपन सोर्स महत्वपूर्ण हो तो इसे चुनें। कार्यात्मक रूप से LM Studio के बहुत करीब।

4. llama.cpp server, आधार आदिम

llama.cpp एक राज्यहीन HTTP सर्वर के साथ आता है जिसे आप प्रति मॉडल लॉन्च करते हैं। दो शेल कमांड, दो पोर्ट, दो मॉडल। यह RAM में दो GGUF क्वांटाइजेशन रखने का सबसे कठोर तरीका है: कोई wrapper नहीं, कोई शेड्यूलर नहीं, कोई टेलीमेट्री नहीं, और यहां कुछ भी का सबसे छोटा मेमोरी ओवरहेड।

जहां यह कम पड़ता है: आप अपनी खुद की रूटिंग तार लगाते हैं। कोई GUI नहीं। कोई मॉडल प्रबंधक नहीं। सेटअप के लिए केवल कमांड-लाइन।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux (Docker भी)।

डाउनलोड: GitHub

नीचे की पंक्ति: उन लोगों के लिए जो समझना चाहते हैं कि अमूर्त परतें क्या छिपा रही हैं। स्क्रिप्टिंग रिग के लिए बिल्कुल सही।

5. LiteLLM, राउटर

LiteLLM मॉडलों को होस्ट नहीं करता; यह उन्हें रूट करता है। अपने Ollama उदाहरण, LM Studio सर्वर, Anthropic API कुंजी और Azure समापन बिंदु की ओर इशारा करें, फिर हर अनुरोध को एक OpenAI-संगत URL के माध्यम से भेजें और राउटर को निर्णय लेने दें। प्रति-मॉडल फॉलबैक और दर सीमा के साथ एक YAML कॉन्फ़िगरेशन फ़ाइल एक कोडिंग सहायक को एक छोटे स्थानीय मॉडल पर वापस आने देती है जब बड़ा व्यस्त हो।

जहां यह कम पड़ता है: प्रबंधित करने के लिए एक अतिरिक्त प्रक्रिया जोड़ता है। रूटिंग निर्णयों को डीबग करने में कुछ लॉग पढ़ना लगता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux (Python, Docker)।

डाउनलोड: GitHub

नीचे की पंक्ति: कई runners के बीच गोंद। यदि आप केवल एक backend चलाते हैं तो छोड़ें, तीन चलाते हैं तो अनिवार्य।

6. Open WebUI, ChatGPT-जैसा frontend

Open WebUI स्थानीय मॉडलों के लिए पॉलिश्ड चैट इंटरफेस है। इसे Ollama (या किसी भी OpenAI-संगत समापन बिंदु) से कनेक्ट करें, और यह आपको बहु-उपयोगकर्ता प्रमाणीकरण, चैट इतिहास, कनवर्सेशन के बीच में मॉडल स्विचिंग और एक एकल ब्राउज़र टैब में मॉडलों की साइड-बाय-साइड तुलना देता है। उपयोगी जहां चार लोग एक मशीन साझा करते हैं।

जहां यह कम पड़ता है: सुचारू अनुभव के लिए Docker में चलता है; मूल स्थापना संभव है लेकिन अधिक परिष्कृत है। किसी भी मॉडल के लोड होने से पहले लगभग 500 MB RAM का उपयोग करता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux (Docker)।

डाउनलोड: GitHub

नीचे की पंक्ति: यदि आपके पास पहले से Ollama चल रहा है तो सर्वश्रेष्ठ frontend। Split Chat मोड किलर फीचर है।

7. vLLM, थ्रूपुट इंजन

vLLM वह है जो आप स्थापित करते हैं जब desktop उपकरण स्केल करना बंद कर देते हैं। PagedAttention मेमोरी प्रबंधन कई मॉडलों को किसी भी एकल-मॉडल runner की तुलना में बेहतर VRAM उपयोग के साथ रखता है। Tensor parallelism एक मॉडल को GPUs में विभाजित करता है; एक ही सर्वर पर कई deployments अलग-अलग मॉडलों को एक साथ होस्ट करते हैं। लैपटॉप के लिए अत्यधिक, दो GPUs वाले वर्कस्टेशन के लिए आवश्यक।

जहां यह कम पड़ता है: Linux-first (WSL2 के माध्यम से Windows)। Python और CUDA सेटअप की आवश्यकता है। आकस्मिक उपयोगकर्ताओं के लिए नहीं।

मूल्य निर्धारण:

प्लेटफॉर्म: Linux, Windows (WSL2), macOS (Apple Silicon आंशिक)।

डाउनलोड: GitHub

नीचे की पंक्ति: केवल तभी पहुँचें जब आपके पास एक गंभीर GPU हो। एक एकल 4090 पर, Ollama आसान है और लगभग उतना ही तेज़।

8. Msty, स्थानीय-प्लस-क्लाउड desktop ऐप

Msty एक एकल desktop बाइनरी के रूप में आता है जो एक बंडल runtime के माध्यम से स्थानीय मॉडल चलाता है और आपकी खुद की API कुंजियों के माध्यम से क्लाउड मॉडल, एक ही विंडो में बगल में। Split Chat एक prompt के लिए चार तक मॉडलों की तुलना करता है। Knowledge Stacks सुविधा स्थानीय दस्तावेज़ों को अनुक्रमित करती है और मॉडलों में इंडेक्स साझा करती है।

जहां यह कम पड़ता है: मुक्त स्तर उदार है लेकिन split chat को दो मॉडलों तक सीमित करता है। चार-तरफा split के लिए सशुल्क स्तर महंगे हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: Msty

नीचे की पंक्ति: स्थानीय बनाम क्लाउड मॉडलों की तुलना बगल में करने का सबसे आसान तरीका। केवल अगर आपको चार-तरफा split की आवश्यकता है तो इसके लिए भुगतान करें।

सही एक कैसे चुनें

FAQ

क्या मैं एक GPU पर दो LLMs चला सकता हूं?

हाँ, यदि दोनों क्वांटाइज़्ड संस्करण VRAM में फिट हों। Q4_K_M पर एक 3B मॉडल लगभग 2 GB का उपयोग करता है; इनमें से दो एक 8 GB कार्ड पर आरामदायक रूप से फिट होते हैं। OLLAMA_MAX_LOADED_MODELS को 1 से ऊपर सेट करें उन्हें गर्म रखने के लिए।

क्या छोटे स्थानीय LLMs वास्तव में अच्छे हैं?

Qwen 2.5 और Llama 3.2 के बाद से 3B-7B रेंज में, छोटे मॉडल सारांश, कोड पूरकता, निष्कर्षण और संक्षिप्त-रूप चैट को GPT-3.5 के समीप गुणवत्ता के साथ संभालते हैं। वे लंबी-संदर्भ तर्क और जटिल बहु-चरणीय कार्यों में विफल रहते हैं। कठिन प्रॉम्प्ट के लिए एक बड़े मॉडल के साथ इसके चारों ओर रूट करें।

Ollama और LM Studio में क्या अंतर है?

Ollama एक CLI-first runtime है जिसमें HTTP API है। LM Studio एक GUI-first desktop ऐप है जो एक बंडल llama.cpp सर्वर चलाता है। वे एक ही मशीन पर समानांतर में चल सकते हैं।

क्या मुझे स्थानीय LLMs चलाने के लिए GPU की आवश्यकता है?

नहीं, लेकिन इससे मदद मिलती है। एक 3B मॉडल आधुनिक Apple Silicon CPU या 16 GB RAM वाली Intel/AMD चिप पर पठनीय गति (10 से 20 tokens/सेकंड) पर चलता है। GPUs इसे 60 से 200 tokens/सेकंड तक ले जाते हैं।

कौन सा ऐप सबसे तेजी से चलता है?

प्रति token, आधुनिक NVIDIA GPU पर vLLM। प्रति install, एक अच्छे quant के साथ llama.cpp। सुविधा के लिए, Ollama।