Ollama के साथ डेस्कटॉप पर कई स्थानीय AI मॉडल चलाना

डेस्कटॉप पर कई स्थानीय AI मॉडल चलाने के लिए सर्वोत्तम ऐप्स वे हैं जो आपके GPU को एकल-स्लॉट कार्ट्रिज कंसोल के रूप में मानना बंद कर देते हैं। बड़े स्थानीय मॉडल के पीछे भागना बंद करने वाले एक लेखक के एक हाल के XDA लेख ने इसे स्पष्ट रूप से कहा: दो 2GB मॉडल एक साथ चल रहे हैं एक 8GB मॉडल को हराते हैं, क्योंकि प्रत्येक छोटा मॉडल एक विशिष्ट कार्य के लिए चुना गया था। एक 3B कोड मॉडल ऑटो-पूर्ण को संभालता था। एक 3B चैट मॉडल बातचीत को संभालता था। कोई भी सर्वकार्य नहीं होना था।

यह वह पैटर्न है जिसकी हम यहाँ परवाह करते हैं। बेंचमार्क-पीछा नहीं। रूटिंग। हमने पिछले कुछ हफ्तों में सात डेस्कटॉप रनर और ऑर्केस्ट्रेटर का परीक्षण किया, मापा कि वे कितनी जल्दी मॉडल स्वैप करते हैं, जांचा कि क्या वे एक साथ दो को लोड रख सकते हैं, और रूटिंग कितनी उपयोगी है इसका मूल्यांकन किया। यह सूची किसी के लिए भी है जिसके पास 12GB से 24GB कार्ड है जो एक वास्तविक सहायक प्लस एक कोड मॉडल प्लस शायद एक दृष्टि मॉडल चाहता है, सब एक मशीन पर।

एक स्थानीय मल्टी-मॉडल रनर में क्या देखें

छह चीजें उन उपकरणों को अलग करती हैं जो मल्टी-मॉडल वर्कफ़्लो को सुखद बनाती हैं उन से जो आपको एकल-मॉडल रूट में मजबूर करती हैं।

त्वरित तुलना

ऐप के लिए सर्वोत्तम प्लेटफॉर्म मुफ्त योजना सशुल्क स्तर मल्टी-मॉडल कहानी
Ollama आधारभूत रनर और API परत Windows, macOS, Linux पूरी तरह मुफ्त, ओपन सोर्स कोई नहीं मांग पर हॉट-स्वैप, हाल के मॉडल को गर्म रखता है
LM Studio GUI मल्टी-मॉडल टैब Windows, macOS, Linux व्यक्तिगत उपयोग के लिए मुफ्त काम के लिए टीम लाइसेंस एक बार कई मॉडल लोड करें, टैब स्विच करें
Msty मॉडल में समानांतर चैट Windows, macOS, Linux मुफ्त स्तर Aurum आजीवन लाइसेंस आठ तक मॉडल से साइड-बाय-साइड प्रतिक्रियाएं
Jan ओपन सोर्स मल्टी-मॉडल चैट क्लाइंट Windows, macOS, Linux पूरी तरह मुफ्त, ओपन सोर्स कोई नहीं प्रति वार्तालाप स्वैप, OpenAI-संगत सर्वर
Open WebUI Ollama पर पाइपलाइन रूटिंग परत वेब UI, स्व-होस्ट किए गए पूरी तरह मुफ्त, ओपन सोर्स कोई नहीं प्रति अनुरोध मॉडल चुनाव, पाइपलाइन स्क्रिप्टिंग
LocalAI ड्रॉप-इन API रूटर Windows, macOS, Linux, Docker पूरी तरह मुफ्त, ओपन सोर्स कोई नहीं एक अंतिम बिंदु कई बैकएंड और प्रारूपों को रूट करता है
LiteLLM क्रॉस-बैकएंड प्रॉक्सी Windows, macOS, Linux पूरी तरह मुफ्त, ओपन सोर्स प्रबंधित क्लाउड स्तर मॉडल नाम से किसी भी स्थानीय या दूरस्थ प्रदाता को रूट करता है

ऐप्स

1. Ollama, स्थानीय मॉडल हॉट-स्वैपिंग के लिए सर्वोत्तम

Ollama एक ऐप है जिस पर इस सूची का अधिकांश हिस्सा निर्भर करता है, और अच्छे कारण के लिए। इसकी CLI और llama.cpp के चारों ओर API मॉडल प्रबंधन को docker pull जैसा लगता है, और इसका कई मॉडल के साथ व्यवहार कारण है कि दो-छोटे-मॉडल वर्कफ़्लो पहली बार क्यों काम करते हैं। ollama run llama3.2:3b चैट के लिए चलाएं और ollama run qwen2.5-coder:3b ऑटो-पूर्ण के लिए, और daemon हाल ही में उपयोग किए गए को गर्म रखता है जबकि दूसरे को लोड करता है। डिफ़ॉल्ट कीप-अलाइव पाँच मिनट है, इसलिए जल्दी वापस स्विच मुआवजे लोड नहीं करता है। OLLAMA_KEEP_ALIVE को उच्च सेट करें और मॉडल निवासी रहता है जब तक VRAM दबाव इसे निष्कासित करने के लिए मजबूर करता है।

http://localhost:11434/v1 पर OpenAI-संगत अंतिम बिंदु का मतलब है हर IDE प्लगइन, चैट फ्रंटएंड, और एजेंट फ्रेमवर्क जिसे हमने परीक्षण किया अनुकूलक के बिना जुड़ा। 24GB कार्ड पर हमने 7B चैट मॉडल और 3B कोड मॉडल को निवासी के साथ बहुत अतिरिक्त जगह के साथ रखा।

जहाँ यह कम पड़ता है: कोई GUI नहीं। मॉडल खोज Modelfile नामक एक पाठ फ़ाइल है। Windows GPU समर्थन मूल रिलीज के बाद से स्थिर रहा है, लेकिन यह अभी भी macOS के लिए पॉलिश में पिछड़ा है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: प्रकाशक साइट - GitHub

निष्कर्ष: पहले इसे स्थापित करें। भले ही आपका दैनिक चालक एक GUI ऐप है, आप शायद बैकएंड के रूप में Ollama चाहते हैं।

2. LM Studio, एक बार कई मॉडल रखने के लिए सर्वोत्तम GUI

LM Studio एक बिना-CLI उपयोगकर्ता को हाथ देने के लिए ऐप है जो अभी भी छोटे मॉडल ट्रिक चाहता है। 0.3 श्रृंखला ने एक ही विंडो में मल्टी-मॉडल समर्थन जोड़ा, इसलिए आप एक टैब में चैट मॉडल लोड कर सकते हैं, दूसरे में कोड मॉडल, और हर बार लोड प्रतीक्षा किए बिना उनके बीच फ्लिप करें। बिल्ट-इन सर्वर प्रति लोड मॉडल के लिए एक OpenAI-संगत अंतिम बिंदु को उजागर करता है, जिसका अर्थ है एक संपादक एक्सटेंशन कोड मॉडल को हिट कर सकता है जबकि आपकी चैट विंडो चैट मॉडल से बात करती रहती है।

मॉडल खोज Hugging Face के विरुद्ध एक खोज बॉक्स है जिसमें परिमाणीकरण पिकर और VRAM अनुमानक बनाए गए हैं। GUI प्रति मॉडल GPU ऑफलोड स्लाइडर दिखाता है, जो महत्वपूर्ण है जब आप एक कार्ड पर दो मध्यम आकार के मॉडल फिट करने की कोशिश कर रहे हैं।

जहाँ यह कम पड़ता है: ओपन सोर्स नहीं। मुफ्त लाइसेंस व्यक्तिगत उपयोग को कवर करता है, और काम के उपयोग के लिए एक अलग लाइसेंस है जिसे डाउनलोड प्रवाह आपको स्वीकार करने के लिए कहता है। कुछ परिमाणीकरण प्रारूप कच्चे llama.cpp में की तुलना में अधिक धीरे लोड होते हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: प्रकाशक साइट - GitHub

निष्कर्ष: सर्वश्रेष्ठ पिक यदि आप वास्तविक GUI, कई लोड मॉडल और टर्मिनल को छुए बिना काम करने वाले API सर्वर चाहते हैं।

3. Msty, समानांतर चैट और तुलना के लिए सर्वोत्तम

Msty ऐप है जिसने हमें कॉपी-पेस्ट करके मॉडल A/B परीक्षण करना बंद कर दिया। इसका विभाजित दृश्य आपको एक ही बार में दो, चार या आठ तक मॉडल को एक प्रॉम्प्ट भेजने देता है और साइड-बाय-साइड प्रतिक्रियाओं को पढ़ता है। यह वास्तव में वही वर्कफ़्लो है जिसे आप चाहते हैं जब आप यह पता लगाने की कोशिश कर रहे हैं कि कौन सा छोटा मॉडल लोड रखने लायक है। इसे Ollama की ओर इंगित करें और यह स्वचालित रूप से आपके स्थानीय मॉडल को विरासत में देता है। इसे OpenAI या Anthropic कुंजियों की ओर इंगित करें और स्थानीय बनाम एक ही दृश्य में होस्ट किए गए की तुलना करें।

Knowledge Stack सुविधा आपको दस्तावेज़ों और PDF के फ़ोल्डर को संलग्न करने और उन्हें मॉडल में क्वेरी करने देती है, जो एक छोटे चैट मॉडल प्लस एक छोटे एम्बेडिंग मॉडल को निवासी के साथ जोड़ा जाता है।

जहाँ यह कम पड़ता है: ओपन सोर्स नहीं। मुफ्त स्तर व्यक्तिगत उपयोग को कवर करता है, और Aurum अपग्रेड दो मॉडल के ऊपर विभाजित चैट, कार्यक्षेत्र सिंक और कुछ अन्य extras को अनलॉक करता है। GUI सुविधाओं से भरा है और सीखने के लिए एक सत्र लेता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: प्रकाशक साइट

निष्कर्ष: यह चुनें जब आपको वास्तव में दो मॉडल को एक ही समय में एक ही प्रश्न का जवाब देते हुए देखना है।

4. Jan, सर्वोत्तम ओपन सोर्स मल्टी-मॉडल चैट क्लाइंट

Jan ओपन सोर्स विकल्प है यदि आप लाइसेंस सवाल के बिना LM Studio-शैली GUI चाहते हैं। यह अपने स्वयं के अनुमान इंजन के साथ आता है, Ollama या llama.cpp सर्वर के विरुद्ध चल सकता है, और आपको प्रति-वार्तालाप मॉडल स्वैप करने देता है। प्रत्येक थ्रेड को याद है कि कौन सा मॉडल, कौन सी प्रणाली प्रॉम्प्ट और कौन से पैरामीटर का उपयोग किया जा रहा था, इसलिए कोड थ्रेड और लेखन थ्रेड विभिन्न विशेषज्ञों की ओर इशारा कर सकते हैं एक दूसरे को दूषित किए बिना।

बिल्ट-इन स्थानीय सर्वर एक OpenAI-संगत अंतिम बिंदु को उजागर करता है, और ऐप स्वयं एक छोटे से एक्सटेंशन API के माध्यम से विस्तारित है। हमारे परीक्षण में, दो थ्रेड के बीच मॉडल स्वैप लगभग तत्काल था जब लक्ष्य पहले से लोड था और लगभग तीन से आठ सेकंड जब इसे NVMe पर डिस्क से लोड करना था।

जहाँ यह कम पड़ता है: अभी तक अपने स्वयं के इंजन में कई मॉडलों को निवासी नहीं रख सकता। यदि आप एक बार दो लोड चाहते हैं, इसे Ollama की ओर इंगित करें और Ollama को निवासी प्रबंधन करने दें। Windows पर GPU त्वरण अभी भी कुछ परिमाणीकरण प्रारूपों के लिए macOS बिल्ड के पीछे है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: प्रकाशक साइट - GitHub

निष्कर्ष: सही पिक यदि ओपन सोर्स महत्वपूर्ण है और आप CLI काम के बिना प्रति-थ्रेड मॉडल रूटिंग चाहते हैं।

5. Open WebUI, Ollama पर सर्वोत्तम रूटिंग परत

Open WebUI Ollama WebUI के रूप में ब्रांडेड होता था, और एक स्व-होस्ट स्थानीय स्टैक के लिए सबसे पूर्ण वेब फ्रंटएंड बना रहता है। यह यहाँ की जगह अर्जित करता है इसकी पाइपलाइन प्रणाली: आप ऐसी स्क्रिप्टें परिभाषित कर सकते हैं जो प्रॉम्प्ट सामग्री, संदेश इतिहास या संलग्न फ़ाइलों के आधार पर प्रति अनुरोध मॉडल चुनती हैं। उत्कृष्ट उदाहरण एक रूटिंग पाइपलाइन है जो कोड ब्लॉक से शुरू होने वाली कोई भी चीज़ को अपने कोडर मॉडल को भेजता है और बाकी सब कुछ अपने चैट मॉडल को, एक वार्तालाप के अंदर सब कुछ।

यह एक एकल संदेश में समानांतर मॉडल प्रतिक्रियाओं, प्लस अपनी स्वयं की दस्तावेज़ स्टोर के साथ RAG, प्लस फ़ंक्शन कॉलिंग को भी समर्थन करता है। क्योंकि यह अपने LAN पर सब कुछ को उजागर करता है, तहखाने में एक Ollama बॉक्स घर में हर मशीन को rerouted मल्टी-मॉडल चैट प्रदान कर सकता है।

जहाँ यह कम पड़ता है: वेब-प्रथम। कोई मूल डेस्कटॉप क्लाइंट नहीं, तो आप या तो इसे ब्राउज़र में स्थानीय रूप से चलाते हैं या सर्वर पर स्व-होस्ट करते हैं। सेटअप Docker या Python के लिए पूछता है, डबल-क्लिक इंस्टॉलर नहीं।

मूल्य निर्धारण:

प्लेटफॉर्म: जहाँ भी Docker या Python चलता है। Windows, macOS, Linux पर ब्राउज़र के माध्यम से एक्सेस।

डाउनलोड: प्रकाशक साइट - GitHub

निष्कर्ष: इसका उपयोग करें जब आप प्रोग्रामेबल रूटिंग चाहते हैं और पाँच मिनट के Docker इंस्टॉल से सहज हैं।

6. LocalAI, मॉडल परिवारों में सर्वोत्तम ड्रॉप-इन API रूटर

LocalAI एक विशेष समस्या का उत्तर है। आपके पास GGUF में चैट मॉडल है, प्रतिलेखन के लिए whisper मॉडल, प्रसार के लिए छवि मॉडल और एक छोटा एम्बेडिंग मॉडल, और आप चाहते हैं कि एक अंतिम बिंदु सभी के लिए OpenAI-संगत बोले। यह प्रत्येक बैकएंड को अपने worker में चलाता है, अनुरोधों को मॉडल नाम के अनुसार रूट करता है, और होस्ट किए गए API की तरह ही आकार में प्रतिक्रियाएं देता है। आपका Continue प्लगइन, आपका नोट्स टूल और आपकी कस्टम स्क्रिप्ट सभी समान URL की ओर इशारा करते हैं और नाम के अनुसार अपने मॉडल को चुनते हैं।

दो-छोटे-मॉडल पैटर्न के लिए, इसका मतलब वर्कफ़्लो की तरह है Continue पूछ रहा है qwen-coder-3b जबकि आपके नोट्स ऐप पूछ रहा है llama-3.2-3b, दोनों एक ही प्रॉक्सी से परोसे गए, दोनों गर्म-लोड योग्य, दोनों अलग-थलग ताकि भारी एम्बेड काम चैट को नहीं रोकता है।

जहाँ यह कम पड़ता है: सेटअप Ollama की तुलना में भारी है। मॉडल कॉन्फ़िगरेशन प्रति बैकएंड YAML है। GPU त्वरण काम करता है लेकिन आपने क्या इंस्टॉल किया है इसके बारे में कुछ ज्ञान चाहता है। प्रलेखन thorough है लेकिन मानता है कि आप पहले से जानते हैं कि OpenAI-संगत payload कैसा दिखता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux, Docker।

डाउनलोड: प्रकाशक साइट - GitHub

निष्कर्ष: सही विकल्प जब आप एक स्थानीय API चाहते हैं जो टेक्स्ट, दृष्टि, ऑडियो और एम्बेडिंग में बोले अलग सर्वरों को एक साथ गोंद के बिना।

7. LiteLLM, कार्य रूटिंग के लिए सर्वोत्तम क्रॉस-बैकएंड प्रॉक्सी

LiteLLM एक Python SDK के रूप में शुरू हुआ सौ मॉडल प्रदाताओं को एक इंटरफेस के साथ बुलाने के लिए, और इसका प्रॉक्सी सर्वर यह है जो स्थानीय-पहली सूची पर यहाँ की जगह अर्जित करता है। इसे Ollama, LM Studio, LocalAI या किसी मिश्रण के सामने चलाएं, और क्लाइंट इसके साथ एक OpenAI-संगत payload के साथ बात करते हैं। यह अनुरोध को उस बैकएंड के लिए फिर से लिखता है जो अनुरोधित मॉडल नाम के पीछे है। इसका मतलब है एक अंतिम बिंदु chat को आपके स्थानीय Llama को रूट करता है और code को आपके स्थानीय Qwen Coder को, समान टूल के साथ दोनों को बिना जाने कि प्रत्येक कहाँ रहता है।

यह fallbacks, retries, rate limits और प्रति-कुंजी बजट को भी संभालता है, जो महत्वपूर्ण है जब आप अपने GPU को साझा करने के लिए एक से अधिक ऐप्स को अनुमति देना शुरू करते हैं।

जहाँ यह कम पड़ता है: यह एक प्रॉक्सी है, रनर नहीं। आप अभी भी वास्तव में मॉडलों को परोसने के लिए बैकएंड के पीछे Ollama या LocalAI की जरूरत है। कॉन्फ़िगरेशन YAML फ़ाइल है। पॉलिश्ड डैशबोर्ड प्रबंधित क्लाउड स्तर में बैठता है, इसलिए स्व-होस्टर्स मुफ्त UI प्लस कॉन्फ़िग फ़ाइलों पर निर्भर करते हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux, Docker।

डाउनलोड: प्रकाशक साइट - GitHub

निष्कर्ष: यह उस दिन जोड़ें जब आपके पास एक से अधिक ऐप एक से अधिक स्थानीय मॉडलों को दबा रहे हैं और आप नाम, रूटिंग और सीमाओं के लिए एक सत्य का स्रोत चाहते हैं।

सही कैसे चुनें

यदि आप छोटे-मॉडल ट्रिक के लिए न्यूनतम सेटअप चाहते हैं, Ollama चलाएं और हो गया। 3B चैट मॉडल और 3B कोड मॉडल खींचें, daemon को एक को गर्म रखने दें जबकि आप दूसरे का उपयोग करते हैं, और अपने संपादक को स्थानीय अंतिम बिंदु की ओर इंगित करें।

यदि आप GUI चाहते हैं और कोई टर्मिनल नहीं, LM Studio स्थापित करें। दो टैब में दो मॉडल लोड करें और API की जरूरत वाली किसी भी चीज़ के लिए इसके बिल्ट-इन सर्वर का उपयोग करें।

यदि आप वास्तव में उन्हें VRAM प्रतिबद्ध करने से पहले मॉडलों की तुलना करना चाहते हैं, Msty का उपयोग करें और उम्मीदवारों में समान प्रॉम्प्ट को विभाजित करें जब तक एक जीत न जाए।

यदि आप GUI और ओपन सोर्स चाहते हैं, Ollama के ऊपर Jan चलाएं।

यदि आप प्रॉम्प्ट सामग्री के अनुसार रूट करना चाहते हैं ऐप के बजाय, Ollama के सामने Open WebUI को स्व-होस्ट करें और एक पाइपलाइन लिखें।

यदि आपके कार्यभार में दृष्टि, प्रतिलेखन या चैट के साथ एम्बेडिंग शामिल है, LocalAI को बीच में रखें और एक API को सब कुछ परोसने दें।

यदि आपके पास पहले से तीन उपकरण दो मॉडलों को दबा रहे हैं और यह गड़बड़ी हो रही है, सामने LiteLLM को बंद करें और सब कुछ भूमिका के अनुसार पुनः नाम दें।

सामान्य प्रश्न

क्या मैं वास्तव में एक बार दो स्थानीय AI मॉडल चला सकता हूँ?

हाँ, किसी भी GPU पर दोनों को रखने के लिए पर्याप्त VRAM के साथ। दो 3B या 4B क्वांटाइज्ड मॉडल 12GB कार्ड पर आराम से फिट करते हैं। Ollama और LM Studio दोनों को निवासी रख सकते हैं, और जो भी निष्क्रिय है उसके अनुरोध ठंड लोड के बिना तुरंत लौटते हैं। XDA लेख जिसने इसे प्रेरित किया एक काम का उदाहरण है, सैद्धांतिक नहीं।

एक बड़ा स्थानीय AI मॉडल हमेशा दो छोटे से बेहतर है?

असल कार्यप्रवाह के लिए नहीं। एकल 8B मॉडल को एक सामान्यज्ञ होना चाहिए, जिसका अर्थ है कि यह एक औसत दर्जे का कोडर और औसत दर्जे का लेखक है। दो 3B मॉडल उनकी विशेषज्ञता के लिए चुने गए (कहते हैं कि एक कोडर मॉडल प्लस चैट मॉडल) अक्सर प्रत्येक विशेषज्ञ कार्य पर बड़े एकल मॉडल को हराते हैं, विशेष रूप से सही रूटिंग के साथ। एकमात्र स्थान जहाँ बड़ा एकल मॉडल अभी भी जीतता है गहरी तर्क एक एकल कठिन प्रश्न पर है जिसे लंबे संदर्भ की जरूरत है।

डेस्कटॉप पर कई स्थानीय मॉडल चलाने के लिए सर्वोत्तम मुफ्त ऐप क्या है?

Daemon और API के लिए Ollama। जब आप GUI या प्रोग्रामेबल रूटिंग चाहते हैं तो Jan या Open WebUI को शीर्ष पर जोड़ें। तीनों ओपन सोर्स और बिना सीट सीमा के मुफ्त हैं।

क्या LM Studio आपको एक बार दो मॉडल चलाने देता है?

हाँ, 0.3 श्रृंखला के बाद से यह टैब के साथ एक ही सत्र में कई मॉडलों को लोड करने को समर्थन करता है, और बिल्ट-इन OpenAI-संगत सर्वर प्रत्येक लोड मॉडल को अलग अंतिम बिंदु के रूप में उजागर करता है। मुख्य सीमा VRAM है।

दो स्थानीय AI मॉडल चलाने के लिए मुझे कितना VRAM चाहिए?

दो 3B या 4B क्वांटाइज्ड मॉडलों के लिए आरामदायक न्यूनतम 12GB है। 8GB कार्ड पर आप Q4 में दो बहुत छोटे मॉडल को मुश्किल से चला सकते हैं, लेकिन आप कुछ समवर्ती headroom खो देंगे। 7B प्लस 3B निवासी एक साथ रखने के लिए, 16GB और ऊपर की योजना बनाएं।

Ollama और LocalAI में क्या अंतर है?

Ollama llama.cpp के चारों ओर केंद्रीभूत रनर है जिसमें स्वच्छ CLI, पाठ-मॉडल कैटलॉग और OpenAI-संगत अंतिम बिंदु है। LocalAI व्यापक API परत है जो एक बार में कई बैकएंड का सामना कर सकती है, पाठ, छवि, ऑडियो और एम्बेडिंग सहित, प्रति-बैकएंड YAML कॉन्फ़िग के साथ। Ollama शुरू करना आसान है। LocalAI वह है जिसे आप तब तक पहुँचते हैं जब आपका वर्कफ़्लो चैट से अधिक है।