डेस्कटॉप पर कई स्थानीय AI मॉडल चलाने के लिए सर्वोत्तम ऐप्स वे हैं जो आपके GPU को एकल-स्लॉट कार्ट्रिज कंसोल के रूप में मानना बंद कर देते हैं। बड़े स्थानीय मॉडल के पीछे भागना बंद करने वाले एक लेखक के एक हाल के XDA लेख ने इसे स्पष्ट रूप से कहा: दो 2GB मॉडल एक साथ चल रहे हैं एक 8GB मॉडल को हराते हैं, क्योंकि प्रत्येक छोटा मॉडल एक विशिष्ट कार्य के लिए चुना गया था। एक 3B कोड मॉडल ऑटो-पूर्ण को संभालता था। एक 3B चैट मॉडल बातचीत को संभालता था। कोई भी सर्वकार्य नहीं होना था।
यह वह पैटर्न है जिसकी हम यहाँ परवाह करते हैं। बेंचमार्क-पीछा नहीं। रूटिंग। हमने पिछले कुछ हफ्तों में सात डेस्कटॉप रनर और ऑर्केस्ट्रेटर का परीक्षण किया, मापा कि वे कितनी जल्दी मॉडल स्वैप करते हैं, जांचा कि क्या वे एक साथ दो को लोड रख सकते हैं, और रूटिंग कितनी उपयोगी है इसका मूल्यांकन किया। यह सूची किसी के लिए भी है जिसके पास 12GB से 24GB कार्ड है जो एक वास्तविक सहायक प्लस एक कोड मॉडल प्लस शायद एक दृष्टि मॉडल चाहता है, सब एक मशीन पर।
एक स्थानीय मल्टी-मॉडल रनर में क्या देखें
छह चीजें उन उपकरणों को अलग करती हैं जो मल्टी-मॉडल वर्कफ़्लो को सुखद बनाती हैं उन से जो आपको एकल-मॉडल रूट में मजबूर करती हैं।
- हॉट-स्वैप गति। जब आप सत्र के बीच मॉडल स्विच करते हैं, क्या ऐप पुराने को अनलोड करता है और नए को कुछ सेकंड में लोड करता है, या क्या यह हर बार एक ठंड शुरुआत पर फंस जाता है।
- समवर्ती स्लॉट। कुछ उपकरण दो या तीन मॉडल निवासी रख सकते हैं ताकि प्रतिक्रियाएं तुरंत लगें। दूसरे एक को लोड करते हैं, इसे निष्कासित करते हैं, अगले को लोड करते हैं।
- रूटिंग। क्या आप चैट, ऑटो-पूर्ण, एम्बेडिंग और दृष्टि को विभिन्न बैकएंड की ओर इंगित कर सकते हैं प्रत्येक अनुरोध पर कॉन्फ़िग संपादित किए बिना।
- OpenAI-संगत API। ऐप्स जो एक OpenAI-शैली अंतिम बिंदु को उजागर करते हैं सीधे IDE एक्सटेंशन, नोट टूल्स और ऑर्केस्ट्रेटर में प्लग करते हैं।
- समानांतर चैट। एक ही प्रॉम्प्ट को दो मॉडल भेजने और एक विंडो में परिणाम तुलना करने में सक्षम होना विशेषज्ञ चुनने के लिए वास्तव में उपयोगी है।
- क्रॉस-प्लेटफॉर्म डेस्कटॉप। समान फ़ीचर सेट के साथ Windows, macOS और Linux समर्थन महत्वपूर्ण है यदि आपका सेटअप मशीनों को मिलाता है।
त्वरित तुलना
| ऐप | के लिए सर्वोत्तम | प्लेटफॉर्म | मुफ्त योजना | सशुल्क स्तर | मल्टी-मॉडल कहानी |
|---|---|---|---|---|---|
| Ollama | आधारभूत रनर और API परत | Windows, macOS, Linux | पूरी तरह मुफ्त, ओपन सोर्स | कोई नहीं | मांग पर हॉट-स्वैप, हाल के मॉडल को गर्म रखता है |
| LM Studio | GUI मल्टी-मॉडल टैब | Windows, macOS, Linux | व्यक्तिगत उपयोग के लिए मुफ्त | काम के लिए टीम लाइसेंस | एक बार कई मॉडल लोड करें, टैब स्विच करें |
| Msty | मॉडल में समानांतर चैट | Windows, macOS, Linux | मुफ्त स्तर | Aurum आजीवन लाइसेंस | आठ तक मॉडल से साइड-बाय-साइड प्रतिक्रियाएं |
| Jan | ओपन सोर्स मल्टी-मॉडल चैट क्लाइंट | Windows, macOS, Linux | पूरी तरह मुफ्त, ओपन सोर्स | कोई नहीं | प्रति वार्तालाप स्वैप, OpenAI-संगत सर्वर |
| Open WebUI | Ollama पर पाइपलाइन रूटिंग परत | वेब UI, स्व-होस्ट किए गए | पूरी तरह मुफ्त, ओपन सोर्स | कोई नहीं | प्रति अनुरोध मॉडल चुनाव, पाइपलाइन स्क्रिप्टिंग |
| LocalAI | ड्रॉप-इन API रूटर | Windows, macOS, Linux, Docker | पूरी तरह मुफ्त, ओपन सोर्स | कोई नहीं | एक अंतिम बिंदु कई बैकएंड और प्रारूपों को रूट करता है |
| LiteLLM | क्रॉस-बैकएंड प्रॉक्सी | Windows, macOS, Linux | पूरी तरह मुफ्त, ओपन सोर्स | प्रबंधित क्लाउड स्तर | मॉडल नाम से किसी भी स्थानीय या दूरस्थ प्रदाता को रूट करता है |
ऐप्स
1. Ollama, स्थानीय मॉडल हॉट-स्वैपिंग के लिए सर्वोत्तम
Ollama एक ऐप है जिस पर इस सूची का अधिकांश हिस्सा निर्भर करता है, और अच्छे कारण के लिए। इसकी CLI और llama.cpp के चारों ओर API मॉडल प्रबंधन को docker pull जैसा लगता है, और इसका कई मॉडल के साथ व्यवहार कारण है कि दो-छोटे-मॉडल वर्कफ़्लो पहली बार क्यों काम करते हैं। ollama run llama3.2:3b चैट के लिए चलाएं और ollama run qwen2.5-coder:3b ऑटो-पूर्ण के लिए, और daemon हाल ही में उपयोग किए गए को गर्म रखता है जबकि दूसरे को लोड करता है। डिफ़ॉल्ट कीप-अलाइव पाँच मिनट है, इसलिए जल्दी वापस स्विच मुआवजे लोड नहीं करता है। OLLAMA_KEEP_ALIVE को उच्च सेट करें और मॉडल निवासी रहता है जब तक VRAM दबाव इसे निष्कासित करने के लिए मजबूर करता है।
http://localhost:11434/v1 पर OpenAI-संगत अंतिम बिंदु का मतलब है हर IDE प्लगइन, चैट फ्रंटएंड, और एजेंट फ्रेमवर्क जिसे हमने परीक्षण किया अनुकूलक के बिना जुड़ा। 24GB कार्ड पर हमने 7B चैट मॉडल और 3B कोड मॉडल को निवासी के साथ बहुत अतिरिक्त जगह के साथ रखा।
जहाँ यह कम पड़ता है: कोई GUI नहीं। मॉडल खोज Modelfile नामक एक पाठ फ़ाइल है। Windows GPU समर्थन मूल रिलीज के बाद से स्थिर रहा है, लेकिन यह अभी भी macOS के लिए पॉलिश में पिछड़ा है।
मूल्य निर्धारण:
- मुफ्त: सब कुछ, MIT के तहत ओपन सोर्स।
- सशुल्क: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: प्रकाशक साइट - GitHub
निष्कर्ष: पहले इसे स्थापित करें। भले ही आपका दैनिक चालक एक GUI ऐप है, आप शायद बैकएंड के रूप में Ollama चाहते हैं।
2. LM Studio, एक बार कई मॉडल रखने के लिए सर्वोत्तम GUI
LM Studio एक बिना-CLI उपयोगकर्ता को हाथ देने के लिए ऐप है जो अभी भी छोटे मॉडल ट्रिक चाहता है। 0.3 श्रृंखला ने एक ही विंडो में मल्टी-मॉडल समर्थन जोड़ा, इसलिए आप एक टैब में चैट मॉडल लोड कर सकते हैं, दूसरे में कोड मॉडल, और हर बार लोड प्रतीक्षा किए बिना उनके बीच फ्लिप करें। बिल्ट-इन सर्वर प्रति लोड मॉडल के लिए एक OpenAI-संगत अंतिम बिंदु को उजागर करता है, जिसका अर्थ है एक संपादक एक्सटेंशन कोड मॉडल को हिट कर सकता है जबकि आपकी चैट विंडो चैट मॉडल से बात करती रहती है।
मॉडल खोज Hugging Face के विरुद्ध एक खोज बॉक्स है जिसमें परिमाणीकरण पिकर और VRAM अनुमानक बनाए गए हैं। GUI प्रति मॉडल GPU ऑफलोड स्लाइडर दिखाता है, जो महत्वपूर्ण है जब आप एक कार्ड पर दो मध्यम आकार के मॉडल फिट करने की कोशिश कर रहे हैं।
जहाँ यह कम पड़ता है: ओपन सोर्स नहीं। मुफ्त लाइसेंस व्यक्तिगत उपयोग को कवर करता है, और काम के उपयोग के लिए एक अलग लाइसेंस है जिसे डाउनलोड प्रवाह आपको स्वीकार करने के लिए कहता है। कुछ परिमाणीकरण प्रारूप कच्चे llama.cpp में की तुलना में अधिक धीरे लोड होते हैं।
मूल्य निर्धारण:
- मुफ्त: व्यक्तिगत उपयोग, समय सीमा नहीं।
- सशुल्क: प्रति-सीट शर्तों के साथ अलग काम लाइसेंस, संपर्क आवश्यक।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: प्रकाशक साइट - GitHub
निष्कर्ष: सर्वश्रेष्ठ पिक यदि आप वास्तविक GUI, कई लोड मॉडल और टर्मिनल को छुए बिना काम करने वाले API सर्वर चाहते हैं।
3. Msty, समानांतर चैट और तुलना के लिए सर्वोत्तम
Msty ऐप है जिसने हमें कॉपी-पेस्ट करके मॉडल A/B परीक्षण करना बंद कर दिया। इसका विभाजित दृश्य आपको एक ही बार में दो, चार या आठ तक मॉडल को एक प्रॉम्प्ट भेजने देता है और साइड-बाय-साइड प्रतिक्रियाओं को पढ़ता है। यह वास्तव में वही वर्कफ़्लो है जिसे आप चाहते हैं जब आप यह पता लगाने की कोशिश कर रहे हैं कि कौन सा छोटा मॉडल लोड रखने लायक है। इसे Ollama की ओर इंगित करें और यह स्वचालित रूप से आपके स्थानीय मॉडल को विरासत में देता है। इसे OpenAI या Anthropic कुंजियों की ओर इंगित करें और स्थानीय बनाम एक ही दृश्य में होस्ट किए गए की तुलना करें।
Knowledge Stack सुविधा आपको दस्तावेज़ों और PDF के फ़ोल्डर को संलग्न करने और उन्हें मॉडल में क्वेरी करने देती है, जो एक छोटे चैट मॉडल प्लस एक छोटे एम्बेडिंग मॉडल को निवासी के साथ जोड़ा जाता है।
जहाँ यह कम पड़ता है: ओपन सोर्स नहीं। मुफ्त स्तर व्यक्तिगत उपयोग को कवर करता है, और Aurum अपग्रेड दो मॉडल के ऊपर विभाजित चैट, कार्यक्षेत्र सिंक और कुछ अन्य extras को अनलॉक करता है। GUI सुविधाओं से भरा है और सीखने के लिए एक सत्र लेता है।
मूल्य निर्धारण:
- मुफ्त: ठोस व्यक्तिगत स्तर द्विमुखी विभाजन चैट और स्थानीय मॉडल के साथ।
- सशुल्क: Aurum आजीवन लाइसेंस व्यापक मल्टी-मॉडल दृश्य और सिंक को अनलॉक करता है।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: प्रकाशक साइट
निष्कर्ष: यह चुनें जब आपको वास्तव में दो मॉडल को एक ही समय में एक ही प्रश्न का जवाब देते हुए देखना है।
4. Jan, सर्वोत्तम ओपन सोर्स मल्टी-मॉडल चैट क्लाइंट
Jan ओपन सोर्स विकल्प है यदि आप लाइसेंस सवाल के बिना LM Studio-शैली GUI चाहते हैं। यह अपने स्वयं के अनुमान इंजन के साथ आता है, Ollama या llama.cpp सर्वर के विरुद्ध चल सकता है, और आपको प्रति-वार्तालाप मॉडल स्वैप करने देता है। प्रत्येक थ्रेड को याद है कि कौन सा मॉडल, कौन सी प्रणाली प्रॉम्प्ट और कौन से पैरामीटर का उपयोग किया जा रहा था, इसलिए कोड थ्रेड और लेखन थ्रेड विभिन्न विशेषज्ञों की ओर इशारा कर सकते हैं एक दूसरे को दूषित किए बिना।
बिल्ट-इन स्थानीय सर्वर एक OpenAI-संगत अंतिम बिंदु को उजागर करता है, और ऐप स्वयं एक छोटे से एक्सटेंशन API के माध्यम से विस्तारित है। हमारे परीक्षण में, दो थ्रेड के बीच मॉडल स्वैप लगभग तत्काल था जब लक्ष्य पहले से लोड था और लगभग तीन से आठ सेकंड जब इसे NVMe पर डिस्क से लोड करना था।
जहाँ यह कम पड़ता है: अभी तक अपने स्वयं के इंजन में कई मॉडलों को निवासी नहीं रख सकता। यदि आप एक बार दो लोड चाहते हैं, इसे Ollama की ओर इंगित करें और Ollama को निवासी प्रबंधन करने दें। Windows पर GPU त्वरण अभी भी कुछ परिमाणीकरण प्रारूपों के लिए macOS बिल्ड के पीछे है।
मूल्य निर्धारण:
- मुफ्त: सब कुछ, AGPL के तहत ओपन सोर्स।
- सशुल्क: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: प्रकाशक साइट - GitHub
निष्कर्ष: सही पिक यदि ओपन सोर्स महत्वपूर्ण है और आप CLI काम के बिना प्रति-थ्रेड मॉडल रूटिंग चाहते हैं।
5. Open WebUI, Ollama पर सर्वोत्तम रूटिंग परत
Open WebUI Ollama WebUI के रूप में ब्रांडेड होता था, और एक स्व-होस्ट स्थानीय स्टैक के लिए सबसे पूर्ण वेब फ्रंटएंड बना रहता है। यह यहाँ की जगह अर्जित करता है इसकी पाइपलाइन प्रणाली: आप ऐसी स्क्रिप्टें परिभाषित कर सकते हैं जो प्रॉम्प्ट सामग्री, संदेश इतिहास या संलग्न फ़ाइलों के आधार पर प्रति अनुरोध मॉडल चुनती हैं। उत्कृष्ट उदाहरण एक रूटिंग पाइपलाइन है जो कोड ब्लॉक से शुरू होने वाली कोई भी चीज़ को अपने कोडर मॉडल को भेजता है और बाकी सब कुछ अपने चैट मॉडल को, एक वार्तालाप के अंदर सब कुछ।
यह एक एकल संदेश में समानांतर मॉडल प्रतिक्रियाओं, प्लस अपनी स्वयं की दस्तावेज़ स्टोर के साथ RAG, प्लस फ़ंक्शन कॉलिंग को भी समर्थन करता है। क्योंकि यह अपने LAN पर सब कुछ को उजागर करता है, तहखाने में एक Ollama बॉक्स घर में हर मशीन को rerouted मल्टी-मॉडल चैट प्रदान कर सकता है।
जहाँ यह कम पड़ता है: वेब-प्रथम। कोई मूल डेस्कटॉप क्लाइंट नहीं, तो आप या तो इसे ब्राउज़र में स्थानीय रूप से चलाते हैं या सर्वर पर स्व-होस्ट करते हैं। सेटअप Docker या Python के लिए पूछता है, डबल-क्लिक इंस्टॉलर नहीं।
मूल्य निर्धारण:
- मुफ्त: सब कुछ, BSD-3 शैली लाइसेंस के तहत ओपन सोर्स।
- सशुल्क: कोई नहीं।
प्लेटफॉर्म: जहाँ भी Docker या Python चलता है। Windows, macOS, Linux पर ब्राउज़र के माध्यम से एक्सेस।
डाउनलोड: प्रकाशक साइट - GitHub
निष्कर्ष: इसका उपयोग करें जब आप प्रोग्रामेबल रूटिंग चाहते हैं और पाँच मिनट के Docker इंस्टॉल से सहज हैं।
6. LocalAI, मॉडल परिवारों में सर्वोत्तम ड्रॉप-इन API रूटर
LocalAI एक विशेष समस्या का उत्तर है। आपके पास GGUF में चैट मॉडल है, प्रतिलेखन के लिए whisper मॉडल, प्रसार के लिए छवि मॉडल और एक छोटा एम्बेडिंग मॉडल, और आप चाहते हैं कि एक अंतिम बिंदु सभी के लिए OpenAI-संगत बोले। यह प्रत्येक बैकएंड को अपने worker में चलाता है, अनुरोधों को मॉडल नाम के अनुसार रूट करता है, और होस्ट किए गए API की तरह ही आकार में प्रतिक्रियाएं देता है। आपका Continue प्लगइन, आपका नोट्स टूल और आपकी कस्टम स्क्रिप्ट सभी समान URL की ओर इशारा करते हैं और नाम के अनुसार अपने मॉडल को चुनते हैं।
दो-छोटे-मॉडल पैटर्न के लिए, इसका मतलब वर्कफ़्लो की तरह है Continue पूछ रहा है qwen-coder-3b जबकि आपके नोट्स ऐप पूछ रहा है llama-3.2-3b, दोनों एक ही प्रॉक्सी से परोसे गए, दोनों गर्म-लोड योग्य, दोनों अलग-थलग ताकि भारी एम्बेड काम चैट को नहीं रोकता है।
जहाँ यह कम पड़ता है: सेटअप Ollama की तुलना में भारी है। मॉडल कॉन्फ़िगरेशन प्रति बैकएंड YAML है। GPU त्वरण काम करता है लेकिन आपने क्या इंस्टॉल किया है इसके बारे में कुछ ज्ञान चाहता है। प्रलेखन thorough है लेकिन मानता है कि आप पहले से जानते हैं कि OpenAI-संगत payload कैसा दिखता है।
मूल्य निर्धारण:
- मुफ्त: सब कुछ, MIT के तहत ओपन सोर्स।
- सशुल्क: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux, Docker।
डाउनलोड: प्रकाशक साइट - GitHub
निष्कर्ष: सही विकल्प जब आप एक स्थानीय API चाहते हैं जो टेक्स्ट, दृष्टि, ऑडियो और एम्बेडिंग में बोले अलग सर्वरों को एक साथ गोंद के बिना।
7. LiteLLM, कार्य रूटिंग के लिए सर्वोत्तम क्रॉस-बैकएंड प्रॉक्सी
LiteLLM एक Python SDK के रूप में शुरू हुआ सौ मॉडल प्रदाताओं को एक इंटरफेस के साथ बुलाने के लिए, और इसका प्रॉक्सी सर्वर यह है जो स्थानीय-पहली सूची पर यहाँ की जगह अर्जित करता है। इसे Ollama, LM Studio, LocalAI या किसी मिश्रण के सामने चलाएं, और क्लाइंट इसके साथ एक OpenAI-संगत payload के साथ बात करते हैं। यह अनुरोध को उस बैकएंड के लिए फिर से लिखता है जो अनुरोधित मॉडल नाम के पीछे है। इसका मतलब है एक अंतिम बिंदु chat को आपके स्थानीय Llama को रूट करता है और code को आपके स्थानीय Qwen Coder को, समान टूल के साथ दोनों को बिना जाने कि प्रत्येक कहाँ रहता है।
यह fallbacks, retries, rate limits और प्रति-कुंजी बजट को भी संभालता है, जो महत्वपूर्ण है जब आप अपने GPU को साझा करने के लिए एक से अधिक ऐप्स को अनुमति देना शुरू करते हैं।
जहाँ यह कम पड़ता है: यह एक प्रॉक्सी है, रनर नहीं। आप अभी भी वास्तव में मॉडलों को परोसने के लिए बैकएंड के पीछे Ollama या LocalAI की जरूरत है। कॉन्फ़िगरेशन YAML फ़ाइल है। पॉलिश्ड डैशबोर्ड प्रबंधित क्लाउड स्तर में बैठता है, इसलिए स्व-होस्टर्स मुफ्त UI प्लस कॉन्फ़िग फ़ाइलों पर निर्भर करते हैं।
मूल्य निर्धारण:
- मुफ्त: ओपन-सोर्स प्रॉक्सी, असीमित स्थानीय उपयोग।
- सशुल्क: होस्ट किए गए नियंत्रण विमान टीम सुविधाओं के साथ, उपयोग के अनुसार बिल किया गया।
प्लेटफॉर्म: Windows, macOS, Linux, Docker।
डाउनलोड: प्रकाशक साइट - GitHub
निष्कर्ष: यह उस दिन जोड़ें जब आपके पास एक से अधिक ऐप एक से अधिक स्थानीय मॉडलों को दबा रहे हैं और आप नाम, रूटिंग और सीमाओं के लिए एक सत्य का स्रोत चाहते हैं।
सही कैसे चुनें
यदि आप छोटे-मॉडल ट्रिक के लिए न्यूनतम सेटअप चाहते हैं, Ollama चलाएं और हो गया। 3B चैट मॉडल और 3B कोड मॉडल खींचें, daemon को एक को गर्म रखने दें जबकि आप दूसरे का उपयोग करते हैं, और अपने संपादक को स्थानीय अंतिम बिंदु की ओर इंगित करें।
यदि आप GUI चाहते हैं और कोई टर्मिनल नहीं, LM Studio स्थापित करें। दो टैब में दो मॉडल लोड करें और API की जरूरत वाली किसी भी चीज़ के लिए इसके बिल्ट-इन सर्वर का उपयोग करें।
यदि आप वास्तव में उन्हें VRAM प्रतिबद्ध करने से पहले मॉडलों की तुलना करना चाहते हैं, Msty का उपयोग करें और उम्मीदवारों में समान प्रॉम्प्ट को विभाजित करें जब तक एक जीत न जाए।
यदि आप GUI और ओपन सोर्स चाहते हैं, Ollama के ऊपर Jan चलाएं।
यदि आप प्रॉम्प्ट सामग्री के अनुसार रूट करना चाहते हैं ऐप के बजाय, Ollama के सामने Open WebUI को स्व-होस्ट करें और एक पाइपलाइन लिखें।
यदि आपके कार्यभार में दृष्टि, प्रतिलेखन या चैट के साथ एम्बेडिंग शामिल है, LocalAI को बीच में रखें और एक API को सब कुछ परोसने दें।
यदि आपके पास पहले से तीन उपकरण दो मॉडलों को दबा रहे हैं और यह गड़बड़ी हो रही है, सामने LiteLLM को बंद करें और सब कुछ भूमिका के अनुसार पुनः नाम दें।
सामान्य प्रश्न
क्या मैं वास्तव में एक बार दो स्थानीय AI मॉडल चला सकता हूँ?
हाँ, किसी भी GPU पर दोनों को रखने के लिए पर्याप्त VRAM के साथ। दो 3B या 4B क्वांटाइज्ड मॉडल 12GB कार्ड पर आराम से फिट करते हैं। Ollama और LM Studio दोनों को निवासी रख सकते हैं, और जो भी निष्क्रिय है उसके अनुरोध ठंड लोड के बिना तुरंत लौटते हैं। XDA लेख जिसने इसे प्रेरित किया एक काम का उदाहरण है, सैद्धांतिक नहीं।
एक बड़ा स्थानीय AI मॉडल हमेशा दो छोटे से बेहतर है?
असल कार्यप्रवाह के लिए नहीं। एकल 8B मॉडल को एक सामान्यज्ञ होना चाहिए, जिसका अर्थ है कि यह एक औसत दर्जे का कोडर और औसत दर्जे का लेखक है। दो 3B मॉडल उनकी विशेषज्ञता के लिए चुने गए (कहते हैं कि एक कोडर मॉडल प्लस चैट मॉडल) अक्सर प्रत्येक विशेषज्ञ कार्य पर बड़े एकल मॉडल को हराते हैं, विशेष रूप से सही रूटिंग के साथ। एकमात्र स्थान जहाँ बड़ा एकल मॉडल अभी भी जीतता है गहरी तर्क एक एकल कठिन प्रश्न पर है जिसे लंबे संदर्भ की जरूरत है।
डेस्कटॉप पर कई स्थानीय मॉडल चलाने के लिए सर्वोत्तम मुफ्त ऐप क्या है?
Daemon और API के लिए Ollama। जब आप GUI या प्रोग्रामेबल रूटिंग चाहते हैं तो Jan या Open WebUI को शीर्ष पर जोड़ें। तीनों ओपन सोर्स और बिना सीट सीमा के मुफ्त हैं।
क्या LM Studio आपको एक बार दो मॉडल चलाने देता है?
हाँ, 0.3 श्रृंखला के बाद से यह टैब के साथ एक ही सत्र में कई मॉडलों को लोड करने को समर्थन करता है, और बिल्ट-इन OpenAI-संगत सर्वर प्रत्येक लोड मॉडल को अलग अंतिम बिंदु के रूप में उजागर करता है। मुख्य सीमा VRAM है।
दो स्थानीय AI मॉडल चलाने के लिए मुझे कितना VRAM चाहिए?
दो 3B या 4B क्वांटाइज्ड मॉडलों के लिए आरामदायक न्यूनतम 12GB है। 8GB कार्ड पर आप Q4 में दो बहुत छोटे मॉडल को मुश्किल से चला सकते हैं, लेकिन आप कुछ समवर्ती headroom खो देंगे। 7B प्लस 3B निवासी एक साथ रखने के लिए, 16GB और ऊपर की योजना बनाएं।
Ollama और LocalAI में क्या अंतर है?
Ollama llama.cpp के चारों ओर केंद्रीभूत रनर है जिसमें स्वच्छ CLI, पाठ-मॉडल कैटलॉग और OpenAI-संगत अंतिम बिंदु है। LocalAI व्यापक API परत है जो एक बार में कई बैकएंड का सामना कर सकती है, पाठ, छवि, ऑडियो और एम्बेडिंग सहित, प्रति-बैकएंड YAML कॉन्फ़िग के साथ। Ollama शुरू करना आसान है। LocalAI वह है जिसे आप तब तक पहुँचते हैं जब आपका वर्कफ़्लो चैट से अधिक है।