XDA ने इस महीने एक लेख प्रकाशित किया जिसमें तर्क दिया गया कि एक छोटा स्थानीय एआई स्टैक एक अधिक उत्पादक स्थानीय एआई स्टैक है। लेखक ने सामान्य अव्यवस्था जमा कर ली थी: दो मॉडल रनर, तीन यूजर इंटरफेस, एक वेक्टर डेटाबेस जिसका कोई उपयोग नहीं कर रहा था, और एडेप्टर का एक फोल्डर जिसे वह भूल गया था। न्यूनतम सेट में कटौती करने से सेटअप को बनाए रखना आसान हो गया और पहुंचना आसान हो गया। हमने डेस्कटॉप पर एक न्यूनतम स्थानीय एआई स्टैक के लिए आठ सर्वश्रेष्ठ ऐप्स का परीक्षण किया, एक MacBook Pro M3 पर, RTX 4070 के साथ एक Windows वर्कस्टेशन पर, और AMD 7800 XT के साथ एक Debian बॉक्स पर, इस पर ध्यान केंद्रित करते हुए कि कैसे प्रत्येक स्टैक में एकमात्र उपकरण के रूप में कार्य करता है बजाय कई में से एक के।
न्यूनतम स्थानीय एआई ऐप में क्या देखना है
- एकल-बाइनरी इंस्टॉल या इसके करीब। एक उपकरण जो एक
brew installया.msiहै, एक उपकरण को हराता है जिसे Docker प्लस Python प्लस एक कॉन्फ़िगरेशन फ़ाइल की आवश्यकता होती है। - मॉडल प्रबंधन जो रास्ते से बाहर रहता है। एक GGUF को डाउनलोड करना एक कमांड होना चाहिए। एक को हटाना छिपे हुए फोल्डर को खोजने की आवश्यकता नहीं होनी चाहिए।
- API संगतता। एक OpenAI-संगत एंडपॉइंट वह है जो आपको अपने स्थानीय मॉडल पर किसी भी मौजूदा उपकरण को इंगित करने देता है बिना दोनों पक्षों को फिर से लिखे।
- GPU और CPU स्वत: पहचान। स्टैक को यह निर्धारित करना चाहिए कि आपके पास Metal, CUDA, ROCm है या केवल CPU है और सही का उपयोग करें। मैनुअल बैकएंड चयन वह अव्यवस्था है जिसे ये उपकरण हटाने का मतलब रखते थे।
- RAM अनुशासन। एक उपकरण जो 2 GB RAM पर निष्क्रिय रहता है एक मॉडल को सेवा करने के लिए जो 8 GB में फिट बैठता है कुछ गलत कर रहा है।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ के लिए | प्लेटफॉर्म | मुक्त योजना | शुरुआती कीमत | स्टैंडआउट सुविधा |
|---|---|---|---|---|---|
| llama.cpp | संदर्भ रनटाइम | Windows, macOS, Linux | मुक्त, खुला स्रोत | मुक्त | पोर्टेबल एकल-बाइनरी निष्कर्ष |
| llamafile | एक फाइल, कोई स्थापन नहीं | Windows, macOS, Linux | मुक्त, खुला स्रोत | मुक्त | मॉडल प्लस रनटाइम एक कार्यकारी में |
| Ollama | सरलतम CLI प्लस API | Windows, macOS, Linux | मुक्त, खुला स्रोत | मुक्त | ollama run और आपके पास एक OpenAI एंडपॉइंट है |
| Jan | API के साथ देशी डेस्कटॉप यूआई | Windows, macOS, Linux | मुक्त, खुला स्रोत | मुक्त | क्रॉस-प्लेटफॉर्म डेस्कटॉप चैट |
| KoboldCpp | एकल-बाइनरी यूआई प्लस API | Windows, macOS, Linux | मुक्त, खुला स्रोत | मुक्त | अंतर्निहित वेब यूआई के साथ GGUF रनर |
| Msty | स्थानीय मॉडल पर पॉलिश्ड पेड यूआई | Windows, macOS, Linux | मुक्त स्तर | उन्नत सुविधाओं के लिए Msty सदस्यता | मल्टी-मॉडल चैट इंटरफेस |
| GPT4All | सबसे सरल डेस्कटॉप-केवल चैट | Windows, macOS, Linux | मुक्त, खुला स्रोत | मुक्त | शुरुआत-अनुकूल, कोई CLI नहीं |
| LM Studio | पूर्ण विशेषताओं वाला स्थानीय रनर | Windows, macOS, Linux | व्यक्तिगत के लिए मुक्त | व्यावसायिक लाइसेंसिंग | मॉडल खोज यूआई, व्यापक बैकएंड समर्थन |
ऐप्स
1. llama.cpp — संदर्भ रनटाइम के लिए सर्वश्रेष्ठ जिस पर सभी निर्माण करते हैं
llama.cpp रनटाइम है जिसे इस सूची का अधिकांश हिस्सा एक तरह से लपेटता है। यह एक पोर्टेबल, निर्भरता-मुक्त C++ अनुमान सर्वर है जो CPU, Metal, CUDA, और ROCm पर GGUF मॉडल चलाता है। अपने आप पर न्यूनतम स्टैक के रूप में, llama-server आपको एक OpenAI-संगत एंडपॉइंट देता है, और llama-cli आपको एक REPL देता है। यह अधिकांश स्थानीय एआई कार्य के लिए पर्याप्त है।
जहां यह विफल होता है: कोई पॉलिश्ड यूआई नहीं। आप एक रिलीज बाइनरी को संकलित या डाउनलोड कर रहे हैं। मॉडल प्रबंधन मैनुअल है।
मूल्य निर्धारण:
- मुक्त: पूरी तरह खुला स्रोत
- भुगतान किया: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: github.com/ggerganov/llama.cpp
निचला पंक्ति: llama.cpp वह चुनाव है जब आप सबसे कम हिलने वाले हिस्से चाहते हैं और एक टर्मिनल में आरामदायक हैं।
2. llamafile — एक कार्यकारी में रनटाइम और मॉडल के लिए सर्वश्रेष्ठ
llamafile Mozilla की Ocho परियोजना से एक मॉडल और llama.cpp रनटाइम को एक Cosmopolitan-libc बाइनरी में बंडल करता है जो Windows, macOS, और Linux पर बिना स्थापन के चलता है। फ़ाइल डाउनलोड करें, chmod करें, चलाएं। यह एक ब्राउज़र यूआई खोलता है और localhost पर एक OpenAI-संगत एपीआई को उजागर करता है। यह सूची पर “न्यूनतम स्थानीय एआई” का सबसे शाब्दिक व्याख्या है।
जहां यह विफल होता है: पोर्टेबल एकल-बाइनरी फाइलें होस्ट सुरक्षा उपकरण को मार सकती हैं। एक नया मॉडल डाउनलोड करने का अर्थ है एक नया llamafile डाउनलोड करना।
मूल्य निर्धारण:
- मुक्त: पूरी तरह खुला स्रोत
- भुगतान किया: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: github.com/Mozilla-Ocho/llamafile
निचला पंक्ति: llamafile वह चुनाव है जब स्थापन एक फाइल और केवल एक फाइल होनी चाहिए।
3. Ollama — सरलतम CLI प्लस API वर्कफ़्लो के लिए सर्वश्रेष्ठ
Ollama llama.cpp को इस सूची में कुछ भी की सबसे स्वच्छ स्थापन और कमांड अनुभव के साथ लपेटता है। ollama pull llama3.2:8b एक मॉडल डाउनलोड करता है। ollama run llama3.2:8b एक चैट खोलता है। ollama serve डिफ़ॉल्ट रूप से port 11434 पर एक OpenAI-संगत एंडपॉइंट को उजागर करता है। Modelfile प्रारूप आपको एक एकल पाठ फाइल के साथ सिस्टम प्रॉम्प्ट और पैरामीटर को पिन करने देता है।
जहां यह विफल होता है: डिफ़ॉल्ट स्थापन सर्वर को एक पृष्ठभूमि सेवा के रूप में चलाता है जिसे आप नहीं चाहते। मॉडल को मैनुअल परिमाणीकरण कच्चे llama.cpp की तुलना में सीमित है।
मूल्य निर्धारण:
- मुक्त: पूरी तरह खुला स्रोत
- भुगतान किया: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: ollama.com
निचला पंक्ति: Ollama वह चुनाव है जब एक-कमांड स्थापन और एक-कमांड रन न्यूनतम बार है।
4. Jan — API के साथ देशी डेस्कटॉप यूआई के लिए सर्वश्रेष्ठ जो आप स्वामित्व में रखते हैं
Jan स्थानीय मॉडल के लिए शुरुआत से एक डेस्कटॉप ऐप है, खुला स्रोत, एक OpenAI-संगत API सर्वर बनाया गया है। यह वह है जो आप स्थापित करते हैं जब आप LM Studio सतह के बिना एक वास्तविक डेस्कटॉप चैट यूआई चाहते हैं। टीम सभी तीन OSes के लिए बिल्ड भेजता है और मॉडल खोज प्रवाह को सरल रखता है।
जहां यह विफल होता है: LM Studio या Ollama की तुलना में युवा परियोजना। कुछ उन्नत सुविधाएं (विशेष बैकएंड, गहरी मॉडल अनुकूलन) पिछड़ जाती हैं।
मूल्य निर्धारण:
- मुक्त: पूरी तरह खुला स्रोत
- भुगतान किया: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: jan.ai
निचला पंक्ति: Jan वह चुनाव है जब एक उचित डेस्कटॉप यूआई निर्णायक कारक है।
5. KoboldCpp — एकल-बाइनरी यूआई प्लस API के लिए सर्वश्रेष्ठ पोर्टेबल लक्ष्य पर
KoboldCpp KoboldAI समुदाय के लिए लक्षित llama.cpp के एक कांटे के रूप में शुरू हुआ, और यह एक ब्राउज़र यूआई, एक एपीआई एंडपॉइंट, छवि और ऑडियो इनपुट समर्थन, और कोई स्थापन चरण के साथ एक एकल-बाइनरी GGUF रनर में विकसित हुआ। बाइनरी और एक GGUF को इसके बगल में रखें, एक कमांड चलाएं, और सब कुछ तैयार है।
जहां यह विफल होता है: कुछ विशेष सुविधाएं (Horde एकीकरण, KoboldAI-विशिष्ट प्रॉम्प्ट) एक सामान्य चैट उपयोग के मामले के लिए महत्व नहीं रखती हैं।
मूल्य निर्धारण:
- मुक्त: पूरी तरह खुला स्रोत
- भुगतान किया: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: github.com/LostRuins/koboldcpp
निचला पंक्ति: KoboldCpp वह चुनाव है जब आप एक एकल बाइनरी चाहते हैं जो आपको एक भारी ऐप के बिना एक यूआई और एपीआई दोनों देता है।
6. Msty — स्थानीय मॉडल पर पॉलिश्ड पेड यूआई के लिए सर्वश्रेष्ठ
Msty LM Studio दृष्टिकोण लेता है और एक स्वच्छ यूआई का उत्पादन करता है। कई मॉडल के साथ साथ चैट करें, स्थानीय Ollama या Jan एंडपॉइंट से कनेक्ट करें, और फ़ोल्डर में बातचीत को व्यवस्थित करें। मुक्त स्तर उदार है; भुगतान स्तर वह है जो बहु-उपयोगकर्ता और वर्कस्पेस सुविधाओं को अनलॉक करता है।
जहां यह विफल होता है: क्लोज्ड-सोर्स। “एक खुला स्रोत बाइनरी स्थापित करें” के न्यूनतमवादी अंत में नहीं। एक एकल उपयोगकर्ता जो सिद्धांतों पर पॉलिशिंग को महत्व देता है, यह ठीक है।
मूल्य निर्धारण:
- मुक्त: पूर्ण मुख्य यूआई
- भुगतान किया: उन्नत वर्कस्पेस सुविधाओं के लिए Msty सदस्यता
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: msty.app
निचला पंक्ति: Msty वह चुनाव है जब यूआई पॉलिश खुले स्रोत बाधा के लिए व्यापार के लायक है।
7. GPT4All — शुरुआत-अनुकूल डेस्कटॉप चैट के लिए सर्वश्रेष्ठ
GPT4All Nomic द्वारा किसी के लिए एक स्थानीय LLM चलाने का सबसे अनुकूल तरीका है जो एक टर्मिनल को छूना नहीं चाहता। ऐप स्थापित करें, एक क्यूरेटेड मॉडल सूची ब्राउज़ करें, एक चुनें, चैट करें। यह एक स्थानीय एपीआई को भी उजागर करता है और यदि आप चैट से परे जाने का निर्णय लेते हैं तो Nomic Atlas के साथ दस्तावेज-आधारित RAG में एकीकृत होता है।
जहां यह विफल होता है: क्यूरेटेड मॉडल सूची Hugging Face पर उपलब्ध का एक छोटा सा सबसेट है। उन्नत उपयोगकर्ता इसे बढ़ते हैं।
मूल्य निर्धारण:
- मुक्त: पूरी तरह खुला स्रोत
- भुगतान किया: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: gpt4all.io
निचला पंक्ति: GPT4All एक पहली बार स्थानीय एआई उपयोगकर्ता के लिए चुनाव है जो एक डेस्कटॉप ऐप चाहता है जो बस काम करता है।
8. LM Studio — पूर्ण विशेषताओं वाले स्थानीय रनर के लिए सर्वश्रेष्ठ
LM Studio “अभी भी एक एकल डेस्कटॉप ऐप” का अधिकतमवादी अंत है। Hugging Face से मॉडल खोज, बहु-बैकएंड समर्थन (llama.cpp, MLX Apple Silicon पर), पूर्ण चैट यूआई, एक API सर्वर, और एक मॉडल कॉन्फ़िगरेशन सतह जो सब कुछ उजागर करता है। यह वह है जो लोग डिफॉल्ट रूप से जाते हैं जब Ollama की सादगी बहुत सीमित होती है।
जहां यह विफल होता है: खुला स्रोत नहीं। ऊपर की तुलना में बड़ा स्थापन पदचिह्न। अधिकतमवादी विशेषता सतह XDA पृष्ठ द्वारा तर्क दिए गए न्यूनतम स्टैक के विपरीत है, लेकिन इसे यहां उस बिंदु के रूप में शामिल किया जाता है कि जब आप कट करने से इनकार करते हैं तो क्या होता है।
मूल्य निर्धारण:
- मुक्त: व्यक्तिगत उपयोग
- भुगतान किया: वाणिज्यिक परिनियोजन के लिए व्यावसायिक लाइसेंसिंग
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: lmstudio.ai
निचला पंक्ति: LM Studio वह चुनाव है जब एक पूर्ण विशेषताओं वाला स्थानीय रनर ऊपर की तुलना में बड़ी स्थापन के लायक है।
सही चुनाव कैसे करें
- न्यूनतम व्यवहार्य स्टैक: Ollama। इसे स्थापित करें, एक मॉडल खींचें, किया। बाकी सब कुछ वैकल्पिक है।
- यदि आप एक फाइल और कोई स्थापन पसंद करेंगे: llamafile।
- यदि आप बिना wrapper के संदर्भ रनटाइम चाहते हैं: llama.cpp सीधे।
- यदि आप डेस्कटॉप चैट यूआई और खुला स्रोत चाहते हैं: Jan।
- यदि आप एक एकल बाइनरी चाहते हैं जो एक यूआई भी है: KoboldCpp।
- यदि पॉलिश खुला स्रोत से अधिक मायने रखता है: एक Ollama एंडपॉइंट के ऊपर Msty।
- यदि आपने पहले कभी एक स्थानीय मॉडल स्थापित नहीं किया है: GPT4All।
- यदि आप Ollama से अधिक हो गए हैं और अधिक नॉब्स चाहते हैं: LM Studio।
अक्सर पूछे जाने वाले प्रश्न
16 GB RAM पर मुझे कौन सा मॉडल चलाना चाहिए? एक 7B या 8B मॉडल का Q4 परिमाणीकरण उस लिफाफे में अच्छी तरह से चलता है और अधिकांश चैट और कोडिंग उपयोग के मामलों को कवर करता है। 13B का Q4 परिमाणीकरण संभव है लेकिन तंग है।
क्या ये ऐप्स Apple Silicon पर काम करते हैं? हां। llama.cpp, Ollama, Jan, KoboldCpp, LM Studio, और Msty सभी Apple Silicon पर Metal का उपयोग करते हैं और लगभग-देशी गति प्राप्त करते हैं। llamafile Apple Silicon बिनारी के साथ आता है।
क्या मैं ChatGPT-स्टाइल टूल्स को एक स्थानीय मॉडल पर इंगित कर सकता हूं? हां। Ollama, llama.cpp, Jan, KoboldCpp, LM Studio, और llamafile सभी localhost पर एक OpenAI-संगत एंडपॉइंट को उजागर करते हैं। कोई भी उपकरण जो एक कस्टम बेस यूआरएल स्वीकार करता है http://localhost:<port>/v1 पर इंगित करता है।
एक न्यूनतम स्टैक एक अधिकतमवादी से कैसे अलग है? कम हिलने वाले हिस्से। एक रनटाइम, एक मॉडल मैनेजर, एक यूआई। अधिकतमवादी स्टैक वेक्टर डेटाबेस, ऑर्केस्ट्रेशन परतें, और एजेंट फ्रेमवर्क जोड़ते हैं। अधिकांश एकल उपयोगकर्ताओं को इनमें से किसी की भी आवश्यकता नहीं है जब तक कि एक विशिष्ट समस्या इसे मांग नहीं करती।
क्या इनमें से कोई भी बॉक्स से बाहर एजेंट-सक्षम है? नहीं। ये अनुमान रनटाइम और चैट यूआई हैं। एक एजेंट लूप के लिए आप एक अलग उपकरण जोड़ते हैं जो इन एंडपॉइंट्स में से एक के खिलाफ OpenAI चैट पूर्णता प्रोटोकॉल बोलता है।
डिस्क पर कौन सा स्टैक सबसे छोटा है? llamafile प्लस एक एकल परिमाणित मॉडल सबसे हल्का संभव स्थापन है। Ollama प्लस इसका मॉडल स्टोर एक करीब दूसरा है और बढ़ने में आसान है।