llama.cpp

XDA ने इस महीने एक लेख प्रकाशित किया जिसमें तर्क दिया गया कि एक छोटा स्थानीय एआई स्टैक एक अधिक उत्पादक स्थानीय एआई स्टैक है। लेखक ने सामान्य अव्यवस्था जमा कर ली थी: दो मॉडल रनर, तीन यूजर इंटरफेस, एक वेक्टर डेटाबेस जिसका कोई उपयोग नहीं कर रहा था, और एडेप्टर का एक फोल्डर जिसे वह भूल गया था। न्यूनतम सेट में कटौती करने से सेटअप को बनाए रखना आसान हो गया और पहुंचना आसान हो गया। हमने डेस्कटॉप पर एक न्यूनतम स्थानीय एआई स्टैक के लिए आठ सर्वश्रेष्ठ ऐप्स का परीक्षण किया, एक MacBook Pro M3 पर, RTX 4070 के साथ एक Windows वर्कस्टेशन पर, और AMD 7800 XT के साथ एक Debian बॉक्स पर, इस पर ध्यान केंद्रित करते हुए कि कैसे प्रत्येक स्टैक में एकमात्र उपकरण के रूप में कार्य करता है बजाय कई में से एक के।

न्यूनतम स्थानीय एआई ऐप में क्या देखना है

त्वरित तुलना

ऐप सर्वश्रेष्ठ के लिए प्लेटफॉर्म मुक्त योजना शुरुआती कीमत स्टैंडआउट सुविधा
llama.cpp संदर्भ रनटाइम Windows, macOS, Linux मुक्त, खुला स्रोत मुक्त पोर्टेबल एकल-बाइनरी निष्कर्ष
llamafile एक फाइल, कोई स्थापन नहीं Windows, macOS, Linux मुक्त, खुला स्रोत मुक्त मॉडल प्लस रनटाइम एक कार्यकारी में
Ollama सरलतम CLI प्लस API Windows, macOS, Linux मुक्त, खुला स्रोत मुक्त ollama run और आपके पास एक OpenAI एंडपॉइंट है
Jan API के साथ देशी डेस्कटॉप यूआई Windows, macOS, Linux मुक्त, खुला स्रोत मुक्त क्रॉस-प्लेटफॉर्म डेस्कटॉप चैट
KoboldCpp एकल-बाइनरी यूआई प्लस API Windows, macOS, Linux मुक्त, खुला स्रोत मुक्त अंतर्निहित वेब यूआई के साथ GGUF रनर
Msty स्थानीय मॉडल पर पॉलिश्ड पेड यूआई Windows, macOS, Linux मुक्त स्तर उन्नत सुविधाओं के लिए Msty सदस्यता मल्टी-मॉडल चैट इंटरफेस
GPT4All सबसे सरल डेस्कटॉप-केवल चैट Windows, macOS, Linux मुक्त, खुला स्रोत मुक्त शुरुआत-अनुकूल, कोई CLI नहीं
LM Studio पूर्ण विशेषताओं वाला स्थानीय रनर Windows, macOS, Linux व्यक्तिगत के लिए मुक्त व्यावसायिक लाइसेंसिंग मॉडल खोज यूआई, व्यापक बैकएंड समर्थन

ऐप्स

1. llama.cpp — संदर्भ रनटाइम के लिए सर्वश्रेष्ठ जिस पर सभी निर्माण करते हैं

llama.cpp रनटाइम है जिसे इस सूची का अधिकांश हिस्सा एक तरह से लपेटता है। यह एक पोर्टेबल, निर्भरता-मुक्त C++ अनुमान सर्वर है जो CPU, Metal, CUDA, और ROCm पर GGUF मॉडल चलाता है। अपने आप पर न्यूनतम स्टैक के रूप में, llama-server आपको एक OpenAI-संगत एंडपॉइंट देता है, और llama-cli आपको एक REPL देता है। यह अधिकांश स्थानीय एआई कार्य के लिए पर्याप्त है।

जहां यह विफल होता है: कोई पॉलिश्ड यूआई नहीं। आप एक रिलीज बाइनरी को संकलित या डाउनलोड कर रहे हैं। मॉडल प्रबंधन मैनुअल है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: github.com/ggerganov/llama.cpp

निचला पंक्ति: llama.cpp वह चुनाव है जब आप सबसे कम हिलने वाले हिस्से चाहते हैं और एक टर्मिनल में आरामदायक हैं।

2. llamafile — एक कार्यकारी में रनटाइम और मॉडल के लिए सर्वश्रेष्ठ

llamafile Mozilla की Ocho परियोजना से एक मॉडल और llama.cpp रनटाइम को एक Cosmopolitan-libc बाइनरी में बंडल करता है जो Windows, macOS, और Linux पर बिना स्थापन के चलता है। फ़ाइल डाउनलोड करें, chmod करें, चलाएं। यह एक ब्राउज़र यूआई खोलता है और localhost पर एक OpenAI-संगत एपीआई को उजागर करता है। यह सूची पर “न्यूनतम स्थानीय एआई” का सबसे शाब्दिक व्याख्या है।

जहां यह विफल होता है: पोर्टेबल एकल-बाइनरी फाइलें होस्ट सुरक्षा उपकरण को मार सकती हैं। एक नया मॉडल डाउनलोड करने का अर्थ है एक नया llamafile डाउनलोड करना।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: github.com/Mozilla-Ocho/llamafile

निचला पंक्ति: llamafile वह चुनाव है जब स्थापन एक फाइल और केवल एक फाइल होनी चाहिए।

3. Ollama — सरलतम CLI प्लस API वर्कफ़्लो के लिए सर्वश्रेष्ठ

Ollama llama.cpp को इस सूची में कुछ भी की सबसे स्वच्छ स्थापन और कमांड अनुभव के साथ लपेटता है। ollama pull llama3.2:8b एक मॉडल डाउनलोड करता है। ollama run llama3.2:8b एक चैट खोलता है। ollama serve डिफ़ॉल्ट रूप से port 11434 पर एक OpenAI-संगत एंडपॉइंट को उजागर करता है। Modelfile प्रारूप आपको एक एकल पाठ फाइल के साथ सिस्टम प्रॉम्प्ट और पैरामीटर को पिन करने देता है।

जहां यह विफल होता है: डिफ़ॉल्ट स्थापन सर्वर को एक पृष्ठभूमि सेवा के रूप में चलाता है जिसे आप नहीं चाहते। मॉडल को मैनुअल परिमाणीकरण कच्चे llama.cpp की तुलना में सीमित है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: ollama.com

निचला पंक्ति: Ollama वह चुनाव है जब एक-कमांड स्थापन और एक-कमांड रन न्यूनतम बार है।

4. Jan — API के साथ देशी डेस्कटॉप यूआई के लिए सर्वश्रेष्ठ जो आप स्वामित्व में रखते हैं

Jan स्थानीय मॉडल के लिए शुरुआत से एक डेस्कटॉप ऐप है, खुला स्रोत, एक OpenAI-संगत API सर्वर बनाया गया है। यह वह है जो आप स्थापित करते हैं जब आप LM Studio सतह के बिना एक वास्तविक डेस्कटॉप चैट यूआई चाहते हैं। टीम सभी तीन OSes के लिए बिल्ड भेजता है और मॉडल खोज प्रवाह को सरल रखता है।

जहां यह विफल होता है: LM Studio या Ollama की तुलना में युवा परियोजना। कुछ उन्नत सुविधाएं (विशेष बैकएंड, गहरी मॉडल अनुकूलन) पिछड़ जाती हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: jan.ai

निचला पंक्ति: Jan वह चुनाव है जब एक उचित डेस्कटॉप यूआई निर्णायक कारक है।

5. KoboldCpp — एकल-बाइनरी यूआई प्लस API के लिए सर्वश्रेष्ठ पोर्टेबल लक्ष्य पर

KoboldCpp KoboldAI समुदाय के लिए लक्षित llama.cpp के एक कांटे के रूप में शुरू हुआ, और यह एक ब्राउज़र यूआई, एक एपीआई एंडपॉइंट, छवि और ऑडियो इनपुट समर्थन, और कोई स्थापन चरण के साथ एक एकल-बाइनरी GGUF रनर में विकसित हुआ। बाइनरी और एक GGUF को इसके बगल में रखें, एक कमांड चलाएं, और सब कुछ तैयार है।

जहां यह विफल होता है: कुछ विशेष सुविधाएं (Horde एकीकरण, KoboldAI-विशिष्ट प्रॉम्प्ट) एक सामान्य चैट उपयोग के मामले के लिए महत्व नहीं रखती हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: github.com/LostRuins/koboldcpp

निचला पंक्ति: KoboldCpp वह चुनाव है जब आप एक एकल बाइनरी चाहते हैं जो आपको एक भारी ऐप के बिना एक यूआई और एपीआई दोनों देता है।

6. Msty — स्थानीय मॉडल पर पॉलिश्ड पेड यूआई के लिए सर्वश्रेष्ठ

Msty LM Studio दृष्टिकोण लेता है और एक स्वच्छ यूआई का उत्पादन करता है। कई मॉडल के साथ साथ चैट करें, स्थानीय Ollama या Jan एंडपॉइंट से कनेक्ट करें, और फ़ोल्डर में बातचीत को व्यवस्थित करें। मुक्त स्तर उदार है; भुगतान स्तर वह है जो बहु-उपयोगकर्ता और वर्कस्पेस सुविधाओं को अनलॉक करता है।

जहां यह विफल होता है: क्लोज्ड-सोर्स। “एक खुला स्रोत बाइनरी स्थापित करें” के न्यूनतमवादी अंत में नहीं। एक एकल उपयोगकर्ता जो सिद्धांतों पर पॉलिशिंग को महत्व देता है, यह ठीक है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: msty.app

निचला पंक्ति: Msty वह चुनाव है जब यूआई पॉलिश खुले स्रोत बाधा के लिए व्यापार के लायक है।

7. GPT4All — शुरुआत-अनुकूल डेस्कटॉप चैट के लिए सर्वश्रेष्ठ

GPT4All Nomic द्वारा किसी के लिए एक स्थानीय LLM चलाने का सबसे अनुकूल तरीका है जो एक टर्मिनल को छूना नहीं चाहता। ऐप स्थापित करें, एक क्यूरेटेड मॉडल सूची ब्राउज़ करें, एक चुनें, चैट करें। यह एक स्थानीय एपीआई को भी उजागर करता है और यदि आप चैट से परे जाने का निर्णय लेते हैं तो Nomic Atlas के साथ दस्तावेज-आधारित RAG में एकीकृत होता है।

जहां यह विफल होता है: क्यूरेटेड मॉडल सूची Hugging Face पर उपलब्ध का एक छोटा सा सबसेट है। उन्नत उपयोगकर्ता इसे बढ़ते हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: gpt4all.io

निचला पंक्ति: GPT4All एक पहली बार स्थानीय एआई उपयोगकर्ता के लिए चुनाव है जो एक डेस्कटॉप ऐप चाहता है जो बस काम करता है।

8. LM Studio — पूर्ण विशेषताओं वाले स्थानीय रनर के लिए सर्वश्रेष्ठ

LM Studio “अभी भी एक एकल डेस्कटॉप ऐप” का अधिकतमवादी अंत है। Hugging Face से मॉडल खोज, बहु-बैकएंड समर्थन (llama.cpp, MLX Apple Silicon पर), पूर्ण चैट यूआई, एक API सर्वर, और एक मॉडल कॉन्फ़िगरेशन सतह जो सब कुछ उजागर करता है। यह वह है जो लोग डिफॉल्ट रूप से जाते हैं जब Ollama की सादगी बहुत सीमित होती है।

जहां यह विफल होता है: खुला स्रोत नहीं। ऊपर की तुलना में बड़ा स्थापन पदचिह्न। अधिकतमवादी विशेषता सतह XDA पृष्ठ द्वारा तर्क दिए गए न्यूनतम स्टैक के विपरीत है, लेकिन इसे यहां उस बिंदु के रूप में शामिल किया जाता है कि जब आप कट करने से इनकार करते हैं तो क्या होता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux

डाउनलोड: lmstudio.ai

निचला पंक्ति: LM Studio वह चुनाव है जब एक पूर्ण विशेषताओं वाला स्थानीय रनर ऊपर की तुलना में बड़ी स्थापन के लायक है।

सही चुनाव कैसे करें

अक्सर पूछे जाने वाले प्रश्न

16 GB RAM पर मुझे कौन सा मॉडल चलाना चाहिए? एक 7B या 8B मॉडल का Q4 परिमाणीकरण उस लिफाफे में अच्छी तरह से चलता है और अधिकांश चैट और कोडिंग उपयोग के मामलों को कवर करता है। 13B का Q4 परिमाणीकरण संभव है लेकिन तंग है।

क्या ये ऐप्स Apple Silicon पर काम करते हैं? हां। llama.cpp, Ollama, Jan, KoboldCpp, LM Studio, और Msty सभी Apple Silicon पर Metal का उपयोग करते हैं और लगभग-देशी गति प्राप्त करते हैं। llamafile Apple Silicon बिनारी के साथ आता है।

क्या मैं ChatGPT-स्टाइल टूल्स को एक स्थानीय मॉडल पर इंगित कर सकता हूं? हां। Ollama, llama.cpp, Jan, KoboldCpp, LM Studio, और llamafile सभी localhost पर एक OpenAI-संगत एंडपॉइंट को उजागर करते हैं। कोई भी उपकरण जो एक कस्टम बेस यूआरएल स्वीकार करता है http://localhost:<port>/v1 पर इंगित करता है।

एक न्यूनतम स्टैक एक अधिकतमवादी से कैसे अलग है? कम हिलने वाले हिस्से। एक रनटाइम, एक मॉडल मैनेजर, एक यूआई। अधिकतमवादी स्टैक वेक्टर डेटाबेस, ऑर्केस्ट्रेशन परतें, और एजेंट फ्रेमवर्क जोड़ते हैं। अधिकांश एकल उपयोगकर्ताओं को इनमें से किसी की भी आवश्यकता नहीं है जब तक कि एक विशिष्ट समस्या इसे मांग नहीं करती।

क्या इनमें से कोई भी बॉक्स से बाहर एजेंट-सक्षम है? नहीं। ये अनुमान रनटाइम और चैट यूआई हैं। एक एजेंट लूप के लिए आप एक अलग उपकरण जोड़ते हैं जो इन एंडपॉइंट्स में से एक के खिलाफ OpenAI चैट पूर्णता प्रोटोकॉल बोलता है।

डिस्क पर कौन सा स्टैक सबसे छोटा है? llamafile प्लस एक एकल परिमाणित मॉडल सबसे हल्का संभव स्थापन है। Ollama प्लस इसका मॉडल स्टोर एक करीब दूसरा है और बढ़ने में आसान है।