Ollama

XDA ने एक RTX 5070 लैपटॉप और इंटीग्रेटेड ग्राफिक्स वाली मशीन पर समान 8B मॉडल चलाया और रिपोर्ट किया कि टोकन-प्रति-सेकंड का अंतर ज्यादातर लोगों की कल्पना से कम था। यह 2026 में स्थानीय LLM की कहानी है: क्वांटाइजेशन, Vulkan बैकएंड और Apple की Metal ने कई वर्कलोड को उस रेंज में ले आई है जहां iGPU या छोटा dGPU पर्याप्त है। आपको मॉडल स्थानीय रूप से चलाने के लिए $2,000 के रिग की जरूरत नहीं है।

यह गाइड स्थानीय LLM चलाने के लिए 8 ऐप्स कवर करता है, Intel Core Ultra 5 के साथ Arc iGPU, AMD Ryzen 7 के साथ Radeon 780M और Apple M2 पर परीक्षण किया गया। सभी 8 सही क्वांटाइजेशन के साथ 7B-14B रेंज में मॉडल चलाते हैं (10 टोकन प्रति सेकंड या बेहतर)। हमने सेटअप की सरलता, मॉडल संगतता और iGPU-क्लास हार्डवेयर पर ईमानदार प्रदर्शन को प्राथमिकता दी।

iGPU के लिए स्थानीय LLM रनर में क्या देखें

त्वरित तुलना

ऐप सर्वश्रेष्ठ के लिए मुफ्त योजना शुरुआती कीमत UI शैली
Ollama स्थानीय मॉडल के लिए CLI + API हां मुफ्त (open source) टर्मिनल या तीसरे पक्ष के क्लाइंट
LM Studio पॉलिश किया गया डेस्कटॉप UI हां मुफ्त नेटिव डेस्कटॉप
GPT4All शुरुआत के अनुकूल डेस्कटॉप हां मुफ्त नेटिव डेस्कटॉप
Jan पूरी तरह से open source ChatGPT क्लोन हां मुफ्त नेटिव डेस्कटॉप (Electron)
Msty RAG के साथ सब कुछ एक में हां मुफ्त आधार नेटिव डेस्कटॉप
KoboldCpp रोलप्ले और रचनात्मक लेखन हां मुफ्त (open source) Web UI
Text Generation WebUI पावर-यूजर टिंकरिंग हां मुफ्त (open source) Web UI
AnythingLLM दस्तावेजों पर स्थानीय RAG हां मुफ्त (open source) नेटिव डेस्कटॉप

ऐप्स

1. Ollama, सर्वश्रेष्ठ CLI और API रनर

Ollama स्थानीय LLM के लिए एक मानक के सबसे करीब है। इसे इंस्टॉल करें, ollama run llama3.2:3b चलाएं, और आपके पास एक मिनट से कम में एक काम करने वाला मॉडल है। पर्दे के पीछे यह llama.cpp का उपयोग करता है जिसमें एक क्यूरेटेड मॉडल लाइब्रेरी, localhost:11434 पर OpenAI-संगत API और प्रति-मॉडल मेमोरी प्रबंधन है।

जहां यह कम पड़ता है: कोई निर्मित chat UI नहीं; आप ollama run को टर्मिनल में उपयोग करते हैं या एक क्लाइंट (Open WebUI, Msty, या Mac पर Enchanted) के साथ जोड़ते हैं। ollama.com पर मॉडल लाइब्रेरी क्यूरेटेड है लेकिन कच्चे Hugging Face एक्सेस की तुलना में सीमित है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS (Apple silicon और Intel), Linux।

डाउनलोड: ollama.com/download या Homebrew / apt के माध्यम से।

निष्कर्ष: सर्वश्रेष्ठ बैकएंड, बस। इसे इंस्टॉल करें भले ही आप ऊपर एक अलग UI का उपयोग करने की योजना बना रहे हों।

2. LM Studio, सर्वश्रेष्ठ पॉलिश किया गया डेस्कटॉप UI

LM Studio llama.cpp को एक नेटिव डेस्कटॉप ऐप में लपेटता है जिसमें निर्मित Hugging Face मॉडल ब्राउज़र, वन-क्लिक डाउनलोड, प्रति-मॉडल प्रदर्शन बेंचमार्क और OpenAI-संगत API सर्वर है। GPU ऑफलोड सेटिंग्स Intel Arc, AMD और Apple silicon के लिए समझदारीपूर्ण डिफ़ॉल्ट के साथ उजागर की जाती हैं।

जहां यह कम पड़ता है: बंद-स्रोत (हालांकि मुफ्त)। कुछ उपयोगकर्ता रिपोर्ट करते हैं कि GUI निचले-अंत iGPU पर मॉडल को स्वयं की तुलना में अधिक RAM खाता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux (बीटा)।

डाउनलोड: lmstudio.ai

निष्कर्ष: iGPU उपयोगकर्ताओं के लिए जो GUI पसंद करते हैं सर्वश्रेष्ठ शुरुआती बिंदु। उपभोक्ता हार्डवेयर के लिए सही डिफ़ॉल्ट के साथ आता है।

3. GPT4All, सर्वश्रेष्ठ शुरुआत के अनुकूल डेस्कटॉप

GPT4All Nomic द्वारा पैक का सबसे सुलभ है। इंस्टॉल करें, साइडबार से एक मॉडल चुनें, और यह डाउनलोड और चलता है। LocalDocs पेन कॉन्फ़िगरेशन के बिना फ़ाइलों के फ़ोल्डर पर सरल RAG जोड़ता है।

जहां यह कम पड़ता है: LM Studio की तुलना में छोटी मॉडल कैटलॉग। हमारे परीक्षणों में Ollama या LM Studio की तुलना में Windows पर धीमा।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: nomic.ai/gpt4all

निष्कर्ष: आपके कम तकनीकी पारिवारिक सदस्य को देने का विकल्प। उन्हें टर्मिनल को छुए बिना स्थानीय मॉडल चला रहा है।

4. Jan, सर्वश्रेष्ठ पूरी तरह से open source ChatGPT क्लोन

Jan एक पूरी तरह से open source डेस्कटॉप ऐप है जो ChatGPT के इंटरफेस की नकल करता है। यह bundled llama.cpp के माध्यम से स्थानीय मॉडल चलाता है, दूरस्थ API (OpenAI, Anthropic, Groq, Mistral) को विकल्प के रूप में जोड़ता है और प्रत्येक वार्तालाप को स्थानीय रूप से संग्रहीत करता है।

जहां यह कम पड़ता है: Electron-आधारित, इसलिए RAM फुटप्रिंट नेटिव ऐप्स से भारी है। बहु-पाली वार्तालाप कभी-कभी iGPU पर आक्रामक संदर्भ ट्रंकेशन के कारण संदर्भ खो देते हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: jan.ai

निष्कर्ष: सबसे खुला ChatGPT-समान। सर्वश्रेष्ठ यदि आप स्थानीय प्लस वैकल्पिक दूरस्थ के लिए एक एकल ऐप चाहते हैं।

5. Msty, RAG के साथ सर्वश्रेष्ठ सब कुछ एक में

Msty एक ऐप में स्थानीय मॉडल, दूरस्थ API, दस्तावेजों पर RAG और विभाजन-दृश्य वार्तालाप को जोड़ता है। इसकी “Knowledge Stacks” सुविधा PDF, Word दस्तावेज़ और पाठ फ़ाइलों के फ़ोल्डर को अनुक्रमित करती है ताकि आप वेक्टर डेटाबेस सेट किए बिना उनके साथ चैट कर सकें।

जहां यह कम पड़ता है: बंद-स्रोत। मुफ्त स्तर कुछ उन्नत RAG सुविधाओं को सीमित करता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: msty.app

निष्कर्ष: यदि आप एक अलग वेक्टर स्टोर सेट किए बिना दस्तावेज़ चैट चाहते हैं तो पिक।

6. KoboldCpp, रोलप्ले और रचनात्मक लेखन के लिए सर्वश्रेष्ठ

KoboldCpp लंबे-रूप लेखन और रोलप्ले पर लक्षित llama.cpp के एक फोर्क के रूप में शुरू हुआ। इसमें विश्व सूचना, चरित्र मेमोरी और किताबें वाले एक web UI है जो अन्य रनर सतह नहीं करते हैं। बैकएंड iGPU के लिए Vulkan को समर्थन करता है।

जहां यह कम पड़ता है: UI स्लाइडर के साथ घना है जो केवल पावर-यूजर के लिए कुछ मायने रखता है। chat सहायक वर्कफ़्लो के लिए वास्तव में डिज़ाइन नहीं किया गया।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड: KoboldCpp GitHub releases

निष्कर्ष: लेखकों और रोलप्लेयर्स के लिए जो लगातार पात्रों को चाहते हैं निचे चुन।

7. Text Generation WebUI, सर्वश्रेष्ठ पावर-यूजर टिंकरिंग

Text Generation WebUI (oobabooga) tinkerer का खेल का मैदान है। यह llama.cpp, ExLlama, Transformers और अधिक बैकएंड को समर्थन करता है, प्रत्येक पीढ़ी पैरामीटर को उजागर करता है और LoRA और fine-tuning के साथ एकीकृत करता है।

जहां यह कम पड़ता है: सेटअप शुरुआत के लिए नहीं है; Python venv के साथ 30 मिनट की install की उम्मीद रखें। web UI कार्यात्मक है लेकिन डिज़ाइन नहीं किया गया।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux via Python।

डाउनलोड: oobabooga/text-generation-webui GitHub

निष्कर्ष: सही चुनाव जब आप जानते हैं कि आप क्या ट्यून करना चाहते हैं और बेहतर ऐप में नहीं पहुंच सकते।

8. AnythingLLM, दस्तावेजों पर सर्वश्रेष्ठ स्थानीय RAG

AnythingLLM एक उद्देश्य-निर्मित RAG ऐप है जो स्थानीय (या दूरस्थ) LLM को एक दस्तावेज़ स्टोर के साथ जोड़ता है। एक फ़ोल्डर की ओर इशारा करें या फ़ाइलें छोड़ें, और यह उन्हें एक स्थानीय वेक्टर डेटाबेस में अनुक्रमित करता है। बहु-उपयोगकर्ता कार्यक्षेत्र विभिन्न परियोजनाओं के लिए संदर्भ को अलग करते हैं।

जहां यह कम पड़ता है: RAG-केंद्रित; शुद्ध चैट संभव है लेकिन बिंदु नहीं। सेटअप में chat मॉडल से अलग एक एम्बेडिंग मॉडल चुनना शामिल है, जो शुरुआत को भ्रमित करता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux, प्लस self-hosting के लिए Docker तैनाती।

डाउनलोड: anythingllm.com या Mintplex-Labs/anything-llm GitHub

निष्कर्ष: यदि आप अपने स्वयं के दस्तावेज़ संग्रह को निजी में क्वेरी करना चाहते हैं तो पिक।

सही चुनाव कैसे करें

अधिकांश iGPU उपयोगकर्ताओं के लिए सर्वश्रेष्ठ जोड़ी सेटअप: Ollama बैकएंड के रूप में + LM Studio या Open WebUI क्लाइंट के रूप में। यह आपको सबसे तेजी से बैकएंड सबसे अनुकूल इंटरफेस के साथ देता है।

FAQ

Intel Arc iGPU के लिए सर्वश्रेष्ठ स्थानीय LLM ऐप क्या है?

LM Studio और Ollama दोनों Vulkan का उपयोग करते हैं और Intel Arc iGPU (Xe, Xe2, Xe-LPG) पर अच्छी तरह से काम करते हैं। मॉडल की पसंद ऐप की पसंद की तुलना में अधिक मायने रखती है; 7B-8B मॉडल के Q4_K_M क्वांटाइजेशन甜 spot हैं।

क्या मैं बिना एक discrete GPU के Ryzen APU पर स्थानीय LLM चला सकता हूं?

हां। Ryzen 7000 और 8000 सीरीज़ Radeon 780M / 890M iGPU Q4 क्वांटाइजेशन में Vulkan के माध्यम से 10 से 20 टोकन प्रति सेकंड पर 7B मॉडल चलाते हैं। यदि आप बड़े संदर्भ लोड करना चाहते हैं तो BIOS में ग्राफिक्स के लिए सिस्टम RAM आवंटन बढ़ाएं।

M2 या M3 के साथ MacBook के लिए सर्वश्रेष्ठ स्थानीय LLM क्या है?

Apple silicon M2 पर 20 से 40 टोकन प्रति सेकंड पर Llama 3.1 8B, Qwen 3 8B और Mistral 7B चलाता है। LM Studio और Ollama दोनों स्वचालित रूप से Metal का उपयोग करते हैं। 16GB unified memory पर Q4_K_M या Q5_K_M के साथ रहें।

क्या मुझे स्थानीय मॉडल चलाने के लिए Python जानने की जरूरत है?

नहीं। Ollama, LM Studio, GPT4All, Jan और Msty सभी Python के बिना वन-क्लिक इंस्टॉल हैं। Text Generation WebUI अपवाद है।

कौन सा स्थानीय LLM ऐप पूरी तरह से open source है?

Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI और AnythingLLM सभी open source हैं। LM Studio और Msty मुफ्त हैं लेकिन बंद-स्रोत हैं।

स्थानीय LLM के लिए मुझे कितना RAM चाहिए?

Q4 क्वांटाइजेशन में 7B-8B मॉडल के लिए, 16GB कुल सिस्टम RAM व्यवहार्य है और 32GB आरामदायक है। iGPU सिस्टम RAM साझा करता है, इसलिए तदनुसार बजट करें। 13B-14B मॉडल के लिए, न्यूनतम 32GB की योजना बनाएं।