XDA ने एक RTX 5070 लैपटॉप और इंटीग्रेटेड ग्राफिक्स वाली मशीन पर समान 8B मॉडल चलाया और रिपोर्ट किया कि टोकन-प्रति-सेकंड का अंतर ज्यादातर लोगों की कल्पना से कम था। यह 2026 में स्थानीय LLM की कहानी है: क्वांटाइजेशन, Vulkan बैकएंड और Apple की Metal ने कई वर्कलोड को उस रेंज में ले आई है जहां iGPU या छोटा dGPU पर्याप्त है। आपको मॉडल स्थानीय रूप से चलाने के लिए $2,000 के रिग की जरूरत नहीं है।
यह गाइड स्थानीय LLM चलाने के लिए 8 ऐप्स कवर करता है, Intel Core Ultra 5 के साथ Arc iGPU, AMD Ryzen 7 के साथ Radeon 780M और Apple M2 पर परीक्षण किया गया। सभी 8 सही क्वांटाइजेशन के साथ 7B-14B रेंज में मॉडल चलाते हैं (10 टोकन प्रति सेकंड या बेहतर)। हमने सेटअप की सरलता, मॉडल संगतता और iGPU-क्लास हार्डवेयर पर ईमानदार प्रदर्शन को प्राथमिकता दी।
iGPU के लिए स्थानीय LLM रनर में क्या देखें
- कई बैकएंड. Vulkan Windows और Linux पर महान समीकरणकार है; यह AMD Radeon iGPU और Intel Arc iGPU को विक्रेता-लॉक किए गए टूलकिट के बिना हार्डवेयर त्वरण का उपयोग करने देता है। Metal Apple silicon पर समकक्ष है।
- GGUF समर्थन. GGUF वर्तमान de-facto क्वांटाइजेशन प्रारूप है। Q4_K_M या Q5_K_M iGPU-क्लास VRAM बजट के लिए सर्वश्रेष्ठ गति-से-गुणवत्ता व्यापार देता है।
- एक मॉडल कैटलॉग जिसका आपको पीछा नहीं करना पड़ता. सर्वश्रेष्ठ ऐप्स Hugging Face से वन-क्लिक मॉडल डाउनलोड के साथ आते हैं, इसलिए आप टोरेंट का पीछा नहीं कर रहे हैं।
- समझदारीपूर्ण डिफ़ॉल्ट. iGPU उपयोगकर्ता उन ऐप्स से लाभान्वित होते हैं जो संदर्भ लंबाई, थ्रेड गणना और GPU ऑफलोड प्रतिशत को पूर्व-कॉन्फ़िगर करते हैं बजाय आपको उन्हें मैन्युअल रूप से ट्यून करने के लिए।
- Chat UI प्लस API. सर्वश्रेष्ठ रनर OpenAI-संगत API सर्वर के रूप में दोहरी भूमिका निभाते हैं ताकि आप अन्य उपकरणों को उनकी ओर इंगित कर सकें।
- छोटा मेमोरी फुटप्रिंट. iGPU OS के साथ RAM साझा करता है। ऐप्स को प्राथमिकता दें जो आपको संदर्भ लंबाई को सीमित करने और मॉडल को निष्क्रिय होने पर अनलोड करने देते हैं।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ के लिए | मुफ्त योजना | शुरुआती कीमत | UI शैली |
|---|---|---|---|---|
| Ollama | स्थानीय मॉडल के लिए CLI + API | हां | मुफ्त (open source) | टर्मिनल या तीसरे पक्ष के क्लाइंट |
| LM Studio | पॉलिश किया गया डेस्कटॉप UI | हां | मुफ्त | नेटिव डेस्कटॉप |
| GPT4All | शुरुआत के अनुकूल डेस्कटॉप | हां | मुफ्त | नेटिव डेस्कटॉप |
| Jan | पूरी तरह से open source ChatGPT क्लोन | हां | मुफ्त | नेटिव डेस्कटॉप (Electron) |
| Msty | RAG के साथ सब कुछ एक में | हां | मुफ्त आधार | नेटिव डेस्कटॉप |
| KoboldCpp | रोलप्ले और रचनात्मक लेखन | हां | मुफ्त (open source) | Web UI |
| Text Generation WebUI | पावर-यूजर टिंकरिंग | हां | मुफ्त (open source) | Web UI |
| AnythingLLM | दस्तावेजों पर स्थानीय RAG | हां | मुफ्त (open source) | नेटिव डेस्कटॉप |
ऐप्स
1. Ollama, सर्वश्रेष्ठ CLI और API रनर
Ollama स्थानीय LLM के लिए एक मानक के सबसे करीब है। इसे इंस्टॉल करें, ollama run llama3.2:3b चलाएं, और आपके पास एक मिनट से कम में एक काम करने वाला मॉडल है। पर्दे के पीछे यह llama.cpp का उपयोग करता है जिसमें एक क्यूरेटेड मॉडल लाइब्रेरी, localhost:11434 पर OpenAI-संगत API और प्रति-मॉडल मेमोरी प्रबंधन है।
जहां यह कम पड़ता है: कोई निर्मित chat UI नहीं; आप ollama run को टर्मिनल में उपयोग करते हैं या एक क्लाइंट (Open WebUI, Msty, या Mac पर Enchanted) के साथ जोड़ते हैं। ollama.com पर मॉडल लाइब्रेरी क्यूरेटेड है लेकिन कच्चे Hugging Face एक्सेस की तुलना में सीमित है।
मूल्य निर्धारण:
- मुफ्त, open source (MIT)।
प्लेटफॉर्म: Windows, macOS (Apple silicon और Intel), Linux।
डाउनलोड: ollama.com/download या Homebrew / apt के माध्यम से।
निष्कर्ष: सर्वश्रेष्ठ बैकएंड, बस। इसे इंस्टॉल करें भले ही आप ऊपर एक अलग UI का उपयोग करने की योजना बना रहे हों।
2. LM Studio, सर्वश्रेष्ठ पॉलिश किया गया डेस्कटॉप UI
LM Studio llama.cpp को एक नेटिव डेस्कटॉप ऐप में लपेटता है जिसमें निर्मित Hugging Face मॉडल ब्राउज़र, वन-क्लिक डाउनलोड, प्रति-मॉडल प्रदर्शन बेंचमार्क और OpenAI-संगत API सर्वर है। GPU ऑफलोड सेटिंग्स Intel Arc, AMD और Apple silicon के लिए समझदारीपूर्ण डिफ़ॉल्ट के साथ उजागर की जाती हैं।
जहां यह कम पड़ता है: बंद-स्रोत (हालांकि मुफ्त)। कुछ उपयोगकर्ता रिपोर्ट करते हैं कि GUI निचले-अंत iGPU पर मॉडल को स्वयं की तुलना में अधिक RAM खाता है।
मूल्य निर्धारण:
- व्यक्तिगत उपयोग के लिए मुफ्त, वाणिज्यिक उपयोग के लिए लाइसेंस की आवश्यकता होती है।
प्लेटफॉर्म: Windows, macOS, Linux (बीटा)।
डाउनलोड: lmstudio.ai
निष्कर्ष: iGPU उपयोगकर्ताओं के लिए जो GUI पसंद करते हैं सर्वश्रेष्ठ शुरुआती बिंदु। उपभोक्ता हार्डवेयर के लिए सही डिफ़ॉल्ट के साथ आता है।
3. GPT4All, सर्वश्रेष्ठ शुरुआत के अनुकूल डेस्कटॉप
GPT4All Nomic द्वारा पैक का सबसे सुलभ है। इंस्टॉल करें, साइडबार से एक मॉडल चुनें, और यह डाउनलोड और चलता है। LocalDocs पेन कॉन्फ़िगरेशन के बिना फ़ाइलों के फ़ोल्डर पर सरल RAG जोड़ता है।
जहां यह कम पड़ता है: LM Studio की तुलना में छोटी मॉडल कैटलॉग। हमारे परीक्षणों में Ollama या LM Studio की तुलना में Windows पर धीमा।
मूल्य निर्धारण:
- मुफ्त।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: nomic.ai/gpt4all
निष्कर्ष: आपके कम तकनीकी पारिवारिक सदस्य को देने का विकल्प। उन्हें टर्मिनल को छुए बिना स्थानीय मॉडल चला रहा है।
4. Jan, सर्वश्रेष्ठ पूरी तरह से open source ChatGPT क्लोन
Jan एक पूरी तरह से open source डेस्कटॉप ऐप है जो ChatGPT के इंटरफेस की नकल करता है। यह bundled llama.cpp के माध्यम से स्थानीय मॉडल चलाता है, दूरस्थ API (OpenAI, Anthropic, Groq, Mistral) को विकल्प के रूप में जोड़ता है और प्रत्येक वार्तालाप को स्थानीय रूप से संग्रहीत करता है।
जहां यह कम पड़ता है: Electron-आधारित, इसलिए RAM फुटप्रिंट नेटिव ऐप्स से भारी है। बहु-पाली वार्तालाप कभी-कभी iGPU पर आक्रामक संदर्भ ट्रंकेशन के कारण संदर्भ खो देते हैं।
मूल्य निर्धारण:
- मुफ्त, open source (AGPL)।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: jan.ai
निष्कर्ष: सबसे खुला ChatGPT-समान। सर्वश्रेष्ठ यदि आप स्थानीय प्लस वैकल्पिक दूरस्थ के लिए एक एकल ऐप चाहते हैं।
5. Msty, RAG के साथ सर्वश्रेष्ठ सब कुछ एक में
Msty एक ऐप में स्थानीय मॉडल, दूरस्थ API, दस्तावेजों पर RAG और विभाजन-दृश्य वार्तालाप को जोड़ता है। इसकी “Knowledge Stacks” सुविधा PDF, Word दस्तावेज़ और पाठ फ़ाइलों के फ़ोल्डर को अनुक्रमित करती है ताकि आप वेक्टर डेटाबेस सेट किए बिना उनके साथ चैट कर सकें।
जहां यह कम पड़ता है: बंद-स्रोत। मुफ्त स्तर कुछ उन्नत RAG सुविधाओं को सीमित करता है।
मूल्य निर्धारण:
- मुफ्त आधार।
- Pro क्लाउड सिंक, उन्नत RAG और प्राथमिकता समर्थन जोड़ता है (उनकी साइट पर मूल्य)।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: msty.app
निष्कर्ष: यदि आप एक अलग वेक्टर स्टोर सेट किए बिना दस्तावेज़ चैट चाहते हैं तो पिक।
6. KoboldCpp, रोलप्ले और रचनात्मक लेखन के लिए सर्वश्रेष्ठ
KoboldCpp लंबे-रूप लेखन और रोलप्ले पर लक्षित llama.cpp के एक फोर्क के रूप में शुरू हुआ। इसमें विश्व सूचना, चरित्र मेमोरी और किताबें वाले एक web UI है जो अन्य रनर सतह नहीं करते हैं। बैकएंड iGPU के लिए Vulkan को समर्थन करता है।
जहां यह कम पड़ता है: UI स्लाइडर के साथ घना है जो केवल पावर-यूजर के लिए कुछ मायने रखता है। chat सहायक वर्कफ़्लो के लिए वास्तव में डिज़ाइन नहीं किया गया।
मूल्य निर्धारण:
- मुफ्त, open source (AGPL)।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: KoboldCpp GitHub releases।
निष्कर्ष: लेखकों और रोलप्लेयर्स के लिए जो लगातार पात्रों को चाहते हैं निचे चुन।
7. Text Generation WebUI, सर्वश्रेष्ठ पावर-यूजर टिंकरिंग
Text Generation WebUI (oobabooga) tinkerer का खेल का मैदान है। यह llama.cpp, ExLlama, Transformers और अधिक बैकएंड को समर्थन करता है, प्रत्येक पीढ़ी पैरामीटर को उजागर करता है और LoRA और fine-tuning के साथ एकीकृत करता है।
जहां यह कम पड़ता है: सेटअप शुरुआत के लिए नहीं है; Python venv के साथ 30 मिनट की install की उम्मीद रखें। web UI कार्यात्मक है लेकिन डिज़ाइन नहीं किया गया।
मूल्य निर्धारण:
- मुफ्त, open source (AGPL)।
प्लेटफॉर्म: Windows, macOS, Linux via Python।
डाउनलोड: oobabooga/text-generation-webui GitHub।
निष्कर्ष: सही चुनाव जब आप जानते हैं कि आप क्या ट्यून करना चाहते हैं और बेहतर ऐप में नहीं पहुंच सकते।
8. AnythingLLM, दस्तावेजों पर सर्वश्रेष्ठ स्थानीय RAG
AnythingLLM एक उद्देश्य-निर्मित RAG ऐप है जो स्थानीय (या दूरस्थ) LLM को एक दस्तावेज़ स्टोर के साथ जोड़ता है। एक फ़ोल्डर की ओर इशारा करें या फ़ाइलें छोड़ें, और यह उन्हें एक स्थानीय वेक्टर डेटाबेस में अनुक्रमित करता है। बहु-उपयोगकर्ता कार्यक्षेत्र विभिन्न परियोजनाओं के लिए संदर्भ को अलग करते हैं।
जहां यह कम पड़ता है: RAG-केंद्रित; शुद्ध चैट संभव है लेकिन बिंदु नहीं। सेटअप में chat मॉडल से अलग एक एम्बेडिंग मॉडल चुनना शामिल है, जो शुरुआत को भ्रमित करता है।
मूल्य निर्धारण:
- मुफ्त, open source (MIT)।
प्लेटफॉर्म: Windows, macOS, Linux, प्लस self-hosting के लिए Docker तैनाती।
डाउनलोड: anythingllm.com या Mintplex-Labs/anything-llm GitHub।
निष्कर्ष: यदि आप अपने स्वयं के दस्तावेज़ संग्रह को निजी में क्वेरी करना चाहते हैं तो पिक।
सही चुनाव कैसे करें
- यदि आप बिना परेशानी के सबसे तेजी से काम करने वाला स्थानीय मॉडल चाहते हैं: Ollama।
- यदि आप एक नेटिव GUI और समझदारीपूर्ण डिफ़ॉल्ट चाहते हैं: LM Studio।
- यदि आप स्थानीय LLM के लिए बिल्कुल नए हैं: GPT4All।
- यदि आप पूरी तरह से open source ChatGPT ईला चाहते हैं: Jan।
- यदि आप अपने PDF के साथ चैट करना चाहते हैं: AnythingLLM या Msty।
- यदि आप फिक्शन या रोलप्ले लिखते हैं: KoboldCpp।
- यदि आप प्रत्येक पैरामीटर को ट्यून करना चाहते हैं: Text Generation WebUI।
अधिकांश iGPU उपयोगकर्ताओं के लिए सर्वश्रेष्ठ जोड़ी सेटअप: Ollama बैकएंड के रूप में + LM Studio या Open WebUI क्लाइंट के रूप में। यह आपको सबसे तेजी से बैकएंड सबसे अनुकूल इंटरफेस के साथ देता है।
FAQ
Intel Arc iGPU के लिए सर्वश्रेष्ठ स्थानीय LLM ऐप क्या है?
LM Studio और Ollama दोनों Vulkan का उपयोग करते हैं और Intel Arc iGPU (Xe, Xe2, Xe-LPG) पर अच्छी तरह से काम करते हैं। मॉडल की पसंद ऐप की पसंद की तुलना में अधिक मायने रखती है; 7B-8B मॉडल के Q4_K_M क्वांटाइजेशन甜 spot हैं।
क्या मैं बिना एक discrete GPU के Ryzen APU पर स्थानीय LLM चला सकता हूं?
हां। Ryzen 7000 और 8000 सीरीज़ Radeon 780M / 890M iGPU Q4 क्वांटाइजेशन में Vulkan के माध्यम से 10 से 20 टोकन प्रति सेकंड पर 7B मॉडल चलाते हैं। यदि आप बड़े संदर्भ लोड करना चाहते हैं तो BIOS में ग्राफिक्स के लिए सिस्टम RAM आवंटन बढ़ाएं।
M2 या M3 के साथ MacBook के लिए सर्वश्रेष्ठ स्थानीय LLM क्या है?
Apple silicon M2 पर 20 से 40 टोकन प्रति सेकंड पर Llama 3.1 8B, Qwen 3 8B और Mistral 7B चलाता है। LM Studio और Ollama दोनों स्वचालित रूप से Metal का उपयोग करते हैं। 16GB unified memory पर Q4_K_M या Q5_K_M के साथ रहें।
क्या मुझे स्थानीय मॉडल चलाने के लिए Python जानने की जरूरत है?
नहीं। Ollama, LM Studio, GPT4All, Jan और Msty सभी Python के बिना वन-क्लिक इंस्टॉल हैं। Text Generation WebUI अपवाद है।
कौन सा स्थानीय LLM ऐप पूरी तरह से open source है?
Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI और AnythingLLM सभी open source हैं। LM Studio और Msty मुफ्त हैं लेकिन बंद-स्रोत हैं।
स्थानीय LLM के लिए मुझे कितना RAM चाहिए?
Q4 क्वांटाइजेशन में 7B-8B मॉडल के लिए, 16GB कुल सिस्टम RAM व्यवहार्य है और 32GB आरामदायक है। iGPU सिस्टम RAM साझा करता है, इसलिए तदनुसार बजट करें। 13B-14B मॉडल के लिए, न्यूनतम 32GB की योजना बनाएं।