2026 में एक उपयोगी स्थानीय मॉडल चलाने के लिए किसी को 24 GB कार्ड की आवश्यकता नहीं है। 7 से 14 बिलियन पैरामीटर के परिमाण मॉडल 8 से 12 GB VRAM में फिट होते हैं जिस गति से इस्तेमाल किया गया GTX 1080 या RTX 2080 आराम से पैदा करते हैं, और “केवल क्लाउड” और “अधिकांश समय स्थानीय” के बीच का अंतर अब ड्राइवर इंस्टॉलेशन और 4 GB डाउनलोड है। तरकीब रनटाइम है। कुछ ऐप्स नए RTX 50-series कार्ड को मानते हैं; अन्य को विशेष रूप से पुराने हार्डवेयर के लिए बनाया गया था जो घरेलू सर्वर चेसिस में बैठा है।
हमने पुराने NVIDIA GPU पर स्थानीय AI चलाने के लिए 8 डेस्कटॉप ऐप्स का परीक्षण किया, Pascal (GTX 10-series और Quadro P), Turing (RTX 20-series और Quadro T) और शुरुआती Ampere (RTX 30-series और वर्कस्टेशन A-series) पर ध्यान केंद्रित किया। सूची पर प्रत्येक ऐप Llama 3.1, Qwen 2.5, Mistral 7B या Gemma 2 को 8 GB VRAM पर उपयोग योग्य token-per-second दर के साथ चलाता है। कौन सा आपके सेटअप के अनुकूल है यह इस बात पर निर्भर करता है कि क्या आप एक चैट विंडो, एक सेवा, या एक निम्न-स्तरीय रनटाइम चाहते हैं।
पुराने GPU के लिए स्थानीय AI ऐप में क्या देखें
हार्डवेयर की बाधाएं मार्केटिंग प्रतिलिपि से अधिक महत्वपूर्ण हैं।
- CUDA 11 समर्थन, केवल CUDA 12 नहीं (Pascal Linux पर CUDA 12.6 पर सीमित, Windows पर बाद में)।
- परिमाण प्रारूप जो 8 GB में 7B को फिट करते हैं (GGUF Q4_K_M, Q5_K_M, या AWQ 4-bit)।
- परत अनलोडिंग ताकि एक 13B मॉडल अतिरिक्त परतों को CPU में डंप कर सके बिना बेकार हुए।
- एक क्लिक इंस्टॉलेशन जिसके लिए स्रोत से PyTorch को संकलित करने की आवश्यकता नहीं है।
- एक OpenAI-संगत API ताकि कोई भी क्लाइंट कस्टम शिम के बिना localhost पर इंगित कर सके।
- मॉडल डाउनलोड जो पुनः शुरू होता है और चेकसम को सत्यापित करता है (डायल-अप-युग का पैरानिया अभी भी मदद करता है)।
त्वरित तुलना
| ऐप | के लिए सर्वश्रेष्ठ | Windows / Linux | मुक्त योजना | अनोखी विशेषता | लाइसेंस |
|---|---|---|---|---|---|
| Ollama | Headless daemon और scripts | दोनों | मुक्त | एक-पंक्ति मॉडल पुल, CLI-प्रथम | MIT |
| LM Studio | सब-कुछ-में-एक चैट | दोनों | मुक्त | मॉडल ब्राउज़र + चैट + सर्वर | मालिकाना |
| KoboldCPP | एकल-executable रनटाइम | दोनों | मुक्त | कोई इंस्टॉल नहीं, GGUF, TTS, छवियां | AGPL 3.0 |
| text-generation-webui | Power-user tinker | दोनों | मुक्त | सभी परिमाण प्रारूप समर्थित | AGPL 3.0 |
| GPT4All | एक विनीत लैपटॉप पर पहला मॉडल | दोनों | मुक्त | LocalDocs साइडबार, कम-VRAM पूर्वनिर्धारित | MIT-जैसा |
| Jan | पूरी तरह से open-source LM Studio समकक्ष | दोनों | मुक्त | MCP समर्थन, OpenAI-संगत | Apache 2.0 |
| llama.cpp | बेयर-मेटल गति | दोनों | मुक्त | सबसे तेज CPU + आंशिक GPU अनलोड | MIT |
| vLLM | मल्टी-यूजर API सर्वर | Linux (Windows पर WSL) | मुक्त | Paged attention, सर्वश्रेष्ठ throughput | Apache 2.0 |
ऐप्स
1. Ollama – पुराने NVIDIA कार्डों पर सर्वश्रेष्ठ headless daemon
Ollama वह रनटाइम है जो अधिकांश लोग पहले इंस्टॉल करते हैं क्योंकि पूरी वर्कफ़्लो ollama pull llama3.1:8b है फिर ollama run llama3.1। GTX 1080 Ti (11 GB) पर, Llama 3.1 8B Q4_K_M 25 से 30 tokens प्रति सेकंड पर चलता है; RTX 2080 Super (8 GB) पर, समान मॉडल लगभग 40 पर चलता है। Ollama localhost:11434 पर एक OpenAI-compatible endpoint को बांधता है, और कोई भी frontend जो OpenAI बोलता है (Open WebUI, Msty, LibreChat) एक base URL परिवर्तन के साथ प्लग करता है।
जहां यह कम पड़ता है: चैट क्लाइंट एक टर्मिनल है। Ollama GUI के साथ नहीं आता है; ग्राफिकल उपयोग का मतलब Open WebUI या दूसरे frontend को जोड़ना है।
मूल्य निर्धारण:
- मुक्त: सब कुछ, MIT-licensed
- भुगतान: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: ollama.com
निचली पंक्ति: सही विकल्प जब लक्ष्य एक मॉडल को अन्य tools और scripts में परोसना है, एक ऐप में चैट नहीं करना।
2. LM Studio – पहली स्थापना के लिए सर्वश्रेष्ठ all-in-one
LM Studio “एक EXE डाउनलोड करें और पांच मिनट में एक मॉडल के साथ बात करें” विकल्प है। ऐप एक Hugging Face browser, chat pane, और localhost:1234 पर OpenAI-compatible server को expose करने के लिए एक toggle को बंडल करता है। VRAM detection पुराने कार्डों पर सटीक है, और मॉडल सूची चिन्हित करती है कि कौन सी builds पूरी तरह आपके GPU में फिट होती हैं बनाम जिन्हें CPU offload की आवश्यकता है।
जहां यह कम पड़ता है: क्लाइंट बंद स्रोत है। व्यावसायिक उपयोग के लिए LM Studio Team-लाइसेंस फॉर्म भरने और एक उद्धरण की प्रतीक्षा करने की आवश्यकता है।
मूल्य निर्धारण:
- मुक्त: व्यक्तिगत उपयोग
- भुगतान: अनुरोध पर Team लाइसेंस
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: lmstudio.ai
निचली पंक्ति: पुराने NVIDIA हार्डवेयर पर सबसे user-friendly पहली स्थापना, काम करने वाली चैट विंडो के लिए सबसे तेज़ मार्ग के साथ।
3. KoboldCPP – सर्वश्रेष्ठ zero-install रनटाइम
KoboldCPP एक एकल executable (koboldcpp.exe Windows पर, Linux पर static binary) है जो GGUF मॉडल, Stable Diffusion image generation, और Whisper transcription को बिना किसी Python environment के चलाता है। GTX 1660 Super (6 GB) पर, 7B Q4 मॉडल CPU को कुछ परतों के साथ unloaded होने पर भी फिट होता है, और समान executable apps के बिना switching के बिना quick image generation को संभालता है।
जहां यह कम पड़ता है: UI web-based है (browser tab में खुलता है) और polished के बजाय functional लगता है। Feature depth high है, discoverability low है।
मूल्य निर्धारण:
- मुक्त: सब कुछ, AGPL 3.0
- भुगतान: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: github.com/LostRuins/koboldcpp
निचली पंक्ति: जब लक्ष्य मशीन एक laptop, homelab, या friend का PC है जहां आप system-wide Python install नहीं करना चाहते।
4. text-generation-webui – power users के लिए सर्वश्रेष्ठ
text-generation-webui (oobabooga) हर quantisation format को support करता है जो मायने रखता है (GGUF, GPTQ, AWQ, exllamav2), आपको on the fly loaders को switch करने देता है, और low-level generation knobs (rope scaling, mirostat, dynamic temperature) को expose करता है जो अन्य apps hide करते हैं। RTX 3060 (12 GB) पर, यह खुशी से 20 से 30 tokens प्रति सेकंड में Q4 में एक 14B मॉडल चलाता है।
जहां यह कम पड़ता है: Installer कुछ gigabytes Python dependencies को pull करता है। पहला launch 5 से 10 मिनट लेता है। उस person के लिए tool नहीं जो एक चीज़ क्लिक करके chat करना चाहता है।
मूल्य निर्धारण:
- मुक्त: सब कुछ, AGPL 3.0
- भुगतान: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: github.com/oobabooga/text-generation-webui
निचली पंक्ति: उस user के लिए ideal जो model quantisations और generation strategies को same hardware पर compare करना चाहता है।
5. GPT4All – सर्वश्रेष्ठ low-VRAM starting point
GPT4All सबसे कम floor है: built-in मॉडल catalog 3B और 4B मॉडल को flag करती है जो 4 GB कार्ड पर चलते हैं, और LocalDocs sidebar बिना separate vector database के छोटे RAG jobs को handle करता है। GTX 1060 (6 GB) पर, Mistral 7B Instruct usable 15 से 20 tokens प्रति सेकंड पर चलता है।
जहां यह कम पड़ता है: GUI individual use के लिए design किया गया है; कोई built-in multi-user API नहीं है। Model catalog LM Studio या Ollama की तुलना में छोटा है।
मूल्य निर्धारण:
- मुक्त: सब कुछ
- भुगतान: कोई नहीं; enterprise support एक paid add-on है
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: gpt4all.io
निचली पंक्ति: 4 से 6 GB VRAM वाले laptop पर सही पहली स्थापना।
6. Jan – सर्वश्रेष्ठ fully open-source LM Studio equivalent
Jan वह है जो LM Studio दिखेगा अगर client स्वयं Apache 2.0 होता। First-party मॉडल catalog, OpenAI-compatible server localhost:1337 पर, Model Context Protocol support ताकि Claude Desktop और Continue एक Jan-hosted मॉडल को hit कर सकें, और कोई telemetry नहीं।
जहां यह कम पड़ता है: LM Studio से younger project; catalog छोटा है और कुछ Hugging Face quantisations बाद में आते हैं। Non-CUDA hardware पर Windows GPU acceleration अभी भी catching up है।
मूल्य निर्धारण:
- मुक्त: सब कुछ, Apache 2.0
- भुगतान: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: jan.ai
निचली पंक्ति: Open-source pick जब आप एक LM Studio-style ऐप चाहते हैं जिसका license आप afternoon में read कर सकते हैं।
7. llama.cpp – सर्वश्रेष्ठ bare-metal रनटाइम
llama.cpp C++ project है जिस पर बाकी ecosystem built है। यह everywhere चलता है, Linux पर पांच मिनट में compile होता है, और oldest GPUs पर fastest single-user throughput produce करता है क्योंकि driver और model के बीच कोई Python abstraction नहीं है। GTX 1080 Ti पर -ngl 33 के साथ, यह raw token rates को hit करता है जो higher-level apps को कुछ percent से trail करते हैं।
जहां यह कम पड़ता है: कोई installer नहीं, कोई GUI नहीं। आप compiling और command-line tools चला रहे हैं। Windows user के लिए first-time setup इस list पर किसी भी अन्य ऐप से अधिक काम है।
मूल्य निर्धारण:
- मुक्त: सब कुछ, MIT
- भुगतान: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: github.com/ggml-org/llama.cpp
निचली पंक्ति: Developers के लिए जो जानना चाहते हैं model file और first token के बीच बिल्कुल क्या होता है।
8. vLLM – Linux पर सर्वश्रेष्ठ multi-user API सर्वर
vLLM old workstation को small team की inference server में बदलने के लिए runtime है। Paged attention concurrent requests के साथ nearly linearly throughput को scale करता है, और 4-bit AWQ quantised मॉडल एक 24 GB card को दो या तीन people को simultaneously type करने देते हैं बिना stalling के। Linux पर natively चलता है; Windows users को WSL 2 with CUDA passthrough की जरूरत है।
जहां यह कम पड़ता है: Chat app नहीं। vLLM एक OpenAI-compatible server है और clients को hit करने की expect करता है। Small-model support fine है लेकिन project की optimisation focus bigger deployments पर है।
मूल्य निर्धारण:
- मुक्त: सब कुछ, Apache 2.0
- भुगतान: कोई नहीं
प्लेटफॉर्म: Linux (Windows पर WSL)
डाउनलोड: github.com/vllm-project/vllm
निचली पंक्ति: जब लक्ष्य एक private OpenAI clone है जो कुछ लोग share करते हैं।
सही को कैसे चुनें
- अगर अगले 10 मिनट में chat विंडो चाहते हैं: LM Studio या GPT4All।
- अगर models को अन्य tools में serve कर रहे हैं: Ollama।
- अगर same experience open-source चाहते हैं: Jan।
- अगर आपकी मशीन system-wide कुछ भी install नहीं कर सकती: KoboldCPP।
- अगर performance के आखिरी few percent को squeeze करना चाहते हैं: llama.cpp।
- अगर model builds और quantisations को A/B करना चाहते हैं: text-generation-webui।
- अगर small team मशीन को share करने जा रहा है: Linux पर vLLM।
FAQ
GPU को स्थानीय AI चलाने के लिए कितना पुराना बहुत पुराना है?
4 GB VRAM और Compute Capability 6.0 या higher (Pascal onwards) वाले कार्ड comfortably 3B और 4B मॉडल को चला सकते हैं। 4 GB से नीचे, practical answer small मॉडल के साथ CPU-only inference है।
क्या GTX 1080 Ti को 2026 में still sense बनता है?
Local AI के लिए हाँ। इसके पास 11 GB VRAM, wide CUDA 12 support, और 7B और 8B मॉडल के लिए 25 से 30 tokens प्रति सेकंड पर sufficient compute है। High resolutions पर image generation के लिए insufficient है।
पुराने कार्डों के लिए कौन सा quantisation format सर्वश्रेष्ठ है?
Chat quality के लिए GGUF Q4_K_M या Q5_K_M, vLLM use करते समय maximum throughput के लिए AWQ 4-bit। GPTQ अभी भी काम करता है लेकिन format silently retired किया जा रहा है।
क्या मैं AMD या Intel GPUs पर ये ऐप्स चला सकता हूं?
Ollama, LM Studio, KoboldCPP, और llama.cpp कई AMD कार्डों पर Vulkan या ROCm को support करते हैं। Intel Arc को llama.cpp में SYCL के through और कुछ forks में OpenVINO के through support किया जाता है। यह article NVIDIA पर focus करता है क्योंकि वहीं पुराने-कार्ड conversation रहता है।
क्या मुझे telemetry के बारे में चिंता करनी चाहिए?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All, और vLLM कोई telemetry के साथ नहीं आते। LM Studio के settings में telemetry toggles हैं; पहली run पर opt out करें।