
वह पुराना गेमिंग PC जो आपकी अलमारी में पड़ा है, अभी भी बहुत कुछ करने में सक्षम है। 2018 के दौर का Ryzen या Intel वाला मशीन, 32 GB RAM और एक इस्तेमाल किया हुआ GPU, 7B मॉडल को बातचीत की गति से चलाएगा और 13B मॉडल को आराम से संभाल सकता है। पारिवारिक लैपटॉप्स को इस पर इशारा करें और आपके पास एक निजी, हमेशा-चालू AI है जो LAN पर कुछ सेकंड में जवाब देता है। पुराने PC को स्थानीय AI सर्वर में बदलने वाले सर्वश्रेष्ठ ऐप्स अपने मॉडल्स को अच्छी तरह चुनते हैं, अन्य टूल्स के लिए HTTP API प्रदान करते हैं और मशीन को क्वेरी के बीच सोने देते हैं। हमने सात ऐप्स चुने हैं जो दस साल पुराने हार्डवेयर को एक उपयोगी AI सेवा में बदल देते हैं।
स्थानीय AI सर्वर ऐप में क्या देखें
पुराने हार्डवेयर पर AI के लिए छह चीजें महत्वपूर्ण हैं:
- Backend और फॉर्मेट।
llama.cpp(GGUF) सबसे व्यापक समर्थन देता है; MLC और ONNX विकल्प हैं। - केवल CPU पथ। क्या ऐप GPU के बिना मशीन पर उपयोगी गति से चलता है।
- GPU समर्थन की व्यापकता। Nvidia (CUDA), AMD (ROCm), Intel (SYCL) और Apple Silicon (Metal)।
- समवर्ती अनुरोध हैंडलिंग। क्या परिवार एक साथ क्वेरी कर सकता है बिना एक दूसरे को भूखा रखे।
- OpenAI-संगत API। क्या अन्य टूल्स सर्वर की ओर इशारा कर सकते हैं और सोच सकते हैं कि वे OpenAI API से बात कर रहे हैं।
- मेमोरी की सीमा। RAM प्लस VRAM तय करता है कि कौन सा मॉडल फिट होगा। Q4 क्वांटाइजेशन मेमोरी की जरूरत को लगभग आधा कर देता है।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ | GPU समर्थन | API | विशेषता |
|---|---|---|---|---|
| Ollama | सबसे सरल सर्वर | Nvidia, AMD, Apple | OpenAI-संगत | एक कमांड मॉडल चलाता है |
| LM Studio | दोस्ताना UI | Nvidia, AMD, Apple | OpenAI-संगत | सर्वश्रेष्ठ मॉडल खोज |
| Jan | पूरी तरह स्थानीय ChatGPT | Nvidia, AMD, Apple | OpenAI-संगत | एक ऐप में चैट और सर्वर |
| GPT4All | केवल CPU आधार | Nvidia, AMD, CPU | स्थानीय API | पुराने हार्डवेयर पर चलता है |
| llama.cpp | बेयर-मेटल नियंत्रण | Nvidia, AMD, Apple, CPU | शुद्ध HTTP | अधिकांश ऐप्स का इंजन |
| Open WebUI | Ollama के लिए वेब फ्रंटएंड | कोई भी (क्लाइंट) | Ollama से बात करता है | LAN के लिए ChatGPT जैसा UI |
| LocalAI | OpenAI की सीधी जगह | Nvidia, AMD, CPU | OpenAI-संगत | छवियां, ऑडियो, एंबेडिंग भी परोसता है |
ऐप्स
1. Ollama, सर्वश्रेष्ठ “एक कमांड में मॉडल चलाने के लिए”
Ollama एक बैकग्राउंड सेवा प्रदान करता है जो क्यूरेटेड लाइब्रेरी से मॉडल्स को पुल, क्वांटाइज और परोसता है। एक कमांड (ollama run llama3.2) वजन डाउनलोड करता है, मॉडल लोड करता है और उपयोगकर्ता को चैट में डालता है। सेवा localhost:11434 पर एक OpenAI-संगत एंडपॉइंट उजागर करती है, इसलिए कोई भी टूल जो OpenAI से बात करता है पुराने PC की ओर इशारा कर सकता है और एक जैसा व्यवहार पा सकता है।
कहां असफल होता है: Ollama की अपनी लाइब्रेरी कस्टम मैनिफेस्ट फॉर्मेट का उपयोग करती है। Hugging Face से एक यादृच्छिक GGUF लाने के लिए एक छोटी Modelfile और आयात कदम की जरूरत होती है।
कीमत: निःशुल्क, MIT लाइसेंस।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: Ollama
निष्कर्ष: यहीं से शुरू करें। इसे इंस्टॉल करें, एक कमांड चलाएं, और LAN के पास एक AI सर्वर है।
2. LM Studio, सर्वश्रेष्ठ दोस्ताना UI के लिए
LM Studio एक डेस्कटॉप ऐप है जो Hugging Face को ब्राउज करता है, GGUF मॉडल्स डाउनलोड करता है और उन्हें स्थानीय रूप से चलाता है। इसमें एक चैट इंटरफेस और “स्थानीय सर्वर” टॉगल है जो एक OpenAI-संगत एंडपॉइंट उजागर करता है। UI डाउनलोड से पहले अनुमानित RAM और VRAM उपयोग दिखाता है, जो क्वांटाइजेशन चुनते समय वाकई उपयोगी है।
कहां असफल होता है: बंद स्रोत। ऐप के कुछ हिस्से स्थानीय उपयोग के लिए भी इंटरनेट कनेक्टिविटी पर निर्भर हैं, हालांकि मॉडल ऑफलाइन चलता है।
कीमत: व्यक्तिगत उपयोग के लिए निःशुल्क।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: LM Studio
निष्कर्ष: जब पुराना PC चलाने वाला दोस्त टर्मिनल को छूना नहीं चाहता है तो यह चुनें।
3. Jan, सर्वश्रेष्ठ पूरी तरह स्थानीय ChatGPT क्लोन
Jan एक डेस्कटॉप ऐप है जो ChatGPT जैसे क्लाइंट, मॉडल मैनेजर और स्थानीय API सर्वर एक बंडल में आता है। मॉडल डाउनलोड दिखाई देते हैं, और “सर्वर मोड” एक ही मॉडल्स को LAN पर अन्य ऐप्स के लिए उपलब्ध बनाता है। पूरा डिज़ाइन ओपन-सोर्स और गोपनीयता-प्रथम है।
कहां असफल होता है: Ollama और LM Studio से नया; मॉडल समर्थन पर कभी-कभी खुरदरे किनारे।
कीमत: निःशुल्क, AGPL लाइसेंस।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: Jan
निष्कर्ष: अगर लक्ष्य एक ऐप है जो LAN पर चैट क्लाइंट और सर्वर दोनों की तरह काम करता है।
4. GPT4All, सर्वश्रेष्ठ केवल CPU आधार
GPT4All उस स्थिति के लिए बनाया गया है जहां बिल्कुल कोई GPU नहीं है। यह CPU पर GGUF मॉडल्स को चलाता है 2018 के बाद से किसी भी मशीन पर उपयोगी प्रदर्शन के साथ। डेस्कटॉप ऐप मॉडल्स को प्रबंधित करता है, और एक स्थानीय API सर्वर सेटिंग्स से चालू किया जा सकता है।
कहां असफल होता है: CPU पर गति मेमोरी बैंडविड्थ द्वारा सीमित होती है। GPU के बिना आधुनिक CPU पर 7B मॉडल पर 4 से 8 tok/s की उम्मीद करें।
कीमत: निःशुल्क, MIT लाइसेंस।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड: GPT4All
निष्कर्ष: GPU के बिना कार्यालय PC के लिए। यह अभी भी एक सहायक चलाता है।
5. llama.cpp, सर्वश्रेष्ठ बेयर-मेटल नियंत्रण
llama.cpp वह इंजन है जो ऊपर के अधिकांश ऐप्स को लपेटते हैं। इसे सीधे चलाना पुराने हार्डवेयर पर सबसे तेज़ रास्ता है क्योंकि कोई ओवरहेड नहीं है। llama-server बाइनरी एक HTTP एंडपॉइंट उजागर करता है; llama-cli बाइनरी इंटरैक्टिव चैट चलाता है। सब कुछ एक C++ प्रोजेक्ट है कोई रनटाइम के बिना।
कहां असफल होता है: केवल कमांड-लाइन। कॉन्फ़िगरेशन फ्लैग में रहता है, UI में नहीं।
कीमत: निःशुल्क, MIT लाइसेंस।
प्लेटफॉर्म: Windows, macOS, Linux (हर जगह स्रोत से बनता है)।
डाउनलोड: GitHub
निष्कर्ष: जब लक्ष्य पुरानी मशीन से हर आखिरी token प्रति सेकंड निचोड़ना हो।
6. Open WebUI, सर्वश्रेष्ठ वेब फ्रंटएंड
Open WebUI एक स्व-होस्टेड वेब UI है जो Ollama (या किसी OpenAI-संगत एंडपॉइंट) से बात करता है। इसे पुराने PC पर इंस्टॉल करें, और LAN पर हर डिवाइस को http://server-ip:3000 पर एक ChatGPT जैसा पृष्ठ मिलता है। उपयोगकर्ता, अनुमतियां, RAG दस्तावेज़ और मल्टी-मॉडल राउटिंग सभी अंतर्निहित हैं।
कहां असफल होता है: एक मॉडल बैकएंड के शीर्ष पर चलता है, इसलिए पीछे Ollama या OpenAI-संगत सर्वर की जरूरत है।
कीमत: निःशुल्क, स्व-होस्टेड; BSD-3-Clause।
प्लेटफॉर्म: किसी भी होस्ट पर Docker।
डाउनलोड: GitHub
निष्कर्ष: वह उपयोगकर्ता इंटरफेस जो अधिकांश परिवार चाहते हैं। इसे Ollama के ठीक बाद इंस्टॉल करें।
7. LocalAI, सर्वश्रेष्ठ OpenAI की सीधी जगह
LocalAI LAN पर OpenAI API को बदलता है। चैट समाप्ति, एंबेडिंग, छवि निर्माण (Stable Diffusion), पाठ-से-भाषण और भाषण-से-पाठ सभी उसी HTTP एंडपॉइंट के पीछे रहते हैं जो OpenAI उपयोग करता है। OpenAI SDK वाले कोई भी टूल एक env चर बदलकर LocalAI के खिलाफ काम करते हैं।
कहां असफल होता है: व्यापक दायरा का अर्थ है धीमी स्टार्टअप। प्रत्येक मॉडेलिटी के अपने मॉडल विकल्प हैं।
कीमत: निःशुल्क, MIT लाइसेंस।
प्लेटफॉर्म: Linux, Windows (WSL2), macOS पर Docker।
निष्कर्ष: जब लक्ष्य एक बार में कई ऐप्स में OpenAI को स्थानीय सर्वर से बदलना हो।
सही संयोजन कैसे चुनें
एक home-lab सेटअप के लिए जिसे केवल काम करना है: Ollama प्लस Open WebUI। एक LAN पर मॉडल्स परोसता है; दूसरा परिवार को एक पृष्ठ देता है।
एक दोस्त के लिए जो टर्मिनल को छूना पसंद नहीं करता: डेस्कटॉप पर LM Studio और उन्हें स्थानीय रूप से चैट करने दें।
एक पुराने केवल CPU कार्यालय बॉक्स के लिए: 3B मॉडल के साथ GPT4All। या llama.cpp एक ही मॉडल के साथ अगर टर्मिनल ठीक है।
एक all-in-one जो चैट और सर्वर दोनों देता है बिना दो ऐप्स में विभाजित हुए: Jan।
कई AI टूल्स चलाने वाले घर के लिए (व्यक्तिगत सहायक, कोडिंग IDE, नोट ऐप्स): LocalAI ताकि हर टूल एक OpenAI जैसा एंडपॉइंट देखे।
FAQ
मुझे पहले कौन सा मॉडल चलाना चाहिए? Llama 3.2 3B या Qwen 2.5 3B Q4_K_M पर। दोनों 4 GB RAM में फिट होते हैं, अकेले आधुनिक CPU पर 15 से 30 tok/s पर चलते हैं, और सामान्य सवालों के लिए लगभग फ्लैगशिप जवाब देते हैं।
क्या मुझे GPU की जरूरत है? नहीं, लेकिन यह बदलता है कि आप क्या चला सकते हैं। GPU के बिना, 7B मॉडल 5 से 10 tok/s पर उम्मीद करें। यहां तक कि एक इस्तेमाल किया हुआ Nvidia RTX 3060 (12 GB) के साथ भी, 13B मॉडल 30 से 50 tok/s पर व्यावहारिक हो जाता है।
मुझे कितना RAM चाहिए? 7B मॉडल्स के लिए 16 GB न्यूनतम है। 32 GB 13B क्षेत्र को खोलता है। 64 GB या उससे अधिक 34B और 70B को पकड़ना शुरू करता है (क्वांटाइजेशन के साथ)।
क्या मैं इसे घर के बाहर से एक्सेस कर सकता हूं? हां, Tailscale जैसे mesh VPN पर। एक Ollama या LocalAI एंडपॉइंट को सार्वजनिक इंटरनेट पर उजागर न करें। डिफ़ॉल्ट रूप से कोई built-in auth नहीं है।
एक पुरानी PC निष्क्रिय अवस्था में कितनी शक्ति खींचती है? GPU वाली पुरानी डेस्कटॉप 40 से 80 W निष्क्रिय पर रहती है। यह अधिकांश बाज़ारों में प्रति वर्ष $50 से $100 बिजली है। अगर मशीन को दिन में कुछ बार ही क्वेरी किया जाता है, BIOS में wake-on-LAN सेट करें और सेशन के बीच सो जाएं।
यह Mac mini पर Ollama चलाने से कैसे तुलना करता है? 16 या 24 GB unified memory वाला Apple Silicon Mac mini सबसे ऊर्जा-कुशल रास्ता है। अगर पुराना PC अन्यत्र मूल्य रखता है, तो इसे रखें। अगर शुरुआत करते हैं, तो एक इस्तेमाल किया हुआ M1 mini अक्सर वाट प्रति token में 2018 के टावर को हराता है।