Ollama — Proxmox होम लैब्स के लिए सबसे लोकप्रिय स्थानीय LLM सर्वर

ChatGPT या Claude को भेजा गया हर संदेश बिल्डिंग से बाहर चला जाता है। अधिकांश लोगों के लिए, यह व्यापार ठीक है। होम लैब मालिकों की बढ़ती संख्या के लिए ऐसा नहीं है, और एक Proxmox सर्वर जो पहले से ही Plex, Home Assistant और Pi-hole चला रहा है, ठीक उतना ही CPU, RAM और (अक्सर) GPU है जो एक स्थानीय भाषा मॉडल को चाहिए। एक स्व-होस्टर द्वारा हाल की एक रिपोर्ट जिसने क्लाउड AI को Proxmox पर स्थानीय LLM के लिए छोड़ दिया, ने अपील को अच्छी तरह से संक्षेप में कहा: हार्डवेयर पहले से ही भुगतान किया गया था, इसलिए मॉडल वह चीज़ बन गई जिसने आखिरकार पूरी होम लैब को लायक बना दिया। हमने इसे प्राप्त करने के लिए VM या LXC कंटेनर में चलाने योग्य सात ऐप्स एकत्र किए, सेटअप प्रयास, हार्डवेयर दक्षता और दैनिक अनुभव ChatGPT तक कितना करीब है इसके आधार पर रैंक किया। ये इस साल Proxmox पर स्थानीय LLM होस्ट करने के लिए सर्वश्रेष्ठ ऐप्स हैं।

Proxmox LLM होस्ट में क्या देखें

हर स्थानीय LLM प्रोजेक्ट को एक हाइपरविजर पर बिना सिर के चलाने के लिए नहीं बनाया गया है। कुछ चीजें इंस्टॉल करने योग्य को उन लोगों से अलग करती हैं जो आपसे लड़ेंगे।

त्वरित तुलना

ऐप्स सर्वश्रेष्ठ है परिनियोजन मुफ़्त स्तर GPU समर्थन
Ollama समग्र Proxmox होस्ट Linux VM, LXC, Docker मुफ़्त, ओपन-सोर्स NVIDIA, AMD (ROCm), CPU
Open WebUI Ollama के ऊपर सर्वश्रेष्ठ UI समान VM/LXC पर Docker मुफ़्त, ओपन-सोर्स बैकएंड GPU विरासत में लेता है
LM Studio डेस्कटॉप पर मॉडल खोज डेस्कटॉप ऐप्लिकेशन (बिना सिर के नहीं) मुफ़्त NVIDIA, Apple Silicon
text-generation-webui उन्नत और पुराने मॉडल प्रारूप Linux VM, Docker मुफ़्त, ओपन-सोर्स NVIDIA, AMD, CPU
vLLM उच्च-थ्रूपुट, उत्पादन परिवेशन Linux VM, Docker मुफ़्त, ओपन-सोर्स NVIDIA (सर्वश्रेष्ठ), AMD (आंशिक)
llama.cpp server सबसे पतला, GGUF-देशी Linux VM, LXC, Docker मुफ़्त, ओपन-सोर्स NVIDIA, AMD, Apple Silicon, CPU
LocalAI OpenAI-API ड्रॉप-इन प्रतिस्थापन Linux VM, LXC, Docker मुफ़्त, ओपन-सोर्स NVIDIA, CPU

7 ऐप्स रैंक किए गए

1. Ollama — समग्र रूप से सर्वश्रेष्ठ

Ollama वह ऐप्लिकेशन है जिस पर अधिकांश Proxmox होम लैब मालिक पहले पहुंचते हैं, और आमतौर पर वह होता है जिसके साथ वे रहते हैं। इंस्टॉलेशन एक Debian या Ubuntu VM के अंदर एक एकल शेल कमांड है (या सही कर्नेल मॉड्यूल वाली एक विशेषाधिकार प्राप्त LXC कंटेनर), और एक मॉडल खींचना ollama run llama3 जितना आसान है। यह डिफ़ॉल्ट रूप से पोर्ट 11434 पर एक OpenAI-संगत API को उजागर करता है, जिसका अर्थ है कि Home Assistant, Continue.dev और दर्जनों अन्य उपकरण इसके साथ बिना अतिरिक्त कॉन्फ़िगरेशन के जुड़ते हैं।

जहां यह कम है: बंडल किया गया इंटरफेस एक कमांड-लाइन चैट है, एक वेब UI नहीं, इसलिए अधिकांश लोग इसे Open WebUI या समान फ्रंटएंड के साथ जोड़ते हैं। LXC कंटेनर में GPU पास-थ्रू के लिए NVIDIA ड्राइवर को होस्ट और कंटेनर के बीच बिल्कुल मेल खाना की आवश्यकता होती है, जो VM मार्ग की तुलना में शुरुआती लोगों को ज्यादा परेशान करता है।

मूल्य: मुफ़्त, ओपन-सोर्स।

प्लेटफॉर्म: Linux VM, LXC, Docker, साथ ही लैब के बाहर स्थानीय परीक्षण के लिए Windows और macOS पर देशी।

डाउनलोड: ollama.com

निचली पंक्ति: Proxmox LLM होस्ट के लिए डिफॉल्ट विकल्प, और बैकएंड जिस पर इस सूची के अधिकांश अन्य ऐप्स बनाए गए हैं।

2. Open WebUI — Ollama के ऊपर सर्वश्रेष्ठ UI

Open WebUI Ollama को कुछ ऐसा बनाता है जो सच में ChatGPT की तरह दिखता और महसूस करता है: चैट इतिहास, एकाधिक बातचीत, ड्रॉपडाउन से मॉडल स्विचिंग, पुनः प्राप्ति के साथ दस्तावेज़ अपलोड, और प्रति-उपयोगकर्ता अनुमतियों के साथ बहु-उपयोगकर्ता लॉगिन। यह Ollama के बगल में अपने स्वयं के Docker कंटेनर में चलता है, इसलिए दोनों एक LXC कंटेनर या एक छोटे VM में आराम से फिट होते हैं।

परिवार या गृहस्थ परिनियोजन यहां सबसे अधिक लाभान्वित होते हैं। प्रत्येक व्यक्ति को अपना लॉगिन, अपना चैट इतिहास, और एक व्यवस्थापक सेट कर सकता है कि कौन से मॉडल किसके लिए उपलब्ध हैं।

जहां यह कम है: यह एक फ्रंटएंड है, मॉडल सर्वर नहीं, इसलिए यह पूरी तरह से Ollama (या अन्य OpenAI-संगत बैकएंड) पर निर्भर है जो पहले से ही इसके नीचे चल रहा है। अनुमति और उपयोगकर्ता-प्रबंधन स्क्रीन पहली बार आराम करने में कुछ मिनट लगते हैं।

मूल्य: मुफ़्त, ओपन-सोर्स।

प्लेटफॉर्म: Ollama के साथ Linux VM या LXC कंटेनर पर Docker।

डाउनलोड: github.com/open-webui/open-webui

निचली पंक्ति: जो कोई चाहता है कि परिवार वास्तव में स्थानीय LLM का उपयोग करे अलावा केवल जिस व्यक्ति ने इसे सेटअप किया।

3. LM Studio — मॉडल खोज के लिए सर्वश्रेष्ठ

LM Studio Windows, macOS और Linux के लिए एक पॉलिश किया गया डेस्कटॉप ऐप है जो Hugging Face मॉडल को ब्राउज़ करने, डाउनलोड करने और परीक्षण करने को सुखद बनाता है, एक बिल्ट-इन कैटलॉग के साथ, डाउनलोड से पहले RAM और VRAM अनुमान, और एक स्थानीय सर्वर मोड जो उसी OpenAI-संगत API को उजागर करता है जो इस सूची के अन्य ऐप्स उपयोग करते हैं। यह Ollama की तुलना में Proxmox-देशी कम है, क्योंकि यह एक वर्कस्टेशन पर GUI के साथ चलाने के लिए डिज़ाइन किया गया है अलावा कंटेनर में बिना सिर के, लेकिन यह यहां एक स्थान अर्जित करता है क्योंकि यह Proxmox परिनियोजन के लिए प्रतिबद्ध होने से पहले यह पता लगाने का सबसे तेज़ तरीका है कि कौन सा मॉडल वास्तव में आपके हार्डवेयर में फिट बैठता है।

कुछ होम लैब मालिक विशुद्ध रूप से मॉडल अनुसंधान के लिए डेस्कटॉप मशीन पर LM Studio चलाते हैं, फिर Proxmox बॉक्स पर Ollama में विजयी मॉडल खींचते हैं सदा-चालू सर्वर के लिए।

जहां यह कम है: इसे VM के अंदर बिना सिर के चलाना काम करता है लेकिन ऐप्लिकेशन के बिंदु को खो देता है, क्योंकि GUI मुख्य आकर्षण है। यह होम लैब सर्वर चाहते हैं इस प्रकार की अनुपस्थित, बूट-और-भूलना संचालन के लिए बनाया नहीं गया है।

मूल्य: मुफ़्त।

प्लेटफॉर्म: Windows, macOS, Linux डेस्कटॉप (कंटेनर-देशी नहीं)।

डाउनलोड: lmstudio.ai

निचली पंक्ति: परिनियोजन से पहले टोही उपकरण के रूप में उपयोगी, Proxmox होस्ट स्वयं नहीं।

4. text-generation-webui — उन्नत और पुराने मॉडल प्रारूप के लिए सर्वश्रेष्ठ

text-generation-webui, अक्सर इसके निर्माता के बाद “oobabooga” कहा जाता है, इस सूची का दिग्गज है और अभी भी सबसे व्यापक प्रारूप समर्थन वाला ऐप है: GGUF, GPTQ, AWQ और EXL2 सभी एक ही इंटरफेस के माध्यम से लोड होते हैं, LoRA फाइन-ट्यून समर्थन के साथ और नोटबुक-शैली कच्चे पूर्ण मोड। जो कोई भी एक पुराने या अधिक अस्पष्ट मॉडल को चला रहा है जिसके लिए नए उपकरणों ने समर्थन बंद कर दिया है, यह आमतौर पर वह जगह है जहां यह अभी भी काम करता है।

वेब UI चरित्र कार्ड, चैट प्रीसेट और दीर्घकालीन स्मृति और आवाज़ जैसी चीजों के लिए एक्सटेंशन शामिल करता है, एक स्वच्छ दैनिक-ड्राइवर चैट अनुभव की तुलना में शौक-टिंकरिंग पर अधिक लक्षित सुविधा।

जहां यह कम है: इंटरफेस अपनी उम्र Open WebUI के बगल में दिखाता है, और सेटिंग्स और एक्सटेंशन की बड़ी संख्या उस व्यक्ति को भारी कर सकती है जो केवल एक कार्यप्रवाह चैट बॉक्स चाहता है। अपडेट कभी-कभी विशिष्ट क्वांटाइज़ेशन प्रारूपों के साथ संगतता को तोड़ देते हैं।

मूल्य: मुफ़्त, ओपन-सोर्स।

प्लेटफॉर्म: Linux VM, Docker, Windows और macOS पर भी चलता है।

डाउनलोड: github.com/oobabooga/text-generation-webui

निचली पंक्ति: असामान्य मॉडल प्रारूप या फाइन-ट्यून चलाने वाले टिंकर के लिए सही विकल्प जो अन्य सर्वर समर्थन नहीं करते।

5. vLLM — उच्च-थ्रूपुट और उत्पादन सेवा के लिए सर्वश्रेष्ठ

vLLM इस सूची के अधिकांश से एक अलग समस्या के लिए बनाया गया है: कई एक साथ अनुरोधों को तेजी से देना, GPU स्मृति को लोड के तहत कुशल रखने के लिए PagedAttention का उपयोग करते हुए। एक Proxmox बॉक्स पर जिसमें एक उचित GPU पास किया गया है, vLLM Ollama को एक व्यापक मार्जिन से बेहतर करेगा जब कई लोग या कई अनुप्रयोग एक साथ मॉडल को मारते हैं, जो एक होम लैब के लिए महत्वपूर्ण है जो कई सेवाओं के पीछे एक LLM चलाता है (कोडिंग सहायक, चैट UI और ऑटोमेशन पाइपलाइन, सभी एक साथ)।

यह OpenAI API को नेटिव रूप से बोलता है, इसलिए यह Ollama से बात करने वाले उसी उपकरणों में फिट बैठता है।

जहां यह कम है: सेटअप भारी है, GPU आवश्यकताएं सख्त हैं, और सिंगल-यूजर चैट प्रदर्शन यहां सरल विकल्पों से काफी बेहतर नहीं है। CPU-केवल या कम VRAM होम लैब्स इससे कम लाभ प्राप्त करते हैं।

मूल्य: मुफ़्त, ओपन-सोर्स।

प्लेटफॉर्म: GPU पास-थ्रू, Docker के साथ Linux VM।

डाउनलोड: github.com/vllm-project/vllm

निचली पंक्ति: सिंगल-यूजर ChatGPT प्रतिस्थापन के लिए ओवरकिल, लेकिन सही उपकरण एक बार होम लैब एक साथ कई अनुप्रयोगों या लोगों के लिए स्थानीय मॉडल परोसना शुरू करता है।

6. llama.cpp server — सबसे पतला, GGUF-देशी

llama.cpp C++ अनुमान इंजन है जो इस सूची के अधिकांश ऐप्स हुड के नीचे चलाते हैं, और इसका अपना बंडल किया गया सर्वर (llama-server) एक GGUF मॉडल को किसी भी अतिरिक्त परत के बिना OpenAI-संगत API के ऊपर उजागर करने का सबसे पतला तरीका है। संसाधन उपयोग इस सूची में सबसे कम है, जो एक छोटे LXC कंटेनर या Proxmox होस्ट के लिए एक मजबूत विकल्प बनाता है जिसे उसी हार्डवेयर पर अन्य सेवाओं को भी चलाना होगा।

यह एक न्यूनतम बिल्ट-इन वेब चैट इंटरफेस, कार्यात्मक लेकिन सादा शामिल करता है, जो शीर्ष पर Open WebUI जोड़े बिना बुनियादी उपयोग के लिए पर्याप्त है।

जहां यह कम है: कोई मॉडल प्रबंधक नहीं, कोई बहु-उपयोगकर्ता खाते नहीं, और कॉन्फ़िगरेशन एक सेटिंग्स स्क्रीन की तुलना में कमांड-लाइन झंडे के माध्यम से होता है। यह उस व्यक्ति को पुरस्कृत करता है जो टर्मिनल के साथ सहज है उस व्यक्ति से अधिक जो एक पॉइंट-एंड-क्लिक सेटअप चाहता है।

मूल्य: मुफ़्त, ओपन-सोर्स।

प्लेटफॉर्म: Linux VM, LXC, Docker, Windows, macOS और Apple Silicon पर भी निर्मित।

डाउनलोड: github.com/ggerganov/llama.cpp

निचली पंक्ति: न्यूनतम हार्डवेयर पर एक मॉडल को निचोड़ने या सीमित संसाधन LXC कंटेनर का विकल्प।

7. LocalAI — सर्वश्रेष्ठ OpenAI-API ड्रॉप-इन प्रतिस्थापन

LocalAI OpenAI API के लिए लगभग एक कुल ड्रॉप-इन प्रतिस्थापन होने का लक्ष्य रखता है, चैट पूर्ण होने के साथ ही नहीं बल्कि छवि पीढ़ी, पाठ-से-बोली और एक ही इंटरफेस के पीछे एम्बेडिंग को कवर करता है। एक होम लैब के लिए जो पहले से ही OpenAI API को कॉल करने के लिए जुड़े अनुप्रयोगों या स्वचालन है, LocalAI उस एकीकरण बिंदु को अपरिवर्तित रहने देता है जबकि वास्तविक अनुमान Proxmox बॉक्स पर स्थानीय रूप से होती है।

यह llama.cpp सहित बैकएंड की एक विस्तृत श्रृंखला का समर्थन करता है, इसलिए वही सर्वर यह पर निर्भर करता है कि दिया गया अनुरोध क्या कई विभिन्न मॉडल प्रारूप चला सकता है।

जहां यह कम है: समर्थित मॉडल प्रकारों की चौड़ाई Ollama जैसे एकल-उद्देश्य सर्वर की तुलना में कॉन्फ़िगरेशन जटिलता जोड़ती है, और परियोजना काफी तेजी से चलती है कि दस्तावेज़ कभी-कभी नवीनतम रिलीज़ से पीछे रह जाते हैं।

मूल्य: मुफ़्त, ओपन-सोर्स।

प्लेटफॉर्म: Linux VM, LXC, Docker।

डाउनलोड: localai.io

निचली पंक्ति: सही विकल्प जब मौजूदा उपकरण पहले से ही OpenAI API के विरुद्ध बनाया गया है और एंडपॉइंट को स्वैप करना, एकीकरण को फिर से लिखना नहीं, लक्ष्य है।

सही चुनना कैसे करें

एक व्यक्ति जो दैनिक उपयोग के लिए ChatGPT को प्रतिस्थापित करता है, Ollama को Open WebUI के साथ जोड़ा गया लगभग सब कुछ को कवर करता है: एक चैट इंटरफेस, मॉडल स्विचिंग और नेटवर्क पर कुछ और के लिए एक API एंडपॉइंट। एक परिवार एक Proxmox बॉक्स साझा कर रहा है उसी जोड़ी से लाभान्वित होता है, क्योंकि Open WebUI के प्रति-उपयोगकर्ता लॉगिन कई VMs की आवश्यकता के बिना चैट इतिहास को अलग रखते हैं।

एक शौक जो फाइन-ट्यून, चरित्र प्रीसेट या पुराने क्वांटाइज़ेशन प्रारूप पर टिंकर करना चाहता है, text-generation-webui से अधिक दूरी मिलता है, यहां तक कि इसके अधिक खड़ी शिक्षा घटक के साथ। जो कोई भी अभी भी यह तय कर रहा है कि कौन सा मॉडल उनके हार्डवेयर में फिट बैठता है, Proxmox VM में एक विशिष्ट सेटअप के लिए प्रतिबद्ध होने से पहले डेस्कटॉप पर LM Studio से शुरू करना चाहिए।

एक GPU-समृद्ध rig एक साथ कई अनुप्रयोगों या उपयोगकर्ताओं को परोस रहा है एक एकल मामला है जहां vLLM इसकी अतिरिक्त सेटअप लागत अर्जित करता है, क्योंकि इसका थ्रूपुट लाभ केवल एक साथ लोड के तहत दिखता है। एक CPU-केवल बॉक्स, या Proxmox होस्ट सीमित RAM के साथ बचाने के लिए, llama.cpp सर्वर द्वारा सीधे बेहतर परोसा जाता है, जो इस सूची पर कुछ भी कम से कम ओवरहेड ले जाता है। और एक होम लैब पहले से ही OpenAI API को कॉल करने वाले मौजूदा स्वचालन के साथ LocalAI के लिए एक स्पष्ट मामला है, क्योंकि यह उस एकीकरण बिंदु को बिल्कुल वैसे ही रहने देता है जैसे वह था।

अक्सर पूछे जाने वाले प्रश्न

क्या Proxmox बिना GPU के LLMs चला सकता है? हाँ। Ollama, llama.cpp सर्वर, और LocalAI सभी केवल CPU पर चलते हैं, और एक क्वांटाइज़्स 7B या 8B मॉडल एक आधुनिक बहु-कोर CPU पर चैट के लिए प्रयोग करने योग्य है, हालांकि जवाब CPU की तुलना में ध्यान से धीमे आते हैं। छोटे क्वांटाइज़्स मॉडल (3B और नीचे) विनम्र हार्डवेयर पर भी प्रतिक्रियाशील रहते हैं।

कौन सा स्थानीय LLM ChatGPT गुणवत्ता के सबसे करीब है? मॉडल गुणवत्ता इस पर निर्भर करती है कि कौन से वजन लोड हैं, कौन सर्वर उन्हें चलाता है नहीं, इसलिए इनमें से कोई भी ऐप वही मॉडल चला सकता है। 70B-प्लस रेंज में बड़े खुले मॉडल, एक अच्छे क्वांटाइज़ेशन में चलाया, ChatGPT-स्तर प्रतिक्रिया के सबसे करीब, हालांकि उन्हें अच्छी तरह चलाने के लिए पर्याप्त VRAM या धीमा CPU फॉलबैक की आवश्यकता है।

क्या Ollama मुफ़्त है? हाँ। Ollama मुफ़्त और ओपन-सोर्स है, कोई भुगतान स्तर नहीं, सदस्यता, या उपयोग सीमा, क्योंकि अनुमान पूरी तरह से उस हार्डवेयर पर होती है जिस पर वह चलता है।

क्या मुझे Ollama के लिए VM या LXC कंटेनर का उपयोग करना चाहिए? एक LXC कंटेनर हल्का है और तेजी से शुरू होता है, जो CPU-केवल सेटअप या RAM पर तंग होम लैब के लिए उपयुक्त है। एक VM GPU पास-थ्रू के लिए सुरक्षित विकल्प है, क्योंकि यह Proxmox होस्ट से NVIDIA ड्राइवर स्टैक को अलग करता है और संस्करण-मिलान समस्याओं से बचाता है जो तब उत्पन्न होती हैं जब एक कंटेनर होस्ट के कर्नेल और ड्राइवर साझा करता है।

16 GB VRAM पर कौन सा मॉडल चलता है? एक 13B मॉडल एक 4-बिट या 5-बिट GGUF क्वांटाइज़ेशन 16 GB VRAM में आराम से फिट बैठता है एक उचित संदर्भ विंडो के लिए जगह के साथ। कुछ अच्छी तरह से अनुकूलित 34B क्वांटाइज़ेशन भी एक कम संदर्भ लंबाई के साथ फिट होता है, हालांकि 13B और नीचे लंबी बातचीत के लिए सबसे अधिक हेडरूम देता है।