Ollama, एक ऐप जो NAS पर स्थानीय LLM चलाने के लिए उपयोग किया जाता है

लैपटॉप पर Gemma 4 तेजी से काम करता है। GPU अपना काम करता है, उत्तर कुछ सेकंड में आते हैं, और मॉडल एक वास्तविक सहायक की तरह लगता है। इसे NAS में स्थानांतरित करें और यह काफी धीमा हो जाएगा कि एक सवाल एक छोटी प्रतिबद्धता बन जाए। यह अंतर महत्वपूर्ण है। जब मॉडल साझा संग्रहण पर रहता है, तो पूरा परिवार या टीम इसे कॉल कर सकता है, और एक सेकंड की अतिरिक्त विलंबता इसे एक प्रतिक्रिया की जगह एक उपकरण में बदल देती है।

हमने आठ ऐप्स चुने हैं जो आज NAS पर स्थानीय LLMs को होस्ट करने के लिए चलाते हैं। कुछ सर्वर हैं, कुछ फ्रंट-एंड हैं, कुछ परिनियोजन परत हैं। एक साथ, वे एक मॉडल डाउनलोड करने से लेकर क्लाइंट के परिवार द्वारा साझा एंडपॉइंट को कॉल करने तक के वर्कफ़्लो को कवर करते हैं।

NAS-होस्टेड LLM ऐप्स में क्या देखना है

नीचे आठ में से कम से कम चार को पूरा करते हैं। रैंक उन्हें Synology, QNAP, या स्व-निर्मित NAS पर चलाने में कितना आसान है, इसके आधार पर ऑर्डर करता है।

त्वरित तुलना

ऐप्स सर्वश्रेष्ठ के लिए पर चलता है GPU समर्थन लाइसेंस
Ollama सबसे आसान NAS-होस्टेड सर्वर Linux, macOS, Windows CUDA, Metal, ROCm MIT
LM Studio पॉइंट-एंड-क्लिक मॉडल होस्ट Linux, macOS, Windows CUDA, Metal, ROCm Proprietary (free)
Open WebUI साझा वेब फ्रंट-एंड Docker बैकएंड के माध्यम से MIT
LocalAI OpenAI-संगत ड्रॉप-इन Docker CUDA, ROCm, CPU MIT
Text Generation WebUI पावर-यूजर ट्यूनिंग Linux, macOS, Windows CUDA, ROCm, CPU AGPL
Jan स्थानीय-पहला डेस्कटॉप क्लाइंट Windows, macOS, Linux CUDA, Metal, CPU AGPL
vLLM उच्च-थ्रूपुट अनुमान Linux CUDA (सर्वर GPUs) Apache 2
llama.cpp बेयर-मेटल CPU अनुमान कोई भी कोई भी MIT

1. Ollama, सबसे आसान NAS-होस्टेड सर्वर के लिए सर्वश्रेष्ठ

Ollama NAS के लिए एक-कमांड इंस्टॉल के सबसे करीब है। Docker इमेज, पोर्ट 11434, और हर क्लाइंट जो Ollama या OpenAI API के साथ बात करता है उससे बात कर सकता है। मॉडल लाइब्रेरी Llama, Gemma, Mistral, Qwen, और निर्देश वेरिएंट की बढ़ती सूची को कवर करता है।

जहां यह कम पड़ता है: ठीक-अनाज नमूना नियंत्रण ध्वज के पीछे छिपे होते हैं। जो कोई भी prompt templates को हाथ से स्वैप करना चाहता है वह modelfile सिंटैक्स में समाप्त होता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Linux, macOS, Windows (सभी Docker या नेटिव के रूप में)।

डाउनलोड करें: ollama.com

निचली पंक्ति: पहली बार NAS LLM स्थापित करने वाले किसी के लिए डिफ़ॉल्ट सिफारिश।

2. LM Studio, पॉइंट-एंड-क्लिक मॉडल होस्ट के लिए सर्वश्रेष्ठ

LM Studio डेस्कटॉप ऐप्स है जो OpenAI-संगत सर्वर भी चलाता है। इसे NAS-माउंटेड मॉडल फ़ोल्डर की ओर इंगित करें, सर्वर को सक्षम करें, और LAN पर क्लाइंट इसे कॉल कर सकते हैं। GUI llama.cpp के उन हिस्सों को छुपाता है जो लोगों को डराते हैं।

जहां यह कम पड़ता है: यह पहली जगह में एक डेस्कटॉप ऐप्स है, इसलिए NAS पर headless स्थापना का मतलब एक हल्के X सर्वर के अंदर इसे चलाना है या सेटअप के लिए स्क्रीन के साथ NAS चुनना है।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux.

डाउनलोड करें: lmstudio.ai

निचली पंक्ति: सही चुनाव जब कोई परिवार सदस्य मॉडल बदलना चाहता है और टर्मिनल को छूना नहीं चाहता है।

3. Open WebUI, साझा वेब फ्रंट-एंड के लिए सर्वश्रेष्ठ

Open WebUI NAS-होस्टेड बैकएंड के लिए ChatGPT-आकार का वेब इंटरफेस है। इसे Ollama, LM Studio, या LocalAI की ओर इंगित करें, उपयोगकर्ता जोड़ें, और प्रत्येक परिवार के सदस्य को उनके अपने चैट और prompts की साझी लाइब्रेरी मिलती है। स्थानीय फ़ाइलों पर RAG बॉक्स में आता है।

जहां यह कम पड़ता है: यह एक फ्रंट-एंड है, runtime नहीं। Ollama या LocalAI अभी भी मॉडल कार्य करता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Linux पर Docker, साथ ही Portainer के माध्यम से NAS स्थापना।

डाउनलोड करें: openwebui.com

निचली पंक्ति: Ollama के साथ सही पेयरिंग जब लक्ष्य साझा, ब्राउज़र-पहला पारिवारिक चैट हो।

4. LocalAI, OpenAI-संगत ड्रॉप-इन के लिए सर्वश्रेष्ठ

LocalAI स्थानीय मॉडलों के विरुद्ध OpenAI-संगत एंडपॉइंट (chat, embeddings, images, TTS) को उजागर करता है। कोई भी ऐप्स जो OpenAI API से बात करता है उसके साथ बिना किसी परिवर्तन के बात कर सकता है। backends llama.cpp, whisper.cpp, और stable-diffusion.cpp को span करते हैं।

जहां यह कम पड़ता है: कॉन्फ़िगरेशन फ़ाइल सघन है और प्रत्येक मॉडल को अपनी entry की आवश्यकता है। Ollama आपके लिए मानचित्रण को संभालता है।

मूल्य निर्धारण:

प्लेटफॉर्म: Linux पर Docker, साथ ही Windows और macOS के लिए native builds।

डाउनलोड करें: localai.io

निचली पंक्ति: सही सर्वर जब क्लाइंट OpenAI SDK है और base URL को स्वैप करना पूरा migration है।

5. Text Generation WebUI, पावर-यूजर ट्यूनिंग के लिए सर्वश्रेष्ठ

Text Generation WebUI (oobabooga) पुरानी, समृद्ध फ्रंट-एंड है जो एक सर्वर भी चलाता है। नमूना पैरामीटर, LoRA लोडिंग, और चरित्र-कार्ड शैली prompt templates सभी exposed हैं। जो कोई भी default से परे मॉडल को ट्यून करना चाहता है वह यहां बैठता है।

जहां यह कम पड़ता है: UI को दो बार फिर से बनाया गया है और अभी भी अपनी power-user जड़ों को दिखाता है। यह वह उपकरण नहीं है जो आप परिवार के सदस्य को देते हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux.

डाउनलोड करें: github.com/oobabooga/text-generation-webui

निचली पंक्ति: किसी के लिए pick जो sampling knobs चाहता है जो Ollama और LM Studio छुपाते हैं।

6. Jan, स्थानीय-पहला डेस्कटॉप क्लाइंट के लिए सर्वश्रेष्ठ

Jan स्थानीय-पहली ChatGPT क्लाइंट है। यह CPU-only NASes के लिए अपना runtime के साथ आता है, लेकिन remote Ollama या LocalAI सर्वर के साथ भी बात करता है। Chats और prompts डिस्क पर रहते हैं, इसलिए पूरा इतिहास एक स्थानीय फ़ाइल है।

जहां यह कम पड़ता है: NAS सर्वर के रूप में, यह सबसे मजबूत fit नहीं है। इसे क्लाइंट के रूप में उपयोग करें, और Ollama या LocalAI को serving करने दें।

मूल्य निर्धारण:

प्लेटफॉर्म: Windows, macOS, Linux.

डाउनलोड करें: jan.ai

निचली पंक्ति: NAS सर्वर के लिए सही डेस्कटॉप साथी किसी के लिए जो web tab नहीं चाहता।

7. vLLM, उच्च-थ्रूपुट अनुमान के लिए सर्वश्रेष्ठ

vLLM production-grade सर्वर है। Paged attention, tensor parallelism, और continuous batching इसे कई क्लाइंट को बड़े मॉडल serve करने का तेजी तरीका बनाता है। चाल यह है कि इसे एक real GPU (Ampere या later) की जरूरत है।

जहां यह कम पड़ता है: यह NAS-friendly स्थापना नहीं है। datacenter GPU के बिना NAS chassis इसे तरीके से चलाता नहीं सकता जो docs मानते हैं।

मूल्य निर्धारण:

प्लेटफॉर्म: Linux (आम तौर पर NVIDIA container toolkit के साथ Docker)।

डाउनलोड करें: github.com/vllm-project/vllm

निचली पंक्ति: Pick जब “NAS” एक real GPU के साथ Linux box हो जो एक home lab के clients को serve करता है।

8. llama.cpp, बेयर-मेटल CPU अनुमान के लिए सर्वश्रेष्ठ

llama.cpp low-level runtime है जो इस सूची पर सब कुछ wraps करता है। यह CPU-only NAS builds पर चलता है जहां एक real GPU missing है, quantized models के साथ जो 8B parameter model को कुछ gigabytes तक सिकोड़ देते हैं।

जहां यह कम पड़ता है: कोई UI नहीं है। यह एक सर्वर बाइनरी और CLI है। इसे Open WebUI या Ollama के साथ pair करें।

मूल्य निर्धारण:

प्लेटफॉर्म: कोई भी (Linux, macOS, Windows, ARM जिसमें Raspberry Pi और Apple Silicon शामिल है)।

डाउनलोड करें: github.com/ggerganov/llama.cpp

निचली पंक्ति: सही pick जब NAS CPU-only हो और RAM का प्रत्येक gigabyte महत्वपूर्ण हो।

सही को चुनने का तरीका

सामान्य प्रश्न

कौन सा मॉडल GPU के बिना NAS पर चलता है?

3B-8B रेंज में Gemma, Llama, या Mistral के quantized संस्करण आधुनिक NAS CPU पर कुछ tokens प्रति सेकंड पर चलते हैं। यह interactive chat के लिए धीमा है, एक-बार summary या रात भर की नौकरी के लिए ठीक है।

क्या मुझे अपने NAS पर GPU की जरूरत है?

केवल interactive speed के लिए। CPU-only NAS अभी भी एक छोटे मॉडल को चलाता है; प्रतिक्रिया समय tokens प्रति सेकंड की जगह प्रति sentence कुछ सेकंड में बैठता है।

क्या मैं NAS-hosted मॉडल को अपने LAN के लिए निजी रख सकता हूं?

हाँ। Ollama, LM Studio, और LocalAI default से LAN interface को bind करते हैं। एक home LAN से अधिक कुछ के लिए basic auth या reverse proxy जोड़ें।

स्थानीय मॉडल को कितनी डिस्क स्पेस की जरूरत है?

एक quantized 8B मॉडल लगभग 5 GB पर बैठता है। एक quantized 70B मॉडल 40 GB के करीब बैठता है। 500 GB spare volume वाली NAS एक पूरी लाइब्रेरी रखती है।

क्या कई लोग एक साथ मॉडल का उपयोग कर सकते हैं?

Ollama, LocalAI, और Text Generation WebUI सभी default से serialize करते हैं। vLLM concurrent requests को natively handle करता है। छोटे परिवार के लिए, serialization ठीक है।

गोपनीयता के बारे में क्या?

इस सूची पर हर ऐप्स मॉडल को locally चलाता है। कोई भी prompt या response third party को नहीं भेजा जाता है जब तक कि ऐप्स को इसके लिए configure न किया जाए।