पिछले हफ्ते XDA लेख वहीं समाप्त हुआ जहां हर होम-लैब चर्चा समाप्त होती है: सात स्थानीय LLM में से केवल एक ही एक स्मार्ट होम का दिमाग होने के लिए पर्याप्त था जब ऑटोमेशन दिलचस्प हो गया। बाकी फंक्शन कॉल पर मतिभ्रम करते थे, “बारामदे की रोशनी बंद करो” का इरादा चूकते थे, या इतने गर्म चलते थे कि NAS के पंखे घंटों तक घूमते रहते थे। NAS पर एक स्थानीय मॉडल वॉयस कंट्रोल का एक वैध उत्तर है, लेकिन रनटाइम की पसंद मॉडल की पसंद से अधिक महत्वपूर्ण है।
हमने 7 डेस्कटॉप ऐप्स का परीक्षण किया जो होम NAS या एक ही LAN पर मिनी PC पर चलते हैं, OpenAI-संगत एंडपॉइंट को उजागर करते हैं, और Home Assistant के LLM-आधारित वॉयस पाइपलाइन के साथ स्वच्छ रूप से एकीकृत होते हैं। नीचे सब कुछ वजन डाउनलोड होने के बाद ऑफलाइन चलता है, और सब कुछ एक प्रलेखित Docker इमेज है।
क्या खोजें
- OpenAI-संगत API। Home Assistant’s Assist इसकी अपेक्षा करता है, और नीचे के हर दूसरे टूल एक ही तरीके से प्लग इन करते हैं।
- फंक्शन कॉल सपोर्ट। एक मॉडल जो एक संरचित फंक्शन कॉल नहीं दे सकता वह रोशनी नहीं फेर सकता।
- GGUF या GPTQ मॉडल सपोर्ट। यदि NAS के पास GPU नहीं है, तो CPU पर Q4 GGUF ईमानदार शुरुआती बिंदु है।
- समझदारी भरा मेमोरी फुटप्रिंट। एक 7B Q4 मॉडल आराम में 6 GB RAM से कम रहना चाहिए।
- गर्म शुरुआत। प्रत्येक वॉयस कमांड पर 7B मॉडल को ठंडे से लोड करना पाँच सेकंड की देरी है जिसे आप नोटिस करेंगे।
- एक स्थिर प्रक्रिया प्रबंधक। NAS साप्ताहिक रूप से अपडेट के लिए पुनः आरंभ होता है; मॉडल को स्वचालित रूप से वापस आना चाहिए।
त्वरित तुलना
| ऐप | किसके लिए सर्वश्रेष्ठ | प्लेटफॉर्म | मुक्त योजना | स्टैंडआउट विशेषता |
|---|---|---|---|---|
| Ollama | डिफ़ॉल्ट रनर जिसे अधिकांश Home Assistant गाइड लक्षित करते हैं | Linux, macOS, Windows | हाँ (open source) | मॉडल कैटलॉग और एक स्थिर OpenAI-संगत एंडपॉइंट |
| LocalAI | OpenAI API के लिए ऑल-इन-वन ड्रॉप-इन, ऑडियो सहित | Linux, macOS, Windows (Docker) | हाँ (open source) | एक कंटेनर से चैट, एम्बेडिंग, TTS और STT को संभालता है |
| LM Studio | NAS होस्ट पर GUI और LAN के लिए सर्वर | Windows, macOS, Linux | हाँ | मॉडल डिस्कवरी और वन-क्लिक सर्वर टॉगल |
| Open WebUI | वेब चैट फ्रंटएंड जो Home Assistant के साथ भी बात करता है | Linux, macOS, Windows (Docker) | हाँ (open source) | Ollama, LocalAI या किसी भी OpenAI-संगत बैकएंड के साथ मल्टी-यूजर चैट |
| Home Assistant | एंडपॉइंट का उपभोक्ता | Windows, macOS, Linux (HAOS, Docker) | हाँ | नेटिव Assist LLM एकीकरण फंक्शन कॉल रूटिंग के साथ |
| vLLM | GPU वाले NAS पर सर्वोत्तम थ्रूपुट | Linux (Docker) | हाँ (open source) | मल्टी-यूजर उपयोग के लिए निरंतर बैचिंग और पेजेड अटेंशन |
| llama.cpp | उपरोक्त अधिकांश के पीछे bare-metal C++ रनर | Linux, macOS, Windows | हाँ (open source) | लगभग किसी भी हार्डवेयर पर CPU पर GGUF चलाता है |
NAS पर स्मार्ट होम LLM के लिए 7 सर्वश्रेष्ठ ऐप्स
1. Ollama — सर्वश्रेष्ठ डिफ़ॉल्ट रनर और जिसे अधिकांश गाइड लक्षित करते हैं
Ollama llama.cpp को एक स्वच्छ CLI, मॉडल लाइब्रेरी और OpenAI-संगत HTTP सर्वर के साथ लपेटता है जो Home Assistant का Assist LLM एकीकरण बॉक्स से बाहर बात करता है। NAS पर इंस्टॉल करें, ollama pull qwen2.5:7b-instruct करें, और Home Assistant को http://<nas-ip>:11434 पर इंगित करें। सर्विस मैनेजर इसे रीबूट के पार गर्म रखता है।
यह कहां विफल होता है: मल्टी-यूजर समवर्ती एकल-लेन है; समानांतर अनुरोध बैच के बजाय कतार में प्रतीक्षा करते हैं। Windows सपोर्ट हाल ही में आया है और Linux पर स्थिरता में पिछड़ जाता है।
मूल्य निर्धारण:
- मुक्त: MIT के तहत open source
- भुगतान: self-hosting के लिए कोई नहीं
प्लेटफॉर्म: Linux, macOS, Windows (नेटिव और Docker)
डाउनलोड: ollama.com
निचली पंक्ति: पहले Ollama चुनें, और केवल तभी निकलें जब एक विशिष्ट सीमा आपको दूर धकेले।
2. LocalAI — सर्वश्रेष्ठ यदि आप एक कंटेनर से चैट, बोली और एम्बेडिंग चाहते हैं
LocalAI वह ड्रॉप-इन है जो पूरी OpenAI सतह को कवर करता है: चैट पूर्णता, एम्बेडिंग, TTS, STT और इमेज जनरेशन, सब कुछ स्थानीय। Home Assistant की Wyoming प्रोटोकॉल STT के लिए LocalAI के Whisper एंडपॉइंट और TTS के लिए Piper पर इंगित कर सकती है, जिसका अर्थ है कि पूरी वॉयस लूप NAS पर रहती है।
यह कहां विफल होता है: कॉन्फिग फाइल घनी है और पहली बार पढ़ने की जरूरत है। GPU त्वरण पथ (CUDA, ROCm, Vulkan) प्रति-बिल्ड हैं और गलत इमेज चुनने से मौन CPU फॉलबैक मिलता है।
मूल्य निर्धारण:
- मुक्त: MIT के तहत open source
- भुगतान: कोई नहीं
प्लेटफॉर्म: Linux, macOS, Windows (Docker)
डाउनलोड: localai.io
निचली पंक्ति: LocalAI चुनें यदि लक्ष्य एक आत्मनिर्भर वॉयस स्टैक है जिसमें एक छत के नीचे STT, TTS और चैट है।
3. LM Studio — सर्वश्रेष्ठ जब अधिक दोस्ताना UI मायने रखता है
LM Studio एक डेस्कटॉप चैट ऐप के रूप में शुरू हुआ और हेडलेस सर्वर मोड में बढ़ा। डिस्प्ले या रिमोट KVM सेशन वाले NAS पर, मॉडल पिकर और क्वांटिजेशन चुनने वाले कच्चे CLI की तुलना में अधिक क्षमाशील हैं। बिल्ट-इन सर्वर OpenAI-संगत एंडपॉइंट को उजागर करता है जो Home Assistant की अपेक्षा करता है।
यह कहां विफल होता है: मूल ऐप closed source है, जो कुछ होम-लैब सेटअप के लिए एक निर्णायक नहीं है। हेडलेस मोड उपलब्ध है लेकिन अभी भी एक दूसरे दर्जे का नागरिक है।
मूल्य निर्धारण:
- मुक्त: पूर्ण ऐप
- भुगतान: कोई नहीं
प्लेटफॉर्म: Windows, macOS, Linux
डाउनलोड: lmstudio.ai
निचली पंक्ति: LM Studio चुनें यदि आप स्मार्ट-होम भूमिका के लिए एक को लॉक करने से पहले मॉडलों को आजमाने के लिए एक UI चाहते हैं।
4. Open WebUI — सर्वश्रेष्ठ चैट फ्रंटएंड जो मनुष्यों को लूप में रखता है
Open WebUI वह ब्राउजर-आधारित ChatGPT-स्टाइल फ्रंटएंड है जो Ollama, LocalAI या किसी भी OpenAI-संगत एंडपॉइंट के विरुद्ध चलता है। NAS पर, यह एक परीक्षण सतह के रूप में दोगुना हो जाता है: Assist पाइपलाइन उपयोग करने वाले मॉडल के विरुद्ध एक प्रॉम्प्ट चलाएं, सिस्टम प्रॉम्प्ट को ट्वीक करें, फिर Home Assistant को अपडेट करें। भूमिकाओं के साथ मल्टी-यूजर सपोर्ट परिवार को एडमिन कंसोल से दूर रखता है।
यह कहां विफल होता है: यह एक चैट UI है, ऑटोमेशन पथ का हिस्सा नहीं। सेटअप को एक स्थायी वॉल्यूम और LAN या Tailscale एक्सेस के लिए रिवर्स प्रॉक्सी की आवश्यकता है।
मूल्य निर्धारण:
- मुक्त: MIT के तहत open source
- भुगतान: कोई नहीं
प्लेटफॉर्म: Linux, macOS, Windows (Docker)
डाउनलोड: openwebui.com
निचली पंक्ति: जिस किसी भी रनटाइम पर आप सेटल करते हैं उसके ऊपर मानव-सामने की चैट के रूप में Open WebUI चुनें।
5. Home Assistant — एंडपॉइंट का सर्वश्रेष्ठ उपभोक्ता
Home Assistant’s Assist LLM एकीकरण वह है जो “रसोई की रोशनी चालू करो” को एक फंक्शन कॉल में बदल देता है। Ollama, LocalAI, LM Studio या किसी भी OpenAI-संगत एंडपॉइंट पर इंगित करें, इकाइयों पर “expose to Assist” टिक करें जिन्हें आप मॉडल को नियंत्रित करना चाहते हैं, और वॉयस पूरी तरह से LAN पर चलती है। प्रॉम्प्ट टेम्पलेट संपादन योग्य है, यह है कि आप मॉडल को कमरों का मतिभ्रम करने से कैसे रोकते हैं।
यह कहां विफल होता है: फंक्शन कॉल की गुणवत्ता मॉडल पर निर्भर करती है, और Home Assistant आपको नहीं बताएगा कि जब मॉडल एक प्रशंसनीय लेकिन गलत इकाई आईडी लौटाता है। डिबग Assist डिबग पेन में रहता है और महारत हासिल करने में समय लगता है।
मूल्य निर्धारण:
- मुक्त: open source
- भुगतान: वैकल्पिक Nabu Casa क्लाउड, स्थानीय वॉयस के लिए आवश्यक नहीं
प्लेटफॉर्म: Windows, macOS, Linux (HAOS, Docker, VM)
डाउनलोड: home-assistant.io
निचली पंक्ति: Home Assistant चुनें क्योंकि LLM तभी दिलचस्प है जब कुछ इसके आउटपुट पर कार्य करता है, और यह वह कुछ है।
6. vLLM — सर्वश्रेष्ठ यदि NAS के पास एक वास्तविक GPU है
vLLM थ्रूपुट-केंद्रित रनटाइम है। निरंतर बैचिंग, पेजेड अटेंशन और एक उचित मल्टी-रिक्वेस्ट कतार एक छोटे NVIDIA कार्ड को एक पारिवारिक-स्केल एंडपॉइंट में बदल देती है जो वॉयस अनुरोध, Open WebUI टैब और Obsidian प्लगइन को एक ही समय में सेवा दे सकती है।
यह कहां विफल होता है: केवल GPU, इसलिए एक CPU-only NAS बाहर है। मॉडल संगतता Ollama की तुलना में संकीर्ण है और एक नई आर्किटेक्चर जोड़ना एक बिल्ड स्टेप है।
मूल्य निर्धारण:
- मुक्त: Apache 2.0 के तहत open source
- भुगतान: कोई नहीं
प्लेटफॉर्म: Linux (Docker)
डाउनलोड: github.com/vllm-project/vllm
निचली पंक्ति: vLLM चुनें यदि NAS के पास एक समर्थित NVIDIA कार्ड है और कई परिवार के सदस्य मॉडल को एक साथ मारेंगे।
7. llama.cpp — सीमित हार्डवेयर के लिए सर्वश्रेष्ठ bare-metal रनर
llama.cpp C++ प्रोजेक्ट है जो उपरोक्त अधिकांश रनटाइम को शक्ति देता है। इसे सीधे चलाना, बिल्ट-इन HTTP सर्वर के साथ, 7B मॉडल को Synology या पुरानी ARM बॉक्स में निचोड़ने का सबसे दुबला तरीका है। Apple Silicon पर Metal और NVIDIA पर CUDA के लिए सपोर्ट एक बाइनरी को अधिकांश होम सेटअप को कवर करने देता है।
यह कहां विफल होता है: कोई मॉडल प्रबंधन नहीं, कोई ऑटो-अपडेट नहीं, बॉक्स से बाहर कोई सर्विस स्क्रिप्ट नहीं। यह एक उपकरण, एक उत्पाद नहीं है।
मूल्य निर्धारण:
- मुक्त: MIT के तहत open source
- भुगतान: कोई नहीं
प्लेटफॉर्म: Linux, macOS, Windows (source, binary या Docker)
डाउनलोड: github.com/ggerganov/llama.cpp
निचली पंक्ति: llama.cpp चुनें यदि NAS छोटा है, OS असामान्य है और आप मॉडल फाइल पर कम से कम अमूर्तता चाहते हैं।
कैसे चुनें
यदि आप शुरुआत से शुरुआत कर रहे हैं, तो NAS पर Ollama इंस्टॉल करें और Home Assistant को इसकी ओर इंगित करें।
यदि वॉयस स्टैक को एक ही बॉक्स पर STT और TTS की आवश्यकता है, तो Ollama को LocalAI के लिए स्वैप करें और Whisper और Piper इमेज खींचें।
यदि आप प्रतिबद्ध होने से पहले मॉडलों की तुलना करने के लिए एक UI चाहते हैं, तो LM Studio इंस्टॉल करें और इसके सर्वर मोड का उपयोग करें।
यदि परिवार उसी मॉडल के साथ चैट करना चाहता है जो ऑटोमेशन चलाता है, तो शीर्ष पर Open WebUI जोड़ें।
यदि NAS के पास NVIDIA GPU है और एक से अधिक भारी उपयोगकर्ता हैं, तो समवर्ती के लिए vLLM पर स्विच करें।
यदि हार्डवेयर असामान्य रूप से छोटा है और हर मेगाबाइट महत्वपूर्ण है, तो llama.cpp सीधे चलाएं।
FAQ
क्या मैं वाकई NAS पर एक उपयोगी मॉडल चला सकता हूं?
हां। एक आधुनिक आठ-कोर CPU पर llama.cpp में 7B Q4 मॉडल छोटे वॉयस-कमांड प्रतिक्रियाओं के लिए पठनीय गति में उत्पादन करता है। यदि NAS के पास 16 GB RAM और NVMe कैश है, तो मॉडल गर्म शुरुआत के बाद सेकंड में लोड होता है। लंबी चैट या तर्क के लिए, एक GPU जोड़ें।
कौन सा मॉडल Home Assistant फंक्शन कॉल को सर्वश्रेष्ठ तरीके से संभालता है?
Qwen 2.5 Instruct, Llama 3.1 8B Instruct और Hermes-3-Llama 7B-8B आकार पर विश्वसनीय स्थानीय विकल्प हैं। 7B से नीचे, फंक्शन-कॉल फॉर्मेटिंग टूटने लगती है। प्रतिबद्ध होने से पहले Assist डिबग पेन पर मुट्ठी भर यथार्थवादी आदेशों के साथ परीक्षण करें।
क्या मॉडल मेरे पूरे घर की स्थिति देखता है?
केवल वे इकाइयां जिन्हें आप स्पष्ट रूप से Assist के लिए उजागर करते हैं। एक्सपोजर टॉगल प्रति-इकाई है, इसलिए कार्यालय में एक प्रकाश को मॉडल के संदर्भ में रिसाव नहीं करना पड़ता। सेट को छोटा रखें; प्रॉम्प्ट सस्ता है और मॉडल कम गलतियां करता है।
जब इंटरनेट गिर जाता है तो क्या होता है?
कुछ नहीं बदलता। STT, LLM और TTS सभी NAS पर चलते हैं, इसलिए वॉयस कंट्रोल काम करता रहता है। केवल रास्ता जिसे WAN की आवश्यकता है वह दूरस्थ पहुंच है, और Nabu Casa क्लाउड या एक self-hosted VPN दोनों इसे अलग से ठीक करते हैं।