LiteLLM

XDA का Nvidia Personal AI Router पर लेख एक संवेदनशील बात को छूता है: एक समापन बिंदु के पीछे दो PCs, वजन और स्वास्थ्य द्वारा मॉडल अनुरोध रूट किए जाते हैं, पाँच ऐप्स में कॉन्फ़िग फाइलों को संपादित किए बिना। महत्वपूर्ण बात यह है कि Nvidia की रिलीज एक श्रेणी की एक विविधता है जो ओपन-सोर्स स्टैक पहले से ही कवर करता है, और व्यापक मॉडल समर्थन के साथ कवर करता है। यदि आपके पास 4090 वाला एक वर्कस्टेशन है और अलमारी में Ollama चलाने वाला एक मिनी PC है, तो एक प्रॉक्सी जो उन्हें एकीभूत करता है, वह गायब टुकड़ा है।

हमने 2026 में स्थानीय LLM अनुमान के लिए सात लोड बैलेंसर और गेटवे का परीक्षण किया। प्रत्येक विकल्प Ollama, vLLM, LM Studio, llama.cpp, या एक मिश्रण के सामने बैठता है, एक OpenAI-संगत समापन बिंदु को उजागर करता है, और रूटिंग को संभालता है जब एक बैकएंड व्यस्त, ऑफलाइन या काम के लिए गलत उपकरण हो।

स्थानीय AI लोड बैलेंसर में क्या देखें

त्वरित तुलना

ऐप के लिए सर्वश्रेष्ठ बैकएंड लाइसेंस ओपन सोर्स
LiteLLM 100+ प्रदाताओं के साथ सार्वभौमिक प्रॉक्सी कोई भी OpenAI-संगत MIT हाँ
Olla शुद्ध स्थानीय, छोटा पदचिह्न Ollama, vLLM, LM Studio, SGLang, llama.cpp Apache 2.0 हाँ
Nvidia Personal AI Router Windows पर Nvidia-हार्डवेयर सेटअप Nvidia-अनुकूलित बैकएंड मुफ़्त (पंजीकरण) नहीं
vLLM उच्च-थ्रूपुट एकल-मॉडल परिवहन vLLM इंजन Apache 2.0 हाँ
Ollama सबसे सरल मल्टी-मॉडल होस्ट नेटिव MIT हाँ
LocalAI अधिक मीडिया मॉडल के साथ ड्रॉप-इन OpenAI क्लोन GGUF, ONNX, diffusers MIT हाँ
Portkey नीति नियंत्रण के साथ एंटरप्राइज गेटवे 200+ प्रदाता AGPL / सशुल्क स्तर स्रोत-उपलब्ध

स्थानीय AI अनुमान लोड बैलेंसिंग के लिए 7 सर्वश्रेष्ठ ऐप्स

1. LiteLLM — समग्र सर्वश्रेष्ठ

LiteLLM आपके मॉडल के सामने एक Python या Rust प्रॉक्सी के रूप में चलता है और एक /v1 समापन बिंदु प्रदान करता है जो OpenAI से बात करता है। इसे Ollama, vLLM, होस्ट किए गए Anthropic और OpenAI के किसी भी मिश्रण की ओर इंगित करें, और यह उनके बीच लोड को संतुलित करेगा, 429s पर वापस हटेगा, दोहराए गए प्रॉम्प्ट को कैश करेगा, और प्रति-कुंजी बजट लागू करेगा। 2026 का Rust पुनः लेखन एक एकल नोड पर 1500 अनुरोध प्रति सेकंड से अधिक थ्रूपुट ड्राइव करता है, जो एक होम लैब को कभी भी आवश्यकता से अधिक है लेकिन एक साझा टीम गेटवे पर सुखद है।

जहां यह अल्पसंख्यक है: कॉन्फ़िग फ़ाइल एक बार जब आप फॉलबैक ट्री और लागत स्तर जोड़ते हैं, तो जल्दी बढ़ती है। डैशबोर्ड कार्यात्मक है लेकिन कुछ भी जो आप दिखाएंगे नहीं।

कीमत: मुफ़्त और ओपन सोर्स (MIT)। एक सशुल्क एंटरप्राइज स्तर SSO और ऑडिट लॉग जोड़ता है।

प्लेटफॉर्म: Windows, macOS, Linux, Docker।

डाउनलोड: litellm.ai · GitHub

निष्कर्ष: यदि आप एक राउटर चाहते हैं जो होम लैब से होस्ट किए गए APIs तक बढ़ता है, यहाँ से शुरू करें।

2. Olla — सर्वश्रेष्ठ शुद्ध-स्थानीय विकल्प

Olla स्व-होस्ट किए गए अनुमान के लिए विशेष रूप से निर्मित एक LLM प्रॉक्सी है। यह Ollama, LM Studio, vLLM, llama.cpp, SGLang और LiteLLM से ही बात करता है, हर बैकएंड में मॉडल को स्वचालित रूप से खोजता है, और 50 MB मेमोरी से नीचे रहता है। दो Ollama बॉक्स के बीच फेलओवर एक पाँच-लाइन YAML फ़ाइल है, और उजागर मेट्रिक्स एक प्लगइन के बिना Prometheus को खिलाते हैं।

जहां यह अल्पसंख्यक है: कोई निर्मित लागत ट्रैकिंग या बजट प्रवर्तन नहीं, क्योंकि यह होस्ट किए गए APIs को नहीं छूता है। LiteLLM की तुलना में समुदाय छोटा है।

कीमत: मुफ़्त और ओपन सोर्स (Apache 2.0)।

प्लेटफॉर्म: Windows, macOS, Linux, Docker। एक एकल स्थिर बाइनरी।

डाउनलोड: thushan.github.io/olla · GitHub

निष्कर्ष: यह चुनें यदि आपका संपूर्ण स्टैक उस हार्डवेयर पर है जिसे आप स्वामित्व में हैं और आप एक राउटर चाहते हैं जो एक सेकंड में बूट होता है।

3. Nvidia Personal AI Router — Nvidia हार्डवेयर पर सर्वश्रेष्ठ टर्नकी विकल्प

Nvidia Personal AI Router XDA लेख का विषय है। यह एक Windows ऐप्लिकेशन के रूप में आता है जो आपके LAN को स्कैन करता है, Nvidia-आधारित अनुमान नोड्स को खोजता है, और उन्हें एक स्थानीय समापन बिंदु के पीछे पूल करता है। मॉडल रूटिंग, स्ट्रीमिंग, और क्वांटाइजेशन हैंडऑफ राउटर के अंदर संभाले जाते हैं, और एक ही सूट से क्लाइंट ऐप्स (Nvidia ChatRTX और Nvidia AI Workbench) सीधे प्लग करते हैं।

जहां यह अल्पसंख्यक है: Nvidia-पहली: Radeon और Intel Arc रिग दूसरे दर्जे के नागरिक हैं। राउटर नेटिव रूप से एक OpenAI-संगत समापन बिंदु को उजागर नहीं करता है, इसलिए तीसरे पक्ष के क्लाइंट को एक शिम की आवश्यकता है।

कीमत: Nvidia डेवलपर खाते के साथ मुफ़्त।

प्लेटफॉर्म: Windows।

डाउनलोड: nvidia.com/ai-router

निष्कर्ष: यदि आप कभी Nvidia पारिस्थितिकतंत्र को नहीं छोड़ते तो दो Nvidia रिग को एक AI समापन बिंदु में पूल करने का सबसे आसान तरीका।

4. vLLM — एकल शक्तिशाली GPU को अधिकतम करने के लिए सर्वश्रेष्ठ

vLLM स्वयं में एक राउटर नहीं है, लेकिन निरंतर बैचिंग और PagedAttention के साथ इसका OpenAI-संगत सर्वर एकल GPU पर थ्रूपुट को काफी व्यापक मार्जिन से Ollama द्वारा प्राप्त किए जा सकने वाले से आगे ड्राइव करता है। एक दो-नोड सेटअप में, vLLM को LiteLLM या Olla के पीछे चलाना एक टीम को एक बड़े मॉडल की सेवा करने के लिए मानक पैटर्न है, जबकि सस्ते बैकएंड लंबी पूंछ को संभालते हैं।

जहां यह अल्पसंख्यक है: मॉडल लोडिंग Ollama से धीमी है; कोई CPU-केवल फॉलबैक नहीं। क्वांटाइजेशन समर्थन llama.cpp के पीछे पिछड़ता है।

कीमत: मुफ़्त और ओपन सोर्स (Apache 2.0)।

प्लेटफॉर्म: CUDA, ROCm, या Intel XPU के साथ Linux। WSL2 के माध्यम से Windows। macOS Metal समर्थन समुदाय-चलायित है।

डाउनलोड: vllm.ai · GitHub

निष्कर्ष: इसे अपने राउटर को काम देने के लिए एक बैकएंड के रूप में उपयोग करें, राउटर के रूप में नहीं।

5. Ollama — सरल बहु-मॉडल होस्टिंग के लिए सर्वश्रेष्ठ

Ollama सूची पर रहता है क्योंकि अधिकांश होम सेटअप पहले से ही इसे चलाते हैं, और इसके निर्मित कतार कई समवर्ती अनुरोधों को उचित रूप से संभालता है। उच्च उपलब्धता के लिए सामने एक राउटर के साथ जोड़ी करें, या हॉट स्पेयर फेलओवर के लिए Olla के साथ दो Ollama बॉक्स चलाएं।

जहां यह अल्पसंख्यक है: बैच वर्कलोड पर GPU प्रति थ्रूपुट vLLM के पीछे 4-8x पिछड़ता है। कोई लागत ट्रैकिंग नहीं, कोई रूटिंग बुद्धिमत्ता नहीं।

कीमत: मुफ़्त और ओपन सोर्स (MIT)।

प्लेटफॉर्म: Windows, macOS, Linux, Docker।

डाउनलोड: ollama.com · GitHub

निष्कर्ष: विश्वसनीय बैकएंड, राउटर नहीं। इसे रखें और सामने कुछ और स्मार्ट डालें।

6. LocalAI — यदि राउटर भी अनुमान होस्ट के रूप में दोगुना करता है तो सर्वश्रेष्ठ

LocalAI एक एकल बाइनरी है जो OpenAI API बोलता है और LLMs, एम्बेडिंग मॉडल, TTS, इमेज जनरेशन और स्पीच-टू-टेक्स्ट को होस्ट करता है। यह पर्दे के पीछे अन्य Ollama या vLLM बैकएंड को कॉल कर सकता है, जो इसे एक एकल-नोड होम लैब के लिए सभी-में-एक के लिए सभ्य बनाता है जहां आप तीन की बजाय एक प्रक्रिया चलाएंगे।

जहां यह अल्पसंख्यक है: हाइब्रिड स्थानीय-प्लस-होस्ट किए गए सेटअप के लिए LiteLLM से कम लचीला। मीडिया-मॉडल समर्थन का मतलब है कि बाइनरी भारी है।

कीमत: मुफ़्त और ओपन सोर्स (MIT)।

प्लेटफॉर्म: Windows, macOS, Linux, Docker।

डाउनलोड: localai.io · GitHub

निष्कर्ष: यदि आप एक राउटर और एक ही बॉक्स पर एक पूर्ण मीडिया-मॉडल होस्ट चाहते हैं तो अच्छा विकल्प।

7. Portkey — यदि आपको नीति नियंत्रण की आवश्यकता है तो सर्वश्रेष्ठ

Portkey एंटरप्राइज-स्वाद विकल्प है। यह LiteLLM की तरह स्थानीय और होस्ट किए गए मॉडल का सामना करता है लेकिन बॉक्स से बाहर गार्ड्रेल, PII रिडेक्शन, और प्रति-टीम रूटिंग नीतियां जोड़ता है। स्व-होस्ट किए गए OSS संस्करण रूटिंग मूल बातें को कवर करता है; SSO, ऑडिट, और प्रबंधित डैशबोर्ड सशुल्क स्तर के पीछे बैठते हैं।

जहां यह अल्पसंख्यक है: AGPL कुछ होमलैबर्स को डराता है। पूर्ण नीति इंजन केवल तभी उपयोगी है जब एक टीम इस पर निर्भर हो।

कीमत: स्व-होस्ट किए गए मुफ़्त (AGPL); सशुल्क प्रबंधित स्तर एक विनम्र प्रति-सीट मासिक शुल्क से शुरू होते हैं।

प्लेटफॉर्म: किसी भी होस्ट OS पर Docker।

डाउनलोड: portkey.ai · GitHub

निष्कर्ष: एकल होमलैब के लिए ओवरकिल, एक छोटी टीम गेटवे के लिए सही आकार।

सही कैसे चुनें

FAQ

लोड बैलेंसर और अनुमान इंजन में क्या अंतर है?

एक अनुमान इंजन (vLLM, Ollama, llama.cpp) वास्तविक मॉडल चलाता है। एक लोड बैलेंसर या गेटवे (LiteLLM, Olla) सामने बैठता है और तय करता है कि कौन सा इंजन प्रत्येक अनुरोध प्राप्त करता है। आपको दोनों की जरूरत है: एक सेवा के लिए, एक रूटिंग के लिए।

क्या मैं फॉलबैक के रूप में होस्ट किए गए API के साथ स्थानीय मॉडल को लोड-बैलेंस कर सकता हूं?

हाँ। LiteLLM और Portkey इसके लिए बिल्कुल निर्मित हैं। पहले कम लागत वजन के साथ स्थानीय मॉडल कॉन्फ़िगर करें, फिर फॉलबैक के रूप में एक होस्ट किए गए प्रदाता; राउटर केवल तभी होस्ट किए गए API का उपयोग करता है जब आपका GPU नीचे या अधिभारित हो।

यदि मेरे पास केवल एक GPU है तो क्या मुझे राउटर की आवश्यकता है?

कड़ाई से नहीं, लेकिन यह अभी भी मदद करता है। एक राउटर आपको एक स्थिर समापन बिंदु, पुन: प्रयास तर्क और अवलोकनीयता देता है, इसलिए यदि आप बाद में Ollama को vLLM में स्वैप करते हैं तो आपको किसी भी क्लाइंट ऐप को नहीं छूना होगा।

क्या Nvidia Personal AI Router AMD या Intel GPUs के साथ काम करता है?

आधिकारिक रूप से नहीं। यह Nvidia हार्डवेयर और CUDA को लक्षित करता है। मिश्रित सेटअप के लिए, LiteLLM या Olla निर्माता की परवाह किए बिना किसी भी OpenAI-संगत बैकएंड को समान रूप से व्यवहार करेंगे।

किसके पास सबसे कम विलंबता है?

Olla परीक्षणों में एक स्थानीय नेटवर्क पर 5 मिमी से कम जोड़ता है, इसके Go कोर के लिए धन्यवाद। LiteLLM एक गर्म कैश पर Rust इंजन के साथ 10-15 मिमी के आसपास बैठता है। अधिकांश चैट और कोडिंग वर्कलोड के लिए, कोई भी मॉडल की अपनी डिकोड समय के आगे अदृश्य है।