Google का Gemma परिवार लैपटॉप के लिए एक अच्छी मिठास की जगह है। एक 4B चेकपॉइंट 8GB VRAM में आसानी से फिट हो जाता है, लाइसेंस आंतरिक उपकरणों के लिए काफी अनुमेय है, और Ollama एक कमांड में वज़न खींचता है। यह एक ही छोटा, खुले-वजन वाला मॉडल नहीं है जो एक साधारण डेस्कटॉप पर अच्छी तरह से चलता है। जब से Gemma 3 आया है, हमने उसी 16GB लैपटॉप और एक 24GB डेस्कटॉप पर छह अन्य परिवारों का परीक्षण किया है, और उनमें से कई उन कार्यों में Gemma को हराते हैं जो हमारे लिए महत्वपूर्ण हैं। नीचे Gemma विकल्प दिए गए हैं जिन्हें हमने स्थापित रखा है।
त्वरित तुलना
| मॉडल परिवार | सर्वश्रेष्ठ के लिए | निःशुल्क योजना | लाइसेंस | उल्लेखनीय विशेषता |
|---|---|---|---|---|
| Llama 3 (Meta) | सामान्य चैट, उपकरण उपयोग | हाँ, Hugging Face पर वज़न | Meta सामुदायिक लाइसेंस | सबसे व्यापक उपकरण और परिमाण समर्थन |
| Qwen 3 (Alibaba) | बहुभाषी तर्क | हाँ | Apache 2.0 | अंतर्निहित सोच मोड जिसे आप टॉगल कर सकते हैं |
| Phi-4 (Microsoft) | 8GB लैपटॉप | हाँ | MIT | प्रति गीगाबाइट सर्वश्रेष्ठ छोटे-मॉडल तर्क |
| Mistral 7B / Nemo | कोड और तेज़ चैट | हाँ | Apache 2.0 | बॉक्स से बाहर फ़ंक्शन कॉलिंग के साथ शिप |
| DeepSeek V3 / R1 distills | गणित, कोड, चिंतन की श्रृंखलाएँ | हाँ | MIT (distills) | स्पष्ट <think> टैग |
| IBM Granite 3.3 | एंटरप्राइज-सुरक्षित ड्राफ्ट | हाँ | Apache 2.0 | संरचित निष्कर्षण पर मजबूत |
| SmolLM 3 | Raspberry Pi और पुराने लैपटॉप | हाँ | Apache 2.0 | 4GB RAM के तहत चलने वाला 3B मॉडल |
लोग Gemma के विकल्प क्यों खोजते हैं
Gemma 3 सक्षम है, लेकिन कुछ वास्तविक अंतराल हमें अन्य मॉडल परिवारों की ओर ले जाते हैं:
- 27B चेकपॉइंट परिवार का शीर्ष है, और भारी काम के लिए कोई बड़ा भाई नहीं है। Qwen 3 32B और Llama 3 70B वहाँ से उठाते हैं जहाँ Gemma रुकता है।
- उपकरण कॉलिंग और फ़ंक्शन कॉलिंग देर से आई, और स्थानीय चलाने वालों में कवरेज अभी भी असमान है। Mistral और Llama ने महीनों से इसे निखारा है।
- चिंतन श्रृंखला शैली एक ऐसी चीज़ के बजाय अंतर्निहित है जो आप चालू कर सकते हैं। Qwen 3 और DeepSeek R1 अपनी तर्क को
<think>ब्लॉक में उजागर करते हैं जिन्हें आप लॉग या छिपा सकते हैं। - अंग्रेजी और कुछ यूरोपीय भाषाओं के बाहर बहुभाषी गुणवत्ता Qwen 3 की तुलना में कमजोर है, जो r/LocalLLaMA पर एक आम शिकायत है।
- Gemma लाइसेंस OSI द्वारा अनुमोदित नहीं है। यदि आपकी कानूनी टीम को Apache 2.0 या MIT की आवश्यकता है, तो Gemma बाहर है और Qwen, Mistral और DeepSeek वापस खेल में हैं।
विकल्प
Llama 3 (Meta) - सबसे व्यापक इकोसिस्टम के लिए सर्वश्रेष्ठ
Llama 3 अधिकांश लोगों के लिए डिफ़ॉल्ट स्थानीय मॉडल है जो अपना AI होस्ट करते हैं, और कारण उबाऊ है: हर चलाने वाला इसका समर्थन करता है, हर क्वांटाइजेशन प्रारूप पहले इसे लक्षित करता है, और हर fine-tune समुदाय इसके लिए लिखता है। 8B मॉडल उसी 16GB लैपटॉप पर चलता है जहाँ Gemma 4B फिट होता है, थोड़ी अधिक RAM जगह के साथ, और 70B मॉडल वर्कस्टेशन GPU तक स्केल करता है।
जहाँ यह कम पड़ता है: Meta सामुदायिक लाइसेंस में उपयोग प्रतिबंध हैं जो Apache 2.0 में नहीं हैं। बहुभाषी गुणवत्ता Qwen 3 से पिछड़ी है।
मूल्य निर्धारण:
- निःशुल्क: Hugging Face और Ollama पर पूर्ण वज़न
- सशुल्क: Together, Groq, Fireworks के माध्यम से क्लाउड होस्टिंग लगभग $0.20 प्रति मिलियन टोकन से शुरू होती है
- vs Gemma: तुलनीय मेमोरी पदचिह्न, बड़ा इकोसिस्टम, कमजोर अंतर्निहित तर्क
Gemma से माइग्रेशन: ollama pull llama3.1:8b और अपने Open WebUI या LM Studio कॉन्फिग में मॉडल का नाम स्वैप करें। संकेत स्वच्छ रूप से पोर्ट करते हैं। चैट टेम्पलेट भिन्न हैं, इसलिए किसी भी सिस्टम संकेत को एक बार फिर से चलाएँ।
डाउनलोड: ollama.com/library/llama3.1
निचली पंक्ति: Llama 3 चुनें जब उपकरण की चौड़ाई कच्चे बेंचमार्क से अधिक महत्वपूर्ण हो। यदि आपको Apache 2.0 की आवश्यकता है तो इसे छोड़ दें।
Qwen 3 (Alibaba) - सर्वश्रेष्ठ सर्वांगीण डिफ़ॉल्ट
Qwen 3 स्थानीय उपयोग के लिए सबसे सुरक्षित सामान्य-उद्देश्य सिफारिश बन गया है। परिवार 0.6B से 32B घने चेकपॉइंट को कवर करता है, साथ ही 30B और 235B MoE वेरिएंट, तो आप VRAM द्वारा चुन सकते हैं और अपनी संकेत शैली बदले बिना चेकपॉइंट के बीच स्वैप कर सकते हैं। गणित और कोड पर तर्क गुणवत्ता एक ही पैरामीटर गिनती के साथ Gemma को हराती है, और अनुमान समय पर सक्षम करने के लिए एक उचित सोच मोड है।
जहाँ यह कम पड़ता है: Alibaba के लाइसेंस खंड उपयोगकर्ता-गिनती सीमा के चारों ओर कुछ उद्यमों को परेशान करते हैं। MoE वेरिएंट को एक चलाने वाले की आवश्यकता है जो mixture-of-experts का समर्थन करता है, जो प्रत्येक डेस्कटॉप ऐप सुंदर ढंग से संभालता नहीं है।
मूल्य निर्धारण:
- निःशुल्क: Hugging Face, Modelscope, Ollama पर वज़न
- सशुल्क: Alibaba Cloud API, साथ ही DashScope और OpenRouter मिरर
- vs Gemma: क्लाउड पर सस्ता, स्थानीय रूप से स्वच्छ तर्क, समान पदचिह्न
Gemma से माइग्रेशन: समान Ollama प्रवाह। यदि आप Gemma के अंतर्निहित सिस्टम संकेत अनुमान का उपयोग करते हैं, तो Qwen एक ही निर्देश स्वीकार करता है। CLI में /set think के साथ सोच मोड चालू करें।
डाउनलोड: ollama.com/library/qwen3
निचली पंक्ति: वह मॉडल जो हम किसी को भी सुझाते हैं जो अधिक संदर्भ के बिना “मुझे स्थानीय रूप से क्या चलाना चाहिए” पूछते हैं।
Phi-4 (Microsoft) - कमजोर हार्डवेयर के लिए सर्वश्रेष्ठ
Phi-4 और इसके Phi-4-mini भाई छोटी मशीनों को लक्षित करते हैं। 14B मॉडल तर्क बेंचमार्क पर अपने वजन को मारता है, और 3.8B पर Phi-4-mini बिना GPU के 8GB RAM पर चलता है। Microsoft सब कुछ MIT के तहत लाइसेंस देता है, इसलिए यह कागजी कार्य के बिना वाणिज्यिक परियोजनाओं में गिरता है।
जहाँ यह कम पड़ता है: सामान्य चैट Llama या Qwen की तुलना में सूखा महसूस करता है, और रचनात्मक लेखन कमजोर है। मार्केटिंग कॉपी या कहानी कहने के लिए उपयोग करने के लिए मॉडल नहीं।
मूल्य निर्धारण:
- निःशुल्क: Hugging Face और Ollama पर वज़न
- सशुल्क: उन टीमों के लिए Azure AI Foundry होस्टिंग जो SLA चाहते हैं
- vs Gemma: छोटी मेमोरी पदचिह्न, MIT लाइसेंस, स्वच्छ एंटरप्राइज़ कहानी
Gemma से माइग्रेशन: प्रत्यक्ष स्वैप। Phi-4-mini की संदर्भ विंडो छोटी है (पूर्ण मॉडल पर 128k, mini पर 32k), इसलिए पहले लंबी-दस्तावेज़ संकेत का ऑडिट करें।
डाउनलोड: ollama.com/library/phi4
निचली पंक्ति: पुराने लैपटॉप के लिए Phi-4-mini चुनें और Phi-4 जब तर्क गुणवत्ता व्यक्तित्व से अधिक महत्वपूर्ण हो।
Mistral 7B और Mistral Nemo - कोड और फ़ंक्शन कॉलिंग के लिए सर्वश्रेष्ठ
Mistral 7B तीक्ष्ण रहता है, और नया Nemo 12B मॉडल जो Mistral ने NVIDIA के साथ बनाया है वह परिवार है जिसकी ओर हम तेज़ कोड पूरा करना और विश्वसनीय फ़ंक्शन कॉलिंग चाहते हैं। Nemo के उपकरण का उपयोग हर डेस्कटॉप चलाने वाले पर पहली कोशिश में काम किया जिसे हमने परीक्षण किया। Apache 2.0, कोई शर्तें नहीं।
जहाँ यह कम पड़ता है: मूल मॉडल Llama 3 की तुलना में कम बातूनी हैं, और आउटपुट संक्षिप्त लग सकते हैं। नए बड़े Mistral मॉडल उनकी वाणिज्यिक API के पीछे बंद हैं।
मूल्य निर्धारण:
- निःशुल्क: Hugging Face पर 7B और Nemo वज़न
- सशुल्क: बंद मॉडल के लिए Mistral Le Plateforme API (Large, Medium)
- vs Gemma: बेहतर कोड, बॉक्स से बाहर फ़ंक्शन कॉलिंग, Apache 2.0
Gemma से माइग्रेशन: Ollama खींचें, चैट टेम्पलेट को Mistral की [INST] प्रारूप में समायोजित करें। यदि आप उपकरण-कॉलिंग एजेंटों के लिए Gemma का उपयोग करते हैं, तो Nemo पहली बार चलाने पर एक अपग्रेड जैसा महसूस होगा।
डाउनलोड: mistral.ai
निचली पंक्ति: वह विकल्प जब Gemma का उपकरण समर्थन आपको निराश कर दिया है।
DeepSeek V3 और R1 distills - सर्वश्रेष्ठ तर्क के लिए
DeepSeek दो परिवारों को पता करने के लिए योग्य है: V3, एक मजबूत सामान्य MoE मॉडल, और R1 distills जो Llama और Qwen बेस को मशीनों में सोचने में fine-tune करता है। R1 distills अपनी चिंतन श्रृंखला को <think> टैग के अंदर उजागर करते हैं, जो XDA लेखक का मतलब था “एक स्थानीय LLM जो उत्तर देने से पहले वास्तव में सोचता है।” गणित के शब्द समस्याओं और बहु-चरणीय कोड परिवर्तनों पर, R1 distills अक्सर कम VRAM में चलते हुए Gemma 3 27B को हराते हैं।
जहाँ यह कम पड़ता है: सोच मोड टोकन को खा जाता है, जो पहली टोकन विलंबता को धीमा करता है और संदर्भ को खा जाता है। MoE V3 मॉडल अधिकांश डेस्कटॉप के लिए भारी है।
मूल्य निर्धारण:
- निःशुल्क: Hugging Face पर R1-distill वज़न (MIT लाइसेंस), V3 वज़न भी खुले हैं
- सशुल्क: DeepSeek API, साथ ही OpenRouter मिरर
- vs Gemma: बेहतर तर्क पारदर्शिता, समान सेटअप लागत
Gemma से माइग्रेशन: deepseek-r1:14b खींचें और बिल्कुल वैसे ही संकेत दें जैसे आप Gemma करेंगे। अपने UI से <think> टैग फ़िल्टर करें यदि अंतिम उपयोगकर्ताओं को उन्हें नहीं देखना चाहिए।
डाउनलोड: ollama.com/library/deepseek-r1
निचली पंक्ति: तर्क-प्रथम चुनाव।
IBM Granite 3.3 - संरचित निष्कर्षण के लिए सर्वश्रेष्ठ
IBM Granite शांत, अदृश्य, और कॉर्पोरेट काम पर बहुत अच्छा है जिसके लिए अधिकांश स्थानीय LLM वास्तव में उपयोग किए जाते हैं: दस्तावेज़ों से फ़ील्ड निकालना, ईमेल ड्राफ्ट करना, टिकट वर्गीकरण करना। Apache 2.0 लाइसेंस, एंटरप्राइज़ पक्ष पर Watsonx उपकरण, और 8B मॉडल उसी हार्डवेयर पर Gemma के साथ चलता है।
जहाँ यह कम पड़ता है: बातचीतीय स्वर कठोर है। रचनात्मक कार्य एक कानूनी ज्ञापन जैसा महसूस करते हैं।
मूल्य निर्धारण:
- निःशुल्क: Hugging Face और Ollama पर वज़न
- सशुल्क: होस्ट किए गए अनुमान और एंटरप्राइज़ समर्थन के लिए IBM Watsonx
- vs Gemma: संरचित JSON आउटपुट पर मजबूत, चैट पर कमजोर
Gemma से माइग्रेशन: प्रत्यक्ष स्वैप। यदि आप JSON-मोड संकेत रैपर के साथ Gemma का उपयोग करते हैं, तो Granite इसे अधिक विश्वसनीय रूप से सम्मान करता है।
डाउनलोड: ollama.com/library/granite3.3
निचली पंक्ति: निष्कर्षण और वर्गीकरण पाइपलाइनों के लिए उबाऊ सही उत्तर।
SmolLM 3 - पुराने लैपटॉप और सिंगल-बोर्ड कंप्यूटर के लिए सर्वश्रेष्ठ
SmolLM 3 Hugging Face से एक 3B मॉडल है जो छोटे हार्डवेयर पर चलने के लिए डिज़ाइन किया गया है। यह 4GB RAM के तहत फिट बैठता है, एक Raspberry Pi 5 पर बूट करता है, और एक सुसंगत बातचीत रखता है। यह Gemma 4B को तर्क में पार नहीं करेगा, लेकिन एक मशीन पर चलता रहेगा जहाँ Gemma डिस्क में स्वैप करेगा।
जहाँ यह कम पड़ता है: ज्ञान कटऑफ पुराना है, और लंबी-संदर्भ याद कमजोर है।
मूल्य निर्धारण:
- निःशुल्क: Apache 2.0 के तहत Hugging Face पर वज़न
- सशुल्क: कोई नहीं
- vs Gemma: आधी मेमोरी, लगभग आधी गुणवत्ता
Gemma से माइग्रेशन: Ollama के माध्यम से खींचें या llama.cpp के माध्यम से सीधे चलाएँ। किसी भी संकेत को दुबारा काम करने की अपेक्षा करें जो Gemma के विशिष्ट ज्ञान कटऑफ को मानता है।
डाउनलोड: huggingface.co/HuggingFaceTB/SmolLM3-3B
निचली पंक्ति: जब मशीन कुछ भी बड़ा नहीं संभाल सकती तो गिरावट।
कैसे चुनें
पहले मेमोरी से चुनें, दूसरा कार्य।
- यदि आपके पास 8GB VRAM या 16GB एकीकृत मेमोरी वाला लैपटॉप है: Phi-4-mini या Gemma 3 4B। दोनों फिट होते हैं, Phi तर्क जीतता है, Gemma बहुविध जीतता है।
- यदि आपके पास 12 से 16GB VRAM है: उपकरणों के लिए Llama 3 8B, तर्क के लिए Qwen 3 8B, कोड के लिए Mistral Nemo।
- यदि आपके पास 24GB या अधिक है: Qwen 3 32B सबसे मजबूत all-rounder है, DeepSeek R1 distill 32B तर्क चुनाव है, Llama 3 70B quantized Q4 में फिट बैठता है।
- यदि आपकी अनुपालन टीम को OSI-अनुमोदित लाइसेंस की आवश्यकता है: Gemma और Llama को नियम से बाहर रखें, Qwen या Mistral के साथ Apache 2.0 जाएँ, या Phi-4 या DeepSeek distills के साथ MIT।
- Gemma पर रहें जब बहुविध इनपुट महत्वपूर्ण हो और आप एक परिवार चाहते हों जो 4B और 12B आकारों में छवियों और पाठ को संभालता हो।
FAQ
16GB लैपटॉप के लिए Gemma का अच्छा विकल्प क्या है? Qwen 3 8B या Phi-4-mini दोनों फिट होते हैं और दोनों सामान्य तर्क पर Gemma 3 4B को हराते हैं। Qwen 3 बहुभाषी काम जीतता है, Phi गणित जीतता है।
क्या DeepSeek R1 कोडिंग के लिए Gemma से बेहतर है? मल्टी-स्टेप डीबग और रीफैक्टर कार्यों के लिए, 14B पर R1 distill आमतौर पर Gemma 3 27B को हराता है, मुख्य रूप से क्योंकि चिंतन श्रृंखला इसे मिस किए गए किनारे के मामलों को पकड़ने में मदद करती है।
क्या मैं Ollama में Gemma के साथ Llama 3 चला सकता हूँ? हाँ। Ollama मांग पर मॉडल स्वैप करता है। दोनों खींचें, CLI में या Open WebUI में नाम से स्विच करें।
सबसे अनुमेय लाइसेंस वाला हल्का स्थानीय LLM कौन सा है? Qwen 3, Mistral 7B, IBM Granite और SmolLM 3 सभी Apache 2.0 के तहत शिप करते हैं। Phi-4 और DeepSeek R1 distills MIT हैं।
क्या Gemma के लिए अंतर्निहित सोच मोड के साथ कोई विकल्प है?
Qwen 3 के पास एक स्पष्ट सोच टॉगल है, और DeepSeek R1 distills <think> टैग में तर्क को लपेटते हैं। Gemma 3 दोनों को उजागर नहीं करता है।