Google Gemma खुले-वजन मॉडल परिवार

Google का Gemma परिवार लैपटॉप के लिए एक अच्छी मिठास की जगह है। एक 4B चेकपॉइंट 8GB VRAM में आसानी से फिट हो जाता है, लाइसेंस आंतरिक उपकरणों के लिए काफी अनुमेय है, और Ollama एक कमांड में वज़न खींचता है। यह एक ही छोटा, खुले-वजन वाला मॉडल नहीं है जो एक साधारण डेस्कटॉप पर अच्छी तरह से चलता है। जब से Gemma 3 आया है, हमने उसी 16GB लैपटॉप और एक 24GB डेस्कटॉप पर छह अन्य परिवारों का परीक्षण किया है, और उनमें से कई उन कार्यों में Gemma को हराते हैं जो हमारे लिए महत्वपूर्ण हैं। नीचे Gemma विकल्प दिए गए हैं जिन्हें हमने स्थापित रखा है।

त्वरित तुलना

मॉडल परिवार सर्वश्रेष्ठ के लिए निःशुल्क योजना लाइसेंस उल्लेखनीय विशेषता
Llama 3 (Meta) सामान्य चैट, उपकरण उपयोग हाँ, Hugging Face पर वज़न Meta सामुदायिक लाइसेंस सबसे व्यापक उपकरण और परिमाण समर्थन
Qwen 3 (Alibaba) बहुभाषी तर्क हाँ Apache 2.0 अंतर्निहित सोच मोड जिसे आप टॉगल कर सकते हैं
Phi-4 (Microsoft) 8GB लैपटॉप हाँ MIT प्रति गीगाबाइट सर्वश्रेष्ठ छोटे-मॉडल तर्क
Mistral 7B / Nemo कोड और तेज़ चैट हाँ Apache 2.0 बॉक्स से बाहर फ़ंक्शन कॉलिंग के साथ शिप
DeepSeek V3 / R1 distills गणित, कोड, चिंतन की श्रृंखलाएँ हाँ MIT (distills) स्पष्ट <think> टैग
IBM Granite 3.3 एंटरप्राइज-सुरक्षित ड्राफ्ट हाँ Apache 2.0 संरचित निष्कर्षण पर मजबूत
SmolLM 3 Raspberry Pi और पुराने लैपटॉप हाँ Apache 2.0 4GB RAM के तहत चलने वाला 3B मॉडल

लोग Gemma के विकल्प क्यों खोजते हैं

Gemma 3 सक्षम है, लेकिन कुछ वास्तविक अंतराल हमें अन्य मॉडल परिवारों की ओर ले जाते हैं:

विकल्प

Llama 3 (Meta) - सबसे व्यापक इकोसिस्टम के लिए सर्वश्रेष्ठ

Llama 3 अधिकांश लोगों के लिए डिफ़ॉल्ट स्थानीय मॉडल है जो अपना AI होस्ट करते हैं, और कारण उबाऊ है: हर चलाने वाला इसका समर्थन करता है, हर क्वांटाइजेशन प्रारूप पहले इसे लक्षित करता है, और हर fine-tune समुदाय इसके लिए लिखता है। 8B मॉडल उसी 16GB लैपटॉप पर चलता है जहाँ Gemma 4B फिट होता है, थोड़ी अधिक RAM जगह के साथ, और 70B मॉडल वर्कस्टेशन GPU तक स्केल करता है।

जहाँ यह कम पड़ता है: Meta सामुदायिक लाइसेंस में उपयोग प्रतिबंध हैं जो Apache 2.0 में नहीं हैं। बहुभाषी गुणवत्ता Qwen 3 से पिछड़ी है।

मूल्य निर्धारण:

Gemma से माइग्रेशन: ollama pull llama3.1:8b और अपने Open WebUI या LM Studio कॉन्फिग में मॉडल का नाम स्वैप करें। संकेत स्वच्छ रूप से पोर्ट करते हैं। चैट टेम्पलेट भिन्न हैं, इसलिए किसी भी सिस्टम संकेत को एक बार फिर से चलाएँ।

डाउनलोड: ollama.com/library/llama3.1

निचली पंक्ति: Llama 3 चुनें जब उपकरण की चौड़ाई कच्चे बेंचमार्क से अधिक महत्वपूर्ण हो। यदि आपको Apache 2.0 की आवश्यकता है तो इसे छोड़ दें।

Qwen 3 (Alibaba) - सर्वश्रेष्ठ सर्वांगीण डिफ़ॉल्ट

Qwen 3 स्थानीय उपयोग के लिए सबसे सुरक्षित सामान्य-उद्देश्य सिफारिश बन गया है। परिवार 0.6B से 32B घने चेकपॉइंट को कवर करता है, साथ ही 30B और 235B MoE वेरिएंट, तो आप VRAM द्वारा चुन सकते हैं और अपनी संकेत शैली बदले बिना चेकपॉइंट के बीच स्वैप कर सकते हैं। गणित और कोड पर तर्क गुणवत्ता एक ही पैरामीटर गिनती के साथ Gemma को हराती है, और अनुमान समय पर सक्षम करने के लिए एक उचित सोच मोड है।

जहाँ यह कम पड़ता है: Alibaba के लाइसेंस खंड उपयोगकर्ता-गिनती सीमा के चारों ओर कुछ उद्यमों को परेशान करते हैं। MoE वेरिएंट को एक चलाने वाले की आवश्यकता है जो mixture-of-experts का समर्थन करता है, जो प्रत्येक डेस्कटॉप ऐप सुंदर ढंग से संभालता नहीं है।

मूल्य निर्धारण:

Gemma से माइग्रेशन: समान Ollama प्रवाह। यदि आप Gemma के अंतर्निहित सिस्टम संकेत अनुमान का उपयोग करते हैं, तो Qwen एक ही निर्देश स्वीकार करता है। CLI में /set think के साथ सोच मोड चालू करें।

डाउनलोड: ollama.com/library/qwen3

निचली पंक्ति: वह मॉडल जो हम किसी को भी सुझाते हैं जो अधिक संदर्भ के बिना “मुझे स्थानीय रूप से क्या चलाना चाहिए” पूछते हैं।

Phi-4 (Microsoft) - कमजोर हार्डवेयर के लिए सर्वश्रेष्ठ

Phi-4 और इसके Phi-4-mini भाई छोटी मशीनों को लक्षित करते हैं। 14B मॉडल तर्क बेंचमार्क पर अपने वजन को मारता है, और 3.8B पर Phi-4-mini बिना GPU के 8GB RAM पर चलता है। Microsoft सब कुछ MIT के तहत लाइसेंस देता है, इसलिए यह कागजी कार्य के बिना वाणिज्यिक परियोजनाओं में गिरता है।

जहाँ यह कम पड़ता है: सामान्य चैट Llama या Qwen की तुलना में सूखा महसूस करता है, और रचनात्मक लेखन कमजोर है। मार्केटिंग कॉपी या कहानी कहने के लिए उपयोग करने के लिए मॉडल नहीं।

मूल्य निर्धारण:

Gemma से माइग्रेशन: प्रत्यक्ष स्वैप। Phi-4-mini की संदर्भ विंडो छोटी है (पूर्ण मॉडल पर 128k, mini पर 32k), इसलिए पहले लंबी-दस्तावेज़ संकेत का ऑडिट करें।

डाउनलोड: ollama.com/library/phi4

निचली पंक्ति: पुराने लैपटॉप के लिए Phi-4-mini चुनें और Phi-4 जब तर्क गुणवत्ता व्यक्तित्व से अधिक महत्वपूर्ण हो।

Mistral 7B और Mistral Nemo - कोड और फ़ंक्शन कॉलिंग के लिए सर्वश्रेष्ठ

Mistral 7B तीक्ष्ण रहता है, और नया Nemo 12B मॉडल जो Mistral ने NVIDIA के साथ बनाया है वह परिवार है जिसकी ओर हम तेज़ कोड पूरा करना और विश्वसनीय फ़ंक्शन कॉलिंग चाहते हैं। Nemo के उपकरण का उपयोग हर डेस्कटॉप चलाने वाले पर पहली कोशिश में काम किया जिसे हमने परीक्षण किया। Apache 2.0, कोई शर्तें नहीं।

जहाँ यह कम पड़ता है: मूल मॉडल Llama 3 की तुलना में कम बातूनी हैं, और आउटपुट संक्षिप्त लग सकते हैं। नए बड़े Mistral मॉडल उनकी वाणिज्यिक API के पीछे बंद हैं।

मूल्य निर्धारण:

Gemma से माइग्रेशन: Ollama खींचें, चैट टेम्पलेट को Mistral की [INST] प्रारूप में समायोजित करें। यदि आप उपकरण-कॉलिंग एजेंटों के लिए Gemma का उपयोग करते हैं, तो Nemo पहली बार चलाने पर एक अपग्रेड जैसा महसूस होगा।

डाउनलोड: mistral.ai

निचली पंक्ति: वह विकल्प जब Gemma का उपकरण समर्थन आपको निराश कर दिया है।

DeepSeek V3 और R1 distills - सर्वश्रेष्ठ तर्क के लिए

DeepSeek दो परिवारों को पता करने के लिए योग्य है: V3, एक मजबूत सामान्य MoE मॉडल, और R1 distills जो Llama और Qwen बेस को मशीनों में सोचने में fine-tune करता है। R1 distills अपनी चिंतन श्रृंखला को <think> टैग के अंदर उजागर करते हैं, जो XDA लेखक का मतलब था “एक स्थानीय LLM जो उत्तर देने से पहले वास्तव में सोचता है।” गणित के शब्द समस्याओं और बहु-चरणीय कोड परिवर्तनों पर, R1 distills अक्सर कम VRAM में चलते हुए Gemma 3 27B को हराते हैं।

जहाँ यह कम पड़ता है: सोच मोड टोकन को खा जाता है, जो पहली टोकन विलंबता को धीमा करता है और संदर्भ को खा जाता है। MoE V3 मॉडल अधिकांश डेस्कटॉप के लिए भारी है।

मूल्य निर्धारण:

Gemma से माइग्रेशन: deepseek-r1:14b खींचें और बिल्कुल वैसे ही संकेत दें जैसे आप Gemma करेंगे। अपने UI से <think> टैग फ़िल्टर करें यदि अंतिम उपयोगकर्ताओं को उन्हें नहीं देखना चाहिए।

डाउनलोड: ollama.com/library/deepseek-r1

निचली पंक्ति: तर्क-प्रथम चुनाव।

IBM Granite 3.3 - संरचित निष्कर्षण के लिए सर्वश्रेष्ठ

IBM Granite शांत, अदृश्य, और कॉर्पोरेट काम पर बहुत अच्छा है जिसके लिए अधिकांश स्थानीय LLM वास्तव में उपयोग किए जाते हैं: दस्तावेज़ों से फ़ील्ड निकालना, ईमेल ड्राफ्ट करना, टिकट वर्गीकरण करना। Apache 2.0 लाइसेंस, एंटरप्राइज़ पक्ष पर Watsonx उपकरण, और 8B मॉडल उसी हार्डवेयर पर Gemma के साथ चलता है।

जहाँ यह कम पड़ता है: बातचीतीय स्वर कठोर है। रचनात्मक कार्य एक कानूनी ज्ञापन जैसा महसूस करते हैं।

मूल्य निर्धारण:

Gemma से माइग्रेशन: प्रत्यक्ष स्वैप। यदि आप JSON-मोड संकेत रैपर के साथ Gemma का उपयोग करते हैं, तो Granite इसे अधिक विश्वसनीय रूप से सम्मान करता है।

डाउनलोड: ollama.com/library/granite3.3

निचली पंक्ति: निष्कर्षण और वर्गीकरण पाइपलाइनों के लिए उबाऊ सही उत्तर।

SmolLM 3 - पुराने लैपटॉप और सिंगल-बोर्ड कंप्यूटर के लिए सर्वश्रेष्ठ

SmolLM 3 Hugging Face से एक 3B मॉडल है जो छोटे हार्डवेयर पर चलने के लिए डिज़ाइन किया गया है। यह 4GB RAM के तहत फिट बैठता है, एक Raspberry Pi 5 पर बूट करता है, और एक सुसंगत बातचीत रखता है। यह Gemma 4B को तर्क में पार नहीं करेगा, लेकिन एक मशीन पर चलता रहेगा जहाँ Gemma डिस्क में स्वैप करेगा।

जहाँ यह कम पड़ता है: ज्ञान कटऑफ पुराना है, और लंबी-संदर्भ याद कमजोर है।

मूल्य निर्धारण:

Gemma से माइग्रेशन: Ollama के माध्यम से खींचें या llama.cpp के माध्यम से सीधे चलाएँ। किसी भी संकेत को दुबारा काम करने की अपेक्षा करें जो Gemma के विशिष्ट ज्ञान कटऑफ को मानता है।

डाउनलोड: huggingface.co/HuggingFaceTB/SmolLM3-3B

निचली पंक्ति: जब मशीन कुछ भी बड़ा नहीं संभाल सकती तो गिरावट।

कैसे चुनें

पहले मेमोरी से चुनें, दूसरा कार्य।

FAQ

16GB लैपटॉप के लिए Gemma का अच्छा विकल्प क्या है? Qwen 3 8B या Phi-4-mini दोनों फिट होते हैं और दोनों सामान्य तर्क पर Gemma 3 4B को हराते हैं। Qwen 3 बहुभाषी काम जीतता है, Phi गणित जीतता है।

क्या DeepSeek R1 कोडिंग के लिए Gemma से बेहतर है? मल्टी-स्टेप डीबग और रीफैक्टर कार्यों के लिए, 14B पर R1 distill आमतौर पर Gemma 3 27B को हराता है, मुख्य रूप से क्योंकि चिंतन श्रृंखला इसे मिस किए गए किनारे के मामलों को पकड़ने में मदद करती है।

क्या मैं Ollama में Gemma के साथ Llama 3 चला सकता हूँ? हाँ। Ollama मांग पर मॉडल स्वैप करता है। दोनों खींचें, CLI में या Open WebUI में नाम से स्विच करें।

सबसे अनुमेय लाइसेंस वाला हल्का स्थानीय LLM कौन सा है? Qwen 3, Mistral 7B, IBM Granite और SmolLM 3 सभी Apache 2.0 के तहत शिप करते हैं। Phi-4 और DeepSeek R1 distills MIT हैं।

क्या Gemma के लिए अंतर्निहित सोच मोड के साथ कोई विकल्प है? Qwen 3 के पास एक स्पष्ट सोच टॉगल है, और DeepSeek R1 distills <think> टैग में तर्क को लपेटते हैं। Gemma 3 दोनों को उजागर नहीं करता है।