LM Studio और Ollama ने स्थानीय LLM को चलाना एक-क्लिक का काम बना दिया। फाइन-ट्यूनिंग वर्षों तक एक डेटा सेंटर का काम रहा, समान हार्डवेयर पर पहुंच से बाहर। यह अंत में बदल रहा है। Unsloth का नया डेस्कटॉप ऐप्लिकेशन दृश्यमान संकेत है, लेकिन अब खुली फ्रेमवर्क का एक छोटा समूह एक एकल 12 GB या 24 GB उपभोक्ता GPU पर एक वास्तविक LoRA अडैप्टर को एक दोपहर की जगह में प्रशिक्षित करता है।
हमने RTX 4070, RTX 4090 और एक बेस M2 Pro Mac में सात उपकरणों का परीक्षण किया। नीचे दिए गए विकल्प वे हैं जो Llama 3.1 8B या Mistral 7B LoRA चलाने को पूरा किया, मेमोरी से बाहर निकले बिना, क्लस्टर की आवश्यकता के बिना, और आपको पहले PyTorch में एक प्रशिक्षण लूप लिखने के लिए कहे बिना। सूची GUI-प्रथम उपकरणों को CLI-प्रथम फ्रेमवर्क के साथ मिश्रित करती है ताकि आप उस एर्गोनोमिक स्तर को चुन सकें जो आप चाहते हैं।
उपभोक्ता-GPU फाइन-ट्यूनर में क्या देखें
- LoRA और QLoRA समर्थन, इसलिए एक 7B मॉडल 12 GB पर प्रशिक्षित होता है और एक 13B 24 GB पर।
- 4-bit और 8-bit क्वांटाइज्ड लोडिंग, जो यह सब फिट होने का कारण है।
- Flash Attention या समकक्ष कर्नल ताकि प्रशिक्षण गति में गिरावट न आए।
- उन मॉडल परिवारों के लिए समर्थन जो आप वास्तव में परवाह करते हैं: Llama, Mistral, Qwen, Gemma, Phi।
- डेटा सेट प्रारूप जो तैयार करने में आसान हैं, आदर्श रूप से JSONL निर्देश/आउटपुट फ़ील्ड के साथ।
- Checkpointing ताकि घंटे चार में क्रैश पूरे रन को न खर्च करे।
त्वरित तुलना
| ऐप | सर्वोत्तम के लिए | प्लेटफॉर्म | मुफ़्त योजना | शुरुआती कीमत/मो | लाइसेंस |
|---|---|---|---|---|---|
| Unsloth | 12–24 GB पर सबसे तेज़ LoRA | Windows, Linux | पूर्ण ऐप | मुफ़्त (Pro tier) | Apache 2.0 |
| Axolotl | कॉन्फ़िग-फ़ाइल पावर यूजर | Linux | पूर्ण ऐप | मुफ़्त | Apache 2.0 |
| LLaMA-Factory | GUI-संचालित, व्यापक मॉडल समर्थन | Windows, Linux | पूर्ण ऐप | मुफ़्त | Apache 2.0 |
| Text Generation WebUI | LoRA संलग्न करें और जगह-जगह पर परीक्षण करें | Windows, macOS, Linux | पूर्ण ऐप | मुफ़्त | AGPLv3 |
| PEFT | अपने स्वयं के प्रशिक्षण लूप के लिए लाइब्रेरी | Windows, macOS, Linux | पूर्ण ऐप | मुफ़्त | Apache 2.0 |
| H2O LLM Studio | प्रयोग ट्रैकिंग के साथ कॉर्पोरेट UI | Windows, Linux | मुफ़्त (ओपन सोर्स) | Enterprise समर्थन | Apache 2.0 |
| MLX-LM | Apple Silicon पर मूल फाइन-ट्यूनिंग | macOS | पूर्ण ऐप | मुफ़्त | MIT |
ऐप्स
1. Unsloth, 12–24 GB पर सर्वश्रेष्ठ सबसे तेज़ LoRA
Unsloth Llama, Mistral, Qwen, Gemma और Phi फाइन-ट्यूनिंग के गर्म पथों को फिर से लिखता है ताकि लगभग दो से पांच गुना तेजी हो और स्टॉक Transformers के बारे में आधा मेमोरी हो। एक 7B LoRA एक एकल 12 GB GPU पर फिट बैठता है और एक मामूली डेटा सेट पर एक दोपहर में पूरा हो जाता है। नया डेस्कटॉप ऐप सामान्य व्यंजनों के लिए अंतिम CLI चरण को हटा देता है।
यह कहाँ कम पड़ता है: कवरेज सबसे लोकप्रिय मॉडल परिवारों की ओर झुकता है; अपरिचित आर्किटेक्चर को अपस्ट्रीम Transformers पथ की आवश्यकता होती है।
मूल्य निर्धारण:
- मुफ़्त: पूर्ण फ्रेमवर्क और डेस्कटॉप ऐप्लिकेशन।
- सशुल्क: एंटरप्राइज समर्थन और तेजी से बहु-GPU कर्नल के लिए Pro tier।
प्लेटफॉर्म: Windows (WSL2 के माध्यम से), Linux।
डाउनलोड करें: unsloth.ai · GitHub
निष्कर्ष: 2026 में एक एकल उपभोक्ता कार्ड पर LoRA प्रशिक्षण के लिए डिफ़ॉल्ट पसंद।
2. Axolotl, सर्वश्रेष्ठ कॉन्फ़िग-फ़ाइल पावर यूजर
Axolotl Hugging Face के चारों ओर निर्मित एक कॉन्फ़िग-संचालित प्रशिक्षण फ्रेमवर्क है। एक एकल YAML फ़ाइल मॉडल, डेटा सेट, LoRA रैंक और प्रशिक्षण args का वर्णन करती है, और Axolotl बाकी का ख्याल रखता है। यह Unsloth की तुलना में कम गति अनुकूलन का समर्थन करता है लेकिन कम सामान्य मॉडल और डेटा सेट प्रारूपों में लचीलेपन में जीत जाता है।
यह कहाँ कम पड़ता है: कोई GUI नहीं; कॉन्फ़िग के पास एक सीखने की वक्र है; डॉक्स मानते हैं कि आपने पहले कुछ प्रशिक्षित किया है।
मूल्य निर्धारण:
- मुफ़्त: पूर्ण ऐप।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Linux (macOS/Windows पर Docker)।
डाउनलोड करें: GitHub (axolotl-ai-cloud/axolotl)
निष्कर्ष: सही विकल्प जब Unsloth के पास आपका मॉडल नहीं है और आप अभी भी एक स्वच्छ पाइपलाइन चाहते हैं।
3. LLaMA-Factory, सर्वश्रेष्ठ GUI-संचालित प्रशिक्षक
LLaMA-Factory एक व्यापक प्रशिक्षण टूलकिट के ऊपर एक Gradio-आधारित GUI भेजता है। एक मॉडल चुनें, एक डेटा सेट अपलोड करें, LoRA रैंक और सीखने की दर सेट करें, और शुरू करें। यह 100+ मॉडल परिवारों को बॉक्स से बाहर कवर करता है और इसके चार्ट हाइपरपैरामीटर ट्यूनिंग को सुलभ बनाते हैं।
यह कहाँ कम पड़ता है: GUI कुछ कठिन विकल्पों को छिपाता है; VRAM किनारे के मामलों में इसे CLI की आवश्यकता है।
मूल्य निर्धारण:
- मुफ़्त: पूर्ण ऐप।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Windows, Linux।
डाउनलोड करें: GitHub (hiyouga/LLaMA-Factory)
निष्कर्ष: LoRA प्रशिक्षण के लिए नए किसी के लिए भी सर्वश्रेष्ठ GUI-प्रथम प्रवेश बिंदु।
4. Text Generation WebUI, LoRA संलग्न करने और परीक्षण करने के लिए सर्वश्रेष्ठ
Text Generation WebUI (“oobabooga”) स्थानीय-LLM चैट UI है जो अधिकांश उत्साही पहले से ही चलाते हैं। इसका Training tab जगह-जगह पर LoRA प्रशिक्षण करता है, और एक बार चलना पूरा होने के बाद आप अडैप्टर को सक्षम कर सकते हैं और तुरंत परिणाम की जांच करने के लिए मॉडल के साथ बातचीत कर सकते हैं।
यह कहाँ कम पड़ता है: इस सूची में सबसे तेजी से प्रशिक्षक नहीं; प्रशिक्षण tab एक अच्छा “बिंदु कनेक्ट करें” उपकरण है, production पाइपलाइन नहीं।
मूल्य निर्धारण:
- मुफ़्त: पूर्ण ऐप।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड करें: GitHub (oobabooga/text-generation-webui)
निष्कर्ष: सबसे कम-घर्षण उपकरण यह देखने के लिए कि क्या आपके डेटा की फाइन-ट्यूनिंग कुछ बदलती है जो आप परवाह करते हैं।
5. PEFT, अपने स्वयं के प्रशिक्षण लूप के लिए सर्वश्रेष्ठ लाइब्रेरी
PEFT Hugging Face की Parameter-Efficient Fine-Tuning लाइब्रेरी है। यह Python बिल्डिंग ब्लॉक, LoRA, IA3, प्रीफिक्स ट्यूनिंग का एक सेट है जो आप एक Trainer में डालते हैं। यदि आप लूप को नियंत्रित करना चाहते हैं, तो यह वह स्तर है जिस पर आप काम करते हैं।
यह कहाँ कम पड़ता है: कोई UI नहीं; प्रत्येक प्रयोग एक स्क्रिप्ट है; आप एर्गोनोमिक्स के लिए जिम्मेदार हैं।
मूल्य निर्धारण:
- मुफ़्त: पूर्ण ऐप।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड करें: GitHub (huggingface/peft)
निष्कर्ष: एक शोधकर्ता या गंभीर शौकीन के लिए सही स्तर का अमूर्तता जो पूर्ण नियंत्रण चाहता है।
6. H2O LLM Studio, सर्वश्रेष्ठ कॉर्पोरेट-फ्लेवर्ड प्रशिक्षक
H2O LLM Studio एक स्वच्छ React UI में समान खुली फ्रेमवर्क को लपेटता है, प्रयोग ट्रैकिंग जोड़ता है, और H2O के क्लाउड उपकरणों के साथ स्वच्छ रूप से एकीकृत करता है जब एक रन एक एकल GPU को बढ़ाता है। 4090 के साथ एक वर्कस्टेशन पर यह आरामदायक है।
यह कहाँ कम पड़ता है: UI यहाँ किसी भी अन्य पिक की तुलना में एक भारी इंस्टॉल है; राय वाले डिफ़ॉल्ट अंतर्निहित नॉब को छिपा सकते हैं।
मूल्य निर्धारण:
- मुफ़्त: पूरी ओपन-सोर्स ऐप।
- सशुल्क: Enterprise समर्थन।
प्लेटफॉर्म: Windows, Linux।
डाउनलोड करें: GitHub (h2oai/h2o-llmstudio)
निष्कर्ष: वह पिक जब प्रयोग एक एकल लैपटॉप के बजाय एक टीम को जाते हैं।
7. MLX-LM, Apple Silicon पर सर्वश्रेष्ठ मूल फाइन-ट्यूनिंग
MLX-LM MLX पर निर्मित Apple-native LM फ्रेमवर्क है। एक Mac Studio या 32 GB एकीकृत मेमोरी के साथ एक बेस M2 Pro पर, 7B और 13B मॉडल पर LoRA फाइन-ट्यूनिंग अब एक समर्थित पथ है, और फ्रेमवर्क का मेमोरी मॉडल साझा GPU/CPU आवंटन का उपयोग करता है उन मॉडल को फिट करने के लिए जिन्हें CUDA कभी नहीं जा सके।
यह कहाँ कम पड़ता है: केवल macOS; मॉडल कैटलॉग CUDA की तुलना में छोटा है; PyTorch-आधारित उपकरणों की तुलना में कम परिपक्व।
मूल्य निर्धारण:
- मुफ़्त: पूर्ण ऐप।
- सशुल्क: लागू नहीं।
प्लेटफॉर्म: macOS (Apple Silicon)।
डाउनलोड करें: GitHub (ml-explore/mlx-lm)
निष्कर्ष: आधुनिक Mac पर सही पिक, अन्य कहीं भी गलत पिक।
सही कैसे चुनें
यदि आपके पास एक एकल 12 GB या 24 GB उपभोक्ता GPU है और गति चाहते हैं, तो Unsloth स्थापित करें और इसके notebooks में से एक चलाएं। इस सूची में कुछ भी एक काम करने वाले अडैप्टर तक तेजी से नहीं मिलता है।
यदि आपका मॉडल या डेटा सेट प्रारूप Unsloth की तेजी से पथ से बाहर है, तो अपने कॉन्फ़िग-संचालित लचीलेपन के लिए Axolotl चुनें।
यदि आपने पहले कुछ भी प्रशिक्षित नहीं किया है, तो LLaMA-Factory एक ही अंतर्निहित उपकरणों पर एक GUI रखता है और “कौन सी सीखने की दर” बहस को छोटा करता है।
यदि आप पहले से Text Generation WebUI चलाते हैं, तो इसका Training tab उपयोग करें। एक एकल-बंद रन के लिए एक और उपकरण जोड़ें।
प्रशिक्षण लूप पर नियंत्रण के लिए, PEFT सही लाइब्रेरी है। Python लिखने की अपेक्षा करें।
यदि प्रयोगों की अन्य लोगों द्वारा समीक्षा की आवश्यकता है, तो H2O LLM Studio ओपन-सोर्स tier में वह UI भेजता है।
MLX-LM Apple Silicon पर सही विकल्प है और केवल वहीं।
FAQ
क्या मुझे 7B मॉडल के फाइन-ट्यून के लिए 24 GB GPU की आवश्यकता है?
नहीं। Unsloth और QLoRA 8–12 GB में 7B LoRA फिट करते हैं। 24 GB आपको 13B आराम से मिलता है।
क्या मैं CPU पर फाइन-ट्यून कर सकता हूं?
तकनीकी रूप से हाँ, जिस तरह से आप तकनीकी रूप से एक नाव से एक समुद्र को पार कर सकते हैं। GPU या Apple Silicon का उपयोग करें।
क्या फाइन-ट्यूनिंग मेरे स्थानीय मॉडल को मेरे काम के लिए बेहतर बनाएगी?
निर्देश निष्पादन और डोमेन शब्दावली के लिए, हाँ। कठोर तर्क लाभ के लिए, ज्यादातर नहीं; आधार मॉडल की छत छत है।
मेरा डेटा सेट कितना बड़ा होना चाहिए?
कार्य-केंद्रित LoRA के लिए, 500 से 5,000 उच्च-गुणवत्ता वाले उदाहरण 100,000 मध्यम उदाहरणों को हराते हैं। निर्दयतापूर्वक क्यूरेट करें।
क्या मैं LoRA अडैप्टर साझा कर सकता हूं जिसे मैंने प्रशिक्षित किया था?
हाँ; अडैप्टर छोटे हैं। पहले आधार मॉडल की लाइसेंस जांचें, अधिकांश Llama और Mistral वेरिएंट permissive हैं लेकिन समान नहीं।