इस सप्ताह एक XDA लेख ने एक स्थानीय LLM को अपनी खुद की विफलताओं पर प्रशिक्षित करने का वर्णन किया। लेखक ने मॉडल के गलत आउटपुट एकत्र किए, कुछ दर्जन को मैन्युअल रूप से लेबल किया, उन्हें एक छोटे डेटासेट में पैक किया, और एक हल्का फाइन-ट्यून चलाया। परिणाम उन सटीक समस्याओं पर एक उल्लेखनीय रूप से बेहतर मॉडल था जहां आधार संस्करण गलत हो रहा था। जो पहले किराए की क्लस्टर की आवश्यकता थी वह अब 12 GB GPU वाले लैपटॉप पर चलता है। ये 2026 में डेस्कटॉप पर स्थानीय LLM फाइन-ट्यूनिंग के लिए सात सर्वश्रेष्ठ ऐप्स हैं, सभी मुफ्त और ओपन सोर्स, उस गति से रैंक किए गए हैं जिस पर पहली फाइन-ट्यून वास्तव में चलती है।
एक स्थानीय फाइन-ट्यूनिंग ऐप में क्या देखना है
- LoRA और QLoRA समर्थन। पूर्ण फाइन-ट्यूनिंग हार्डवेयर-बाध्य है। कम-रैंक अडैप्टर (LoRA) और 4-बिट क्वांटाइज़्ड LoRA (QLoRA) उपभोक्ता GPU पर 7B या 13B मॉडल को फाइन-ट्यून करने का एकमात्र यथार्थवादी तरीका है।
- जो हार्डवेयर आपके पास है उस पर चलता है। NVIDIA CUDA डिफ़ॉल्ट है; AMD पर ROCm दूसरा दर्जा है। Apple Silicon (M-series) का MLX के माध्यम से अपना पथ है। एक “फाइन-ट्यून ऐप” केवल तभी उपयोगी है जब यह आपके GPU या NPU पर चलता है।
- एक डेटासेट प्रारूप जो डरावना नहीं है।
instructionऔरoutputफील्ड वाली JSON Lines आधुनिक मानक है। यदि ऐप एक कस्टम बाइनरी प्रारूप चाहता है, तो यह कठिन हो जाएगा। - मूल्यांकन और चेकपॉइंटिंग। फाइन-ट्यूनिंग गलत हो सकती है। एक टूल जो हर N कदम पर स्नैपशॉट बनाता है और नुकसान वक्र दिखाता है, आपको सप्ताहांत को बर्बाद करने से पहले एक बुरे रन से वापस आने देता है।
- GGUF या MLX को निर्यात करना। फाइन-ट्यूनिंग के बाद, मॉडल को एक अनुमान स्टैक में लोड करने की आवश्यकता है। llama.cpp के लिए GGUF; Apple के लिए MLX। यदि टूल वजन को अपने स्वयं के प्रारूप में लॉक करता है, तो परिणाम का उपयोग नहीं किया जा सकता।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ के लिए | बैकेंड | LoRA/QLoRA | Apple Silicon | आसानी |
|---|---|---|---|---|---|
| Unsloth | सबसे तेज़ सिंगल-GPU LoRA | CUDA | हां | बीटा | सर्वोच्च |
| Axolotl | कॉन्फ़िगर योग्य उत्पादन रन | CUDA (+ROCm) | हां | नहीं | मध्यम |
| LLaMA-Factory | वेब-UI फाइन-ट्यूनिंग | CUDA (+ROCm) | हां | बीटा | उच्च |
| MLX-LM | Apple Silicon फाइन-ट्यून | MLX | हां | हां | उच्च |
| Torchtune | आधिकारिक PyTorch संदर्भ | CUDA | हां | सीमित | मध्यम |
| Hugging Face TRL | Transformers के ऊपर RLHF/DPO/PPO | CUDA (+ROCm) | हां | नहीं | मध्यम |
| LM Studio | अनुमान + हल्के फाइन-ट्यून वर्कफ़्लो के लिए GUI सब कुछ | CUDA/Metal | अडैप्टर लोडिंग | हां | बहुत अधिक |
1. Unsloth, सबसे तेज़ सिंगल-GPU LoRA के लिए सर्वश्रेष्ठ
Unsloth वह टूल है जिसने “अपने लैपटॉप पर 7B मॉडल को फाइन-ट्यून करना” एक शोध पत्र से Colab नोटबुक और pip install में बदल दिया। 12 GB VRAM वाले एक एकल RTX 4070 पर, 2048 कॉन्टेक्स्ट पर 7B QLoRA रन कुछ सौ उदाहरणों के लिए लगभग 30 मिनट में समाप्त होता है। गणितीय ट्रिक एक मेमोरी-कुशल फॉरवर्ड-बैकवर्ड पास है; व्यावहारिक लाभ एक फाइन-ट्यून है जो आप कॉफी बनाते समय चलता है।
जहां यह कम पड़ता है: मल्टी-GPU प्रशिक्षण Axolotl या Torchtune की तुलना में दूसरी श्रेणी है। कुछ विशेष आर्किटेक्चर संदर्भ स्टैक की तुलना में बाद में आते हैं।
मूल्य: मुफ़्त।
प्लेटफॉर्म: Linux (सर्वश्रेष्ठ), Windows (WSL2 के माध्यम से), Apple Silicon (बीटा)।
डाउनलोड करें: unsloth.ai / github.com/unslothai/unsloth
निष्कर्ष: सिंगल उपभोक्ता GPU वाले किसी भी व्यक्ति के लिए डिफ़ॉल्ट पहली फाइन-ट्यून।
2. Axolotl, कॉन्फ़िगर योग्य उत्पादन रन के लिए सर्वश्रेष्ठ
Axolotl वह है जो टीमें तब उपयोग करती हैं जब Unsloth का खुशहाली मार्ग पर्याप्त नहीं होता है। कॉन्फ़िगरेशन-फ़ाइल दृष्टिकोण रन को पुनरुत्पादनीय बनाता है: एक एकल YAML फ़ाइल आधार मॉडल, डेटासेट, LoRA रैंक, सीखने की दर, मूल्यांकन कैडेंस और निर्यात लक्ष्य का वर्णन करती है। DeepSpeed और FSDP के साथ मल्टी-GPU काम करता है। समुदाय ने सामान्य कार्यों के लिए दर्जनों पूर्वनिर्धारित कॉन्फ़िग प्रकाशित किए हैं।
जहां यह कम पड़ता है: सीखने की वक्र Unsloth की तुलना में अधिक तीव्र है। पहली रन का अर्थ है YAML कॉन्फ़िग पढ़ना और समझना कि प्रत्येक फील्ड क्या करता है।
मूल्य: मुफ़्त।
प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows।
डाउनलोड करें: github.com/axolotl-ai-cloud/axolotl
निष्कर्ष: पहली Unsloth फाइन-ट्यून कार्य करने के बाद स्नातक होने के लिए टूल।
3. LLaMA-Factory, वेब-UI फाइन-ट्यूनिंग वर्कफ़्लो के लिए सर्वश्रेष्ठ
LLaMA-Factory Axolotl और Unsloth को वेब UI के पीछे लपेटता है। एक आधार मॉडल लोड करें, एक स्थानीय फ़ोल्डर से डेटासेट चुनें, LoRA रैंक के लिए स्लाइडर को समायोजित करें, और रन शुरू करें। नुकसान वक्र ब्राउज़र में प्रस्तुत होते हैं। जो व्यक्ति टर्मिनल को छूना नहीं चाहता उसके लिए, यह एक सौहार्दपूर्ण डेस्कटॉप फाइन-ट्यूनिंग ऐप के सबसे करीब है।
जहां यह कम पड़ता है: वेब UI पूर्ण IDE नहीं है। जटिल मल्टी-स्टेज पाइपलाइन अभी भी एक वास्तविक कॉन्फ़िग चाहते हैं। हर ऑप्टिमाइज़र UI में उजागर नहीं है।
मूल्य: मुफ़्त।
प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows, Docker के माध्यम से macOS।
डाउनलोड करें: github.com/hiyouga/LLaMA-Factory
निष्कर्ष: सर्वश्रेष्ठ पिक यदि टर्मिनल-प्रथम वर्कफ़्लो आपको बंद कर देता है।
4. MLX-LM, Apple Silicon फाइन-ट्यून के लिए सर्वश्रेष्ठ
MLX-LM Apple की आधिकारिक भाषा-मॉडल स्टैक है, MLX सरणी फ्रेमवर्क पर निर्मित। 64 GB एकीकृत मेमोरी वाले M2 Max या M3 Max पर, 7B LoRA फाइन-ट्यून मिड-रेंज NVIDIA GPU के साथ प्रतিस्पर्धी गति पर चलता है। 16 GB के साथ M2 Pro पर यह छोटे मॉडल के लिए काम करता है। MLX-LM Ollama और Apple की अपनी अनुमान रनटाइम के लिए सीधे MLX प्रारूप में निर्यात करता है।
जहां यह कम पड़ता है: हर आधार मॉडल MLX प्रारूप में उपलब्ध नहीं है; Hugging Face वजन से रूपांतरण चरण घर्षण जोड़ता है। इकोसिस्टम CUDA स्टैक से छोटा है।
मूल्य: मुफ़्त।
प्लेटफॉर्म: केवल Apple Silicon macOS।
डाउनलोड करें: github.com/ml-explore/mlx-lm
निष्कर्ष: Mac पर सही टूल। कोई भी अन्य Apple Silicon का इतना अच्छा उपयोग नहीं करता।
5. Torchtune, आधिकारिक PyTorch संदर्भ के लिए सर्वश्रेष्ठ
Torchtune PyTorch का अपना फाइन-ट्यूनिंग लाइब्रेरी है, Meta की टीम द्वारा चलाया जाता है। रेसिपी पठनीय Python हैं, एक कॉन्फ़िग DSL नहीं, जो उन इंजीनियरों के अनुरूप है जो प्रशिक्षण लूप देखना और संशोधित करना चाहते हैं। पूर्ण फाइन-ट्यून, LoRA और DPO के लिए समर्थन। मल्टी-GPU बॉक्स से बाहर काम करता है। दस्तावेज़ इंजीनियरिंग-ग्रेड हैं।
जहां यह कम पड़ता है: Unsloth या Axolotl की तुलना में कम “बैटरी शामिल”। संदर्भ-कार्यान्वयन मुद्रा मतलब कम शॉर्टकट।
मूल्य: मुफ़्त।
प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows, सीमित सुविधाओं के साथ macOS।
डाउनलोड करें: github.com/pytorch/torchtune
निष्कर्ष: Torchtune चुनें यदि आप पहले से PyTorch लिख रहे हैं और प्रशिक्षण लूप देखना चाहते हैं।
6. Hugging Face TRL, RLHF, DPO और पुरस्कार मॉडलिंग के लिए सर्वश्रेष्ठ
TRL (Transformer Reinforcement Learning) सादे supervised फाइन-ट्यून से परे फाइन-ट्यूनिंग कदमों के लिए टूलकिट है: DPO (सीधी वरीयता अनुकूलन), PPO (proximal नीति अनुकूलन), पुरस्कार-मॉडल प्रशिक्षण। XDA “failures को प्रशिक्षित करें” वर्कफ़्लो पर, DPO वास्तविक तकनीक है जिसने लेबल की गई विफलताओं को एक बेहतर मॉडल में बदल दिया। TRL वह है जो इसे चलाता है।
जहां यह कम पड़ता है: अधिक गणित समझने के लिए। RLHF/DPO उन तरीकों से गलत हो सकता है जिनसे SFT नहीं हो सकता; कुछ विफल रन की अपेक्षा करें।
मूल्य: मुफ़्त।
प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows।
डाउनलोड करें: github.com/huggingface/trl
निष्कर्ष: एक वास्तविक “failures से सीखें” फाइन-ट्यूनिंग पाइपलाइन के दूसरे चरण के लिए टूल।
7. LM Studio, सब-कुछ-एक डेस्कटॉप GUI के लिए सर्वश्रेष्ठ
LM Studio मुख्य रूप से एक फाइन-ट्यूनिंग ऐप नहीं है। यह Windows, macOS और Linux पर स्थानीय मॉडल डाउनलोड करने, चलाने और चैट करने के लिए एक डेस्कटॉप GUI है। इस सूची में इसकी भूमिका फाइन-ट्यून वर्कफ़्लो के चारों ओर प्रदान करने वाली पॉलिश है: एक आधार मॉडल लोड करें, Unsloth या Axolotl द्वारा उत्पादित LoRA अडैप्टर लोड करें, फाइन-ट्यून की गई मॉडल के साथ चैट करें, पुनरावृत्ति करें। 2026 रिलीज ने हल्के फाइन-ट्यून सुविधा रैपर जोड़े जो हुड के अंदर Unsloth को कॉल करते हैं।
जहां यह कम पड़ता है: training पक्ष पतला है। LM Studio एक चैट और अनुमान फ्रंटएंड है; लूप के अनुमान आधे के लिए इसे उपयोग करें, training आधे के लिए नहीं।
मूल्य: मुफ़्त।
प्लेटफॉर्म: Windows, macOS, Linux।
डाउनलोड करें: lmstudio.ai
निष्कर्ष: LM Studio को फाइन-ट्यून लूप के अनुमान पक्ष के रूप में चुनें, training पक्ष नहीं।
सही एक कैसे चुनें
- कभी मॉडल को फाइन-ट्यून नहीं किया, एकल NVIDIA GPU है: Unsloth। पहले QLoRA नोटबुक का पालन करें।
- Apple Silicon Mac पर: MLX-LM। कोई भी और हार्डवेयर का इतना अच्छा उपयोग नहीं करता।
- वेब UI चाहते हैं और कोई टर्मिनल नहीं: LLaMA-Factory।
- एक टीम के लिए पुनरुत्पादनीय पाइपलाइन बना रहे हैं: Git में YAML कॉन्फ़िग के साथ Axolotl।
- XDA “failures को प्रशिक्षित करें” वर्कफ़्लो कर रहे हैं: प्रारंभिक SFT के लिए Unsloth, फिर लेबल की गई failures पर DPO के लिए TRL।
- सादे PyTorch में प्रशिक्षण लूप देखना चाहते हैं: Torchtune।
जो भी training टूल आप चुनते हैं उसे LM Studio के साथ जोड़ी जाने वाली अडैप्टर को स्थानीय रूप से परीक्षण करने के लिए अनुमान स्टैक में भेजने से पहले।
FAQ
7B मॉडल को फाइन-ट्यून करने के लिए न्यूनतम GPU क्या है?
2048 कॉन्टेक्स्ट पर QLoRA सबसे छोटे 7B वेरिएंट के लिए 8 GB VRAM में फिट करता है और 12 GB आरामदायक है। 8 GB छोटे कॉन्टेक्स्ट और कम रैंक के लिए काम करता है; 24 GB 13B QLoRA खोलता है।
क्या हम बिना किसी GPU के फाइन-ट्यून कर सकते हैं?
तकनीकी रूप से हां, CPU पर, लेकिन यह अव्यवहारिक होने की हद तक धीमा है। कुछ घंटों के लिए क्लाउड किराया अक्सर CPU फाइन-ट्यून को समाप्त करने के लिए बिजली से सस्ता होता है।
ये टूल्स किस डेटा प्रारूप को स्वीकार करते हैं?
instruction और output फील्ड (Alpaca-style) वाली JSON Lines सार्वभौमिक मानक है। अधिकांश टूल्स ShareGPT प्रारूप और OpenAI के चैट संदेश प्रारूप भी स्वीकार करते हैं।
क्या फाइन-ट्यून की गई मॉडल Ollama, LM Studio या llama.cpp में चलती हैं?
हां, GGUF (llama.cpp और Ollama के लिए) या MLX (Apple के स्टैक के लिए) निर्यात के बाद। ऊपर दिए गए प्रत्येक टूल कम से कम एक प्रारूप को निर्यात करता है।
क्या बंद मॉडल वजन के लिए फाइन-ट्यूनिंग कानूनी है?
केवल उन मॉडल के लिए जिनका लाइसेंस इसकी अनुमति देता है। Llama 3 और 4, Mistral मॉडल, Qwen, Gemma, और इस सूची में हर open-weight मॉडल अपने लाइसेंस के तहत फाइन-ट्यूनिंग की अनुमति देते हैं। बंद मॉडल (GPT-4 क्लास) में डाउनलोड करने योग्य वजन नहीं हैं, इसलिए स्थानीय फाइन-ट्यून संभव नहीं है।