Unsloth एक डेस्कटॉप GPU पर एक स्थानीय Llama मॉडल को फाइन-ट्यून कर रहा है

इस सप्ताह एक XDA लेख ने एक स्थानीय LLM को अपनी खुद की विफलताओं पर प्रशिक्षित करने का वर्णन किया। लेखक ने मॉडल के गलत आउटपुट एकत्र किए, कुछ दर्जन को मैन्युअल रूप से लेबल किया, उन्हें एक छोटे डेटासेट में पैक किया, और एक हल्का फाइन-ट्यून चलाया। परिणाम उन सटीक समस्याओं पर एक उल्लेखनीय रूप से बेहतर मॉडल था जहां आधार संस्करण गलत हो रहा था। जो पहले किराए की क्लस्टर की आवश्यकता थी वह अब 12 GB GPU वाले लैपटॉप पर चलता है। ये 2026 में डेस्कटॉप पर स्थानीय LLM फाइन-ट्यूनिंग के लिए सात सर्वश्रेष्ठ ऐप्स हैं, सभी मुफ्त और ओपन सोर्स, उस गति से रैंक किए गए हैं जिस पर पहली फाइन-ट्यून वास्तव में चलती है।

एक स्थानीय फाइन-ट्यूनिंग ऐप में क्या देखना है

त्वरित तुलना

ऐप सर्वश्रेष्ठ के लिए बैकेंड LoRA/QLoRA Apple Silicon आसानी
Unsloth सबसे तेज़ सिंगल-GPU LoRA CUDA हां बीटा सर्वोच्च
Axolotl कॉन्फ़िगर योग्य उत्पादन रन CUDA (+ROCm) हां नहीं मध्यम
LLaMA-Factory वेब-UI फाइन-ट्यूनिंग CUDA (+ROCm) हां बीटा उच्च
MLX-LM Apple Silicon फाइन-ट्यून MLX हां हां उच्च
Torchtune आधिकारिक PyTorch संदर्भ CUDA हां सीमित मध्यम
Hugging Face TRL Transformers के ऊपर RLHF/DPO/PPO CUDA (+ROCm) हां नहीं मध्यम
LM Studio अनुमान + हल्के फाइन-ट्यून वर्कफ़्लो के लिए GUI सब कुछ CUDA/Metal अडैप्टर लोडिंग हां बहुत अधिक

1. Unsloth, सबसे तेज़ सिंगल-GPU LoRA के लिए सर्वश्रेष्ठ

Unsloth वह टूल है जिसने “अपने लैपटॉप पर 7B मॉडल को फाइन-ट्यून करना” एक शोध पत्र से Colab नोटबुक और pip install में बदल दिया। 12 GB VRAM वाले एक एकल RTX 4070 पर, 2048 कॉन्टेक्स्ट पर 7B QLoRA रन कुछ सौ उदाहरणों के लिए लगभग 30 मिनट में समाप्त होता है। गणितीय ट्रिक एक मेमोरी-कुशल फॉरवर्ड-बैकवर्ड पास है; व्यावहारिक लाभ एक फाइन-ट्यून है जो आप कॉफी बनाते समय चलता है।

जहां यह कम पड़ता है: मल्टी-GPU प्रशिक्षण Axolotl या Torchtune की तुलना में दूसरी श्रेणी है। कुछ विशेष आर्किटेक्चर संदर्भ स्टैक की तुलना में बाद में आते हैं।

मूल्य: मुफ़्त।

प्लेटफॉर्म: Linux (सर्वश्रेष्ठ), Windows (WSL2 के माध्यम से), Apple Silicon (बीटा)।

डाउनलोड करें: unsloth.ai / github.com/unslothai/unsloth

निष्कर्ष: सिंगल उपभोक्ता GPU वाले किसी भी व्यक्ति के लिए डिफ़ॉल्ट पहली फाइन-ट्यून।

2. Axolotl, कॉन्फ़िगर योग्य उत्पादन रन के लिए सर्वश्रेष्ठ

Axolotl वह है जो टीमें तब उपयोग करती हैं जब Unsloth का खुशहाली मार्ग पर्याप्त नहीं होता है। कॉन्फ़िगरेशन-फ़ाइल दृष्टिकोण रन को पुनरुत्पादनीय बनाता है: एक एकल YAML फ़ाइल आधार मॉडल, डेटासेट, LoRA रैंक, सीखने की दर, मूल्यांकन कैडेंस और निर्यात लक्ष्य का वर्णन करती है। DeepSpeed और FSDP के साथ मल्टी-GPU काम करता है। समुदाय ने सामान्य कार्यों के लिए दर्जनों पूर्वनिर्धारित कॉन्फ़िग प्रकाशित किए हैं।

जहां यह कम पड़ता है: सीखने की वक्र Unsloth की तुलना में अधिक तीव्र है। पहली रन का अर्थ है YAML कॉन्फ़िग पढ़ना और समझना कि प्रत्येक फील्ड क्या करता है।

मूल्य: मुफ़्त।

प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows।

डाउनलोड करें: github.com/axolotl-ai-cloud/axolotl

निष्कर्ष: पहली Unsloth फाइन-ट्यून कार्य करने के बाद स्नातक होने के लिए टूल।

3. LLaMA-Factory, वेब-UI फाइन-ट्यूनिंग वर्कफ़्लो के लिए सर्वश्रेष्ठ

LLaMA-Factory Axolotl और Unsloth को वेब UI के पीछे लपेटता है। एक आधार मॉडल लोड करें, एक स्थानीय फ़ोल्डर से डेटासेट चुनें, LoRA रैंक के लिए स्लाइडर को समायोजित करें, और रन शुरू करें। नुकसान वक्र ब्राउज़र में प्रस्तुत होते हैं। जो व्यक्ति टर्मिनल को छूना नहीं चाहता उसके लिए, यह एक सौहार्दपूर्ण डेस्कटॉप फाइन-ट्यूनिंग ऐप के सबसे करीब है।

जहां यह कम पड़ता है: वेब UI पूर्ण IDE नहीं है। जटिल मल्टी-स्टेज पाइपलाइन अभी भी एक वास्तविक कॉन्फ़िग चाहते हैं। हर ऑप्टिमाइज़र UI में उजागर नहीं है।

मूल्य: मुफ़्त।

प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows, Docker के माध्यम से macOS।

डाउनलोड करें: github.com/hiyouga/LLaMA-Factory

निष्कर्ष: सर्वश्रेष्ठ पिक यदि टर्मिनल-प्रथम वर्कफ़्लो आपको बंद कर देता है।

4. MLX-LM, Apple Silicon फाइन-ट्यून के लिए सर्वश्रेष्ठ

MLX-LM Apple की आधिकारिक भाषा-मॉडल स्टैक है, MLX सरणी फ्रेमवर्क पर निर्मित। 64 GB एकीकृत मेमोरी वाले M2 Max या M3 Max पर, 7B LoRA फाइन-ट्यून मिड-रेंज NVIDIA GPU के साथ प्रतিस्पर्धी गति पर चलता है। 16 GB के साथ M2 Pro पर यह छोटे मॉडल के लिए काम करता है। MLX-LM Ollama और Apple की अपनी अनुमान रनटाइम के लिए सीधे MLX प्रारूप में निर्यात करता है।

जहां यह कम पड़ता है: हर आधार मॉडल MLX प्रारूप में उपलब्ध नहीं है; Hugging Face वजन से रूपांतरण चरण घर्षण जोड़ता है। इकोसिस्टम CUDA स्टैक से छोटा है।

मूल्य: मुफ़्त।

प्लेटफॉर्म: केवल Apple Silicon macOS।

डाउनलोड करें: github.com/ml-explore/mlx-lm

निष्कर्ष: Mac पर सही टूल। कोई भी अन्य Apple Silicon का इतना अच्छा उपयोग नहीं करता।

5. Torchtune, आधिकारिक PyTorch संदर्भ के लिए सर्वश्रेष्ठ

Torchtune PyTorch का अपना फाइन-ट्यूनिंग लाइब्रेरी है, Meta की टीम द्वारा चलाया जाता है। रेसिपी पठनीय Python हैं, एक कॉन्फ़िग DSL नहीं, जो उन इंजीनियरों के अनुरूप है जो प्रशिक्षण लूप देखना और संशोधित करना चाहते हैं। पूर्ण फाइन-ट्यून, LoRA और DPO के लिए समर्थन। मल्टी-GPU बॉक्स से बाहर काम करता है। दस्तावेज़ इंजीनियरिंग-ग्रेड हैं।

जहां यह कम पड़ता है: Unsloth या Axolotl की तुलना में कम “बैटरी शामिल”। संदर्भ-कार्यान्वयन मुद्रा मतलब कम शॉर्टकट।

मूल्य: मुफ़्त।

प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows, सीमित सुविधाओं के साथ macOS।

डाउनलोड करें: github.com/pytorch/torchtune

निष्कर्ष: Torchtune चुनें यदि आप पहले से PyTorch लिख रहे हैं और प्रशिक्षण लूप देखना चाहते हैं।

6. Hugging Face TRL, RLHF, DPO और पुरस्कार मॉडलिंग के लिए सर्वश्रेष्ठ

TRL (Transformer Reinforcement Learning) सादे supervised फाइन-ट्यून से परे फाइन-ट्यूनिंग कदमों के लिए टूलकिट है: DPO (सीधी वरीयता अनुकूलन), PPO (proximal नीति अनुकूलन), पुरस्कार-मॉडल प्रशिक्षण। XDA “failures को प्रशिक्षित करें” वर्कफ़्लो पर, DPO वास्तविक तकनीक है जिसने लेबल की गई विफलताओं को एक बेहतर मॉडल में बदल दिया। TRL वह है जो इसे चलाता है।

जहां यह कम पड़ता है: अधिक गणित समझने के लिए। RLHF/DPO उन तरीकों से गलत हो सकता है जिनसे SFT नहीं हो सकता; कुछ विफल रन की अपेक्षा करें।

मूल्य: मुफ़्त।

प्लेटफॉर्म: Linux, WSL2 के माध्यम से Windows।

डाउनलोड करें: github.com/huggingface/trl

निष्कर्ष: एक वास्तविक “failures से सीखें” फाइन-ट्यूनिंग पाइपलाइन के दूसरे चरण के लिए टूल।

7. LM Studio, सब-कुछ-एक डेस्कटॉप GUI के लिए सर्वश्रेष्ठ

LM Studio मुख्य रूप से एक फाइन-ट्यूनिंग ऐप नहीं है। यह Windows, macOS और Linux पर स्थानीय मॉडल डाउनलोड करने, चलाने और चैट करने के लिए एक डेस्कटॉप GUI है। इस सूची में इसकी भूमिका फाइन-ट्यून वर्कफ़्लो के चारों ओर प्रदान करने वाली पॉलिश है: एक आधार मॉडल लोड करें, Unsloth या Axolotl द्वारा उत्पादित LoRA अडैप्टर लोड करें, फाइन-ट्यून की गई मॉडल के साथ चैट करें, पुनरावृत्ति करें। 2026 रिलीज ने हल्के फाइन-ट्यून सुविधा रैपर जोड़े जो हुड के अंदर Unsloth को कॉल करते हैं।

जहां यह कम पड़ता है: training पक्ष पतला है। LM Studio एक चैट और अनुमान फ्रंटएंड है; लूप के अनुमान आधे के लिए इसे उपयोग करें, training आधे के लिए नहीं।

मूल्य: मुफ़्त।

प्लेटफॉर्म: Windows, macOS, Linux।

डाउनलोड करें: lmstudio.ai

निष्कर्ष: LM Studio को फाइन-ट्यून लूप के अनुमान पक्ष के रूप में चुनें, training पक्ष नहीं।

सही एक कैसे चुनें

जो भी training टूल आप चुनते हैं उसे LM Studio के साथ जोड़ी जाने वाली अडैप्टर को स्थानीय रूप से परीक्षण करने के लिए अनुमान स्टैक में भेजने से पहले।

FAQ

7B मॉडल को फाइन-ट्यून करने के लिए न्यूनतम GPU क्या है?

2048 कॉन्टेक्स्ट पर QLoRA सबसे छोटे 7B वेरिएंट के लिए 8 GB VRAM में फिट करता है और 12 GB आरामदायक है। 8 GB छोटे कॉन्टेक्स्ट और कम रैंक के लिए काम करता है; 24 GB 13B QLoRA खोलता है।

क्या हम बिना किसी GPU के फाइन-ट्यून कर सकते हैं?

तकनीकी रूप से हां, CPU पर, लेकिन यह अव्यवहारिक होने की हद तक धीमा है। कुछ घंटों के लिए क्लाउड किराया अक्सर CPU फाइन-ट्यून को समाप्त करने के लिए बिजली से सस्ता होता है।

ये टूल्स किस डेटा प्रारूप को स्वीकार करते हैं?

instruction और output फील्ड (Alpaca-style) वाली JSON Lines सार्वभौमिक मानक है। अधिकांश टूल्स ShareGPT प्रारूप और OpenAI के चैट संदेश प्रारूप भी स्वीकार करते हैं।

क्या फाइन-ट्यून की गई मॉडल Ollama, LM Studio या llama.cpp में चलती हैं?

हां, GGUF (llama.cpp और Ollama के लिए) या MLX (Apple के स्टैक के लिए) निर्यात के बाद। ऊपर दिए गए प्रत्येक टूल कम से कम एक प्रारूप को निर्यात करता है।

क्या बंद मॉडल वजन के लिए फाइन-ट्यूनिंग कानूनी है?

केवल उन मॉडल के लिए जिनका लाइसेंस इसकी अनुमति देता है। Llama 3 और 4, Mistral मॉडल, Qwen, Gemma, और इस सूची में हर open-weight मॉडल अपने लाइसेंस के तहत फाइन-ट्यूनिंग की अनुमति देते हैं। बंद मॉडल (GPT-4 क्लास) में डाउनलोड करने योग्य वजन नहीं हैं, इसलिए स्थानीय फाइन-ट्यून संभव नहीं है।