स्थानीय मॉडल को अपनी स्वयं की विफलताओं पर प्रशिक्षित करना बिल्कुल पूर्व-प्रशिक्षण नहीं है, लेकिन सही तरीके से किया जाए तो यह एक छोटे मॉडल को कल आपको परेशान करने वाली त्रुटि को दोहराना बंद करना सिखाता है। यह “आत्म-सुधार” लूप के पीछे का वादा है जिस पर स्थानीय LLM समुदाय पूरे साल काम कर रहा है: मॉडल के गलत उत्तरों को लॉग करें, उन्हें एक छोटे प्रतिक्रिया डेटासेट में क्यूरेट करें, एक हल्के LoRA फाइन-ट्यून को चलाएं, और देखें कि त्रुटि दर कैसे गिरती है। ये डेस्कटॉप पर विफलताओं से स्थानीय LLM आत्म-सुधार के सर्वश्रेष्ठ ऐप्स हैं, चाहे आप लैपटॉप पर 7B मॉडल चला रहे हों या वर्कस्टेशन पर 70B।
आत्म-सुधार स्टैक में क्या देखें
- निर्मित प्रतिक्रिया कैप्चर। एक टूल जो प्रॉम्प्ट, प्रतिक्रिया और अंगूठे ऊपर/नीचे सिग्नल (या बेहतर, एक सही किया गया उत्तर) को लॉग करता है, यह है जहां लूप शुरू होता है।
- डेटासेट क्यूरेशन। विफलता लॉग को उपयोग से पहले एक स्वच्छ निर्देश-ट्यूनिंग डेटासेट बनना चाहिए।
- कुशल फाइन-ट्यूनिंग। LoRA और QLoRA एक 24 GB फाइन-ट्यून को कुछ ऐसा कम कर देते हैं जो एक एकल उपभोक्ता GPU रात भर चला सकता है।
- मूल्यांकन के लिए स्थानीय अनुमान। वही टूल जो आपके एजेंट को मॉडल परोसता है, को ट्यून किए गए संस्करण को परोसना चाहिए ताकि आप दोनों की तुलना कर सकें।
- प्रोग्रामेटिक प्रॉम्प्ट ऑप्टिमाइजेशन। बहुत सारी विफलता के तरीकों के लिए, समाधान फाइन-ट्यूनिंग नहीं है बल्कि एक बेहतर प्रॉम्प्ट है। ऑप्टिमाइजेशन फ्रेमवर्क इसे यांत्रिक बनाते हैं।
त्वरित तुलना
| ऐप्लिकेशन | इसके लिए सर्वश्रेष्ठ | प्लेटफॉर्म | मुफ्त योजना | शुरुआती मूल्य/माह | रेटिंग |
|---|---|---|---|---|---|
| LangChain | फीडबैक कैप्चर को फाइन-ट्यून वर्कफ़्लो में जंजीरबद्ध करना | Windows, macOS, Linux | पूर्ण | मुफ्त (ओपन सोर्स) | 4.5 |
| LM Studio | दैनिक अनुमान प्लस डेटासेट निर्यात | Windows, macOS, Linux | पूर्ण | मुफ्त | 4.6 |
| Ollama | किसी भी क्लाइंट को ठीक किए गए मॉडल परोसना | Windows, macOS, Linux | पूर्ण | मुफ्त (ओपन सोर्स) | 4.7 |
| Axolotl | पुनरुत्पादक YAML-संचालित LoRA चलाता है | Linux (WSL के माध्यम से Windows, कंटेनर के माध्यम से macOS) | पूर्ण | मुफ्त (ओपन सोर्स) | 4.6 |
| Unsloth | एकल GPU पर 2-5x तेजी से LoRA | Windows, Linux | पूर्ण | निःशुल्क स्तर, Pro उपलब्ध | 4.8 |
| Text Generation WebUI | अनुमान, मूल्यांकन और मैनुअल लेबलिंग के लिए स्थानीय UI | Windows, macOS, Linux | पूर्ण | मुफ्त (ओपन सोर्स) | 4.4 |
| DSPy | लेबल की गई विफलताओं से प्रॉम्प्ट और पाइपलाइनों को अनुकूलित करना | Windows, macOS, Linux | पूर्ण | मुफ्त (ओपन सोर्स) | 4.7 |
ऐप्स
1. LangChain – प्रतिक्रिया लूप को जंजीर करने के लिए सर्वश्रेष्ठ
LangChain एक फाइन-ट्यूनर नहीं है। यह अच्छी तरह से क्या करता है, यह आपको एक एजेंट से प्रत्येक प्रॉम्प्ट-प्रतिक्रिया जोड़ी को कैप्चर करने, विफलताओं को टैग करने और उन्हें एक प्रशिक्षण डेटासेट में रूट करने के लिए निर्माण खंड देता है। Callbacks और Tracing परतें ठीक वही हैं जो एक आत्म-सुधार लूप को चाहिए: मॉडल क्या कहा, उपयोगकर्ता ने उत्तर के साथ क्या किया, और इसे कैसे ठीक किया गया इसका एक स्थायी रिकॉर्ड।
जहां यह विफल होता है: API सतह बड़ी है और अक्सर बदलती है। इंटरनेट पर पुराने कोड नमूने अक्सर गलत होते हैं।
कीमत:
- मुफ्त: फ्रेमवर्क।
- भुगतान: LangSmith एक भुगतान की गई प्रबंधित ट्रेसर है यदि आप एक होस्ट किया गया डैशबोर्ड चाहते हैं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड: langchain.com — स्रोत (GitHub)
निचली पंक्ति: मॉडल, ऐप और प्रशिक्षण डेटा के बीच प्लंबिंग के लिए यहाँ शुरू करें।
2. LM Studio – दैनिक अनुमान और डेटासेट निर्यात के लिए सर्वश्रेष्ठ
LM Studio डेस्कटॉप पर सबसे आसान स्थानीय अनुमान UI है। इसे एक Hugging Face मॉडल पर इंगित करें, एक चैट विंडो और एक स्थानीय OpenAI-संगत सर्वर प्राप्त करें, और सत्र एकत्र करना शुरू करें। हाल के रिलीज में एक सत्र निर्यात सुविधा जोड़ी गई जो बातचीत को JSONL के रूप में डंप करती है, जो एक प्रतिक्रिया डेटासेट के लिए कच्चा माल है।
जहां यह विफल होता है: निर्मित फाइन-ट्यूनिंग नहीं। LM Studio अनुमान-प्रथम है; प्रशिक्षण अन्यत्र होता है।
कीमत:
- मुफ्त: सब कुछ।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड: lmstudio.ai
निचली पंक्ति: एक ट्यूनिंग रन के रास्ते में मॉडल आउटपुट को कैप्चर और निरीक्षण करने के लिए डिफ़ॉल्ट।
3. Ollama – बाद में ठीक किए गए मॉडल को परोसने के लिए सर्वश्रेष्ठ
Ollama उबाऊ, विश्वसनीय मॉडल सर्वर है। एक बार जब आप LoRA को ठीक कर देते हैं, तो इसे एक Ollama मॉडल फ़ाइल के रूप में लपेटें और हर क्लाइंट जो स्थानीय OpenAI एंडपॉइंट से बात करता है, तुरंत आपका सुधारा हुआ संस्करण प्राप्त करता है। हाल के रिलीज में प्रथम-श्रेणी LoRA लोडिंग जोड़ी गई, इसलिए आप बेस वेट को फिर से डाउनलोड किए बिना एडाप्टर को स्वैप कर सकते हैं।
जहां यह विफल होता है: कोई UI नहीं। यह एक डेमन है जो अन्य उपकरणों को शीर्ष पर होने की अपेक्षा करता है।
कीमत:
- मुफ्त: सब कुछ।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड: ollama.com — स्रोत (GitHub)
निचली पंक्ति: आपकी मशीन पर ट्यून किए गए मॉडल को होस्ट करने के लिए सही चुनाव।
4. Axolotl – पुनरुत्पादक LoRA चलाता है के लिए सर्वश्रेष्ठ
Axolotl Hugging Face की प्रशिक्षण स्टैक के चारों ओर एक YAML-संचालित रैपर है। एक डेटासेट पर इंगित करें, एक बेस मॉडल चुनें, अपना LoRA रैंक और सीखने की दर सेट करें, और चलें। हर रन कॉन्फ़िगरेशन फ़ाइल से पुनरुत्पादक है, जो तब मायने रखता है जब आत्म-सुधार का पूरा बिंदु पुनरावृत्तियों में सुधार को मापना है।
जहां यह विफल होता है: Linux-मूल। WSL के माध्यम से Windows पर और कंटेनर के माध्यम से macOS पर चलता है, लेकिन कठोर किनारों के साथ।
कीमत:
- मुफ्त: सब कुछ।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: मुख्य रूप से Linux; Windows के लिए WSL।
डाउनलोड: github.com/axolotl-ai-cloud/axolotl
निचली पंक्ति: सही चुनाव यदि आप चाहते हैं कि प्रयोग एक महीने बाद पुनरुत्पादक हों।
5. Unsloth – तेजी से एकल-GPU LoRA के लिए सर्वश्रेष्ठ
Unsloth एक फाइन-ट्यूनिंग लाइब्रेरी है जो स्टॉक Hugging Face Trainer की तुलना में एक एकल उपभोक्ता GPU पर 2-5x गति निचोड़ता है। VRAM का उपयोग लगभग आधा है। 4090 पर इसका मतलब है कि 7B LoRA चलाना एक घंटे में चार की जगह; 3060 पर इसका मतलब है कि रन बिल्कुल समाप्त हो जाता है।
जहां यह विफल होता है: कुछ आर्किटेक्चर बेस ट्रांसफॉर्मर रिलीज के पीछे हैं। नवीनतम मॉडल के लिए समर्थन एक या दो संस्करण बाद में आता है।
कीमत:
- मुफ्त: एकल GPU पर सब कुछ।
- भुगतान: बहु-GPU और एंटरप्राइज समर्थन के लिए Unsloth Pro।
प्लेटफॉर्म: Windows, Linux.
डाउनलोड: unsloth.ai — स्रोत (GitHub)
निचली पंक्ति: सही चुनाव जब एकल डेस्कटॉप GPU वह सब है जो आपके पास है।
6. Text Generation WebUI – मैनुअल लेबलिंग और मूल्यांकन के लिए सर्वश्रेष्ठ
Text Generation WebUI (Oobabooga) स्थानीय अनुमान के लिए कार्य-घोड़ा UI है, और यह एक लेबलिंग और मूल्यांकन वातावरण के रूप में भी दोगुना है। आधार और ट्यून किए गए मॉडल को बगल में लोड करें, दोनों के विरुद्ध समान प्रॉम्प्ट चलाएं, और चिह्नित करें कि कौन सा उत्तर बेहतर है। हर रेटिंग अगले दौर के लिए समान बातचीत लॉग में जाता है।
जहां यह विफल होता है: डिफ़ॉल्ट UI पुरानी है। WSL के बिना Windows पर सेटअप मुश्किल हो सकता है।
कीमत:
- मुफ्त: सब कुछ।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड: github.com/oobabooga/text-generation-webui
निचली पंक्ति: लोगों के लिए मूल्यांकन हार्नेस जो UI पसंद करते हैं।
7. DSPy – जब विफलता वजन नहीं, प्रॉम्प्ट है तो सर्वश्रेष्ठ
DSPy प्रॉम्प्ट को पैरामीटर के रूप में मानता है। इसे विफलताओं का एक छोटा लेबल किया गया डेटासेट दें, एक मीट्रिक परिभाषित करें, और यह प्रॉम्प्ट (और कुछ उदाहरणों) को फिट करने के लिए अनुकूलित करता है। विफलता के कई तरीकों के लिए यह फाइन-ट्यूनिंग की तुलना में तेजी से और सस्ता है। अनुकूलित प्रॉम्प्ट तब आपके उत्पादन एजेंट को वापस फीड कर सकता है।
जहां यह विफल होता है: सीखने की अवस्था। अमूर्तन (Signatures, Modules, Optimizers) शक्तिशाली हैं, लेकिन पहली बार पढ़ने पर स्पष्ट नहीं हैं।
कीमत:
- मुफ्त: सब कुछ।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड: dspy.ai — स्रोत (GitHub)
निचली पंक्ति: फाइन-ट्यूनिंग से पहले DSPy आजमाएं। सस्ते प्रॉम्प्ट सस्ती विफलताओं को ठीक करते हैं।
सही वाला कैसे चुनें
यदि आप अभी शुरू कर रहे हैं और एक एकल स्टैक चाहते हैं, तो अनुमान के लिए LM Studio प्लस कैप्चर के लिए LangChain प्लस LoRA ट्यूनिंग रन के लिए Unsloth एक कार्यशील लूप का सबसे सस्ता रास्ता है।
यदि आपकी विफलताएं मुख्यतः तर्क अंतराल हैं (मॉडल घूमा गया, एक कदम छोड़ा गया), DSPy के साथ शुरू करें। प्रॉम्प्ट अनुकूलन अक्सर GPU घंटों की बजाय सेंट के लिए अंतर को बंद कर देता है।
यदि आपकी विफलताएं डोमेन-विशिष्ट हैं (मॉडल आपके कोडबेस या उत्पाद को नहीं जानता), तो यह फाइन-ट्यूनिंग है। LM Studio और Ollama की जोड़ी के ऊपर Axolotl या Unsloth का उपयोग करें।
यदि आप दो या दो से अधिक GPU के साथ एक वर्कस्टेशन पर हैं, तो Axolotl Unsloth की मुफ्त परत से आगे जाता है।
अपने मूल्यांकन UI के रूप में Text Generation WebUI का उपयोग करें, चाहे आप किसके साथ प्रशिक्षण दें। मैनुअल A/B परीक्षण यह जानने का सबसे तेजी से तरीका है कि एक ट्यून वास्तव में चीजों में सुधार करता है।
FAQ
क्या मैं अपने डेटा पर प्रशिक्षण के बिना स्थानीय LLM को आत्म-सुधार कर सकता हूं? केवल एक बिंदु तक। DSPy के साथ प्रॉम्प्ट अनुकूलन आपको अधिकांश लोगों की अपेक्षा से आगे ले जाता है, लेकिन डोमेन-विशिष्ट विफलताओं को डोमेन-विशिष्ट डेटा की आवश्यकता होती है।
एक उपयोगी LoRA फाइन-ट्यून के लिए मुझे कितना डेटा चाहिए? एक लक्षित सुधार के लिए, कुछ सौ लेबल की गई विफलता उदाहरण पर्याप्त हैं। एक सामान्य मॉडल का निर्देश-ट्यूनिंग दसियों हजार की जरूरत है।
3060 या 4060 पर क्या तेजी है: Unsloth या Axolotl? Unsloth, एकल GPU पर एक बड़े मार्जिन से। Axolotl एक बार बेहतर है जब आपके पास कई GPU हों या पुनरुत्पादक YAML कॉन्फ़िग चाहते हों।
क्या मैं LoRA-ट्यून करते समय बेस मॉडल की क्षमताओं को खो देता हूं? आमतौर पर नहीं। LoRA बेस वेट को फ्रीज करता है और एक छोटा एडाप्टर जोड़ता है। आप एडाप्टर को अनलोड कर सकते हैं और बेस मॉडल वापस प्राप्त कर सकते हैं।
क्या मैं Apple Silicon Mac पर यह सब चला सकता हूं? अनुमान (LM Studio, Ollama, Text Generation WebUI) हाँ। Metal पर CUDA की तुलना में प्रशिक्षण धीमा चलता है; कुछ आर्किटेक्चर को अभी भी व्यावहारिक प्रशिक्षण समय के लिए Linux GPU बॉक्स की आवश्यकता है।