XDA की रिपोर्ट कि एक मध्य-सीमा GPU भुगतान AI सदस्यता के ढेर को सब्सिडी कर सकता है बिल्कुल सही है। एक RTX 4070 Ti या Radeon RX 7900 XT 13B और 34B पैरामीटर वाले मॉडल को इस गति से चलाता है जो अधिकांश क्लाउड सेवाएं एक सदस्यता स्तर के लिए चार्ज करती हैं। लेकिन यह चुनना कि आपके पास पहले से मौजूद हार्डवेयर पर कौन सा मॉडल, क्वांटाइजेशन और रनटाइम उपयोग करना है, वास्तविक संख्याओं की आवश्यकता है, अनुमान नहीं।
नीचे दिए गए सात ऐप्स बेंचमार्किंग के दो प्रकार को कवर करते हैं। पहले तीन रनटाइम-एकीकृत बेंचमार्क हैं जो वास्तविक कार्यभार के लिए प्रति सेकंड टोकन और पहले टोकन तक का समय रिपोर्ट करते हैं। बाकी तीसरे पक्ष के बेंचमार्क सूट हैं जो हार्डवेयर की तुलना के लिए पुनरुत्पादन योग्य स्कोर देते हैं। प्रत्येक विकल्प Windows और Linux पर चलता है; दो Apple Silicon के साथ macOS पर भी काम करते हैं।
GPU AI बेंचमार्क में क्या देखें
हर AI बेंचमार्क आपको वह नहीं बताता जो आपको पता होना चाहिए। ये पाँच चीजें देखें:
- विभिन्न संदर्भ लंबाई (128, 2048, 8192) पर प्रति सेकंड टोकन रिपोर्ट करता है
- प्रॉम्प्ट प्रोसेसिंग (प्रीफिल) और जनरेशन को अलग से मापता है
- आप वास्तव में जो क्वांटाइजेशन उपयोग करने की योजना बनाते हैं उसे समर्थन करता है (Q4_K_M, Q8, FP16)
- रन के दौरान VRAM और सिस्टम RAM उपयोग को पढ़ता है
- परिणामों को साझा करने योग्य प्रारूप में प्रकाशित करता है ताकि संख्याएं सेटअप के बीच तुलनीय हों
कुछ भी जो केवल एक संदर्भ में एक एकल थ्रूपुट संख्या की रिपोर्ट करता है वह वास्तविक हार्डवेयर आकार निर्धारण के लिए उपयोगी नहीं है।
त्वरित तुलना
| ऐप | सर्वश्रेष्ठ | मुफ्त योजना | शुरुआती कीमत | विशेष विशेषता |
|---|---|---|---|---|
| llama-bench | पुनरुत्पादन योग्य LLM थ्रूपुट | हाँ | मुफ्त | llama.cpp के साथ आता है |
| LM Studio | GUI बेंचमार्क + मॉडल खरीदारी | हाँ | मुफ्त | अंतर्निहित मॉडल कैटलॉग |
| Ollama benchmark | एक कमांड LLM तनाव परीक्षण | हाँ | मुफ्त | किसी भी खींचे गए मॉडल के साथ चलता है |
| UL Procyon AI | उद्योग-मानक विक्रेता बेंचमार्क | परीक्षण | भुगतान किया लाइसेंस | ONNX + DirectML पथ |
| Geekbench AI | क्रॉस-प्लेटफॉर्म AI स्कोर | हाँ | मुफ्त स्तर | iOS, Android, Windows, macOS |
| MLPerf Client | MLCommons से संदर्भ बेंचमार्क | हाँ | मुफ्त | गहरी हार्डवेयर प्रोफाइलिंग |
| koboldcpp benchmark | Roleplay/chat कार्यभार सिमुलेशन | हाँ | मुफ्त | यथार्थवादी रूप से चैट सत्र का अनुकरण करता है |
ऐप्स
1. llama-bench – सर्वश्रेष्ठ पुनरुत्पादन योग्य LLM थ्रूपुट
llama-bench llama.cpp का हिस्सा है और स्थानीय LLM दुनिया के पास मानक यार्डस्टिक का सबसे करीबी है। इसे एक GGUF फ़ाइल की ओर इशारा करें, एक संदर्भ आकार और बैच आकार बताएं, और यह प्रॉम्प्ट टोकन प्रति सेकंड, जनरेशन टोकन प्रति सेकंड और पहले टोकन तक का समय रिपोर्ट करेगा। यह किसी भी CUDA, ROCm, Metal, या CPU बैकेंड पर चलता है, इसलिए एक एकल उपकरण आपके Nvidia rig, Radeon build और MacBook में तुलनीय संख्याएं देता है।
यह कहाँ विफल होता है: केवल कमांड लाइन। कोई GUI नहीं। कुछ विकल्प (BLAS, बैच आकार) को दस्तावेज़ पढ़ने की आवश्यकता है।
कीमत:
- मुफ्त: MIT के तहत खुला स्रोत।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड करें: llama.cpp on GitHub
निचली पंक्ति: क्वांटाइजेशन या मॉडल की तुलना करते समय डिफ़ॉल्ट बेंचमार्क। एक बार इसके झंडे सीखें।
2. LM Studio – GUI बेंचमार्क के साथ सर्वश्रेष्ठ मॉडल खरीदारी
LM Studio एक डेस्कटॉप ऐप है जो llama.cpp को मॉडल डाउनलोड, चलाने और अब बेंचमार्किंग के लिए ग्राफिकल इंटरफेस के साथ लपेटता है। अंतर्निहित बेंचमार्क टैब किसी भी डाउनलोड किए गए मॉडल को पूर्वनिर्धारित कार्यभार में परीक्षण करता है और मेट्रिक्स को इस तरह से रिपोर्ट करता है जो गैर-विशेषज्ञ पढ़ सकें। यह बचे हुए VRAM हेडरूम को भी दिखाता है, जो अगले मॉडल को आकार देने में मदद करता है।
यह कहाँ विफल होता है: बंद स्रोत। मॉडल कैटलॉग HuggingFace के साथ ओवरलैप करता है और व्यापक नहीं है।
कीमत:
- मुफ्त: पूर्ण ऐप।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS (Apple Silicon), Linux.
डाउनलोड करें: LM Studio
निचली पंक्ति: टर्मिनल को छुए बिना एक ताजा मॉडल को बेंचमार्क करने का सबसे अनुकूल तरीका।
3. Ollama benchmark – सर्वश्रेष्ठ एक-कमांड LLM तनाव परीक्षण
Ollama एक run --verbose ध्वज के साथ आता है जो प्रति-टोकन समय का उत्पादन करता है। समुदाय-रक्षित स्क्रिप्ट के साथ संयुक्त, यह बेंचमार्क उपकरण के रूप में दोहरी भूमिका निभाता है। क्योंकि Ollama नाम से मॉडल खींचता है, एक दूसरी मशीन पर एक ही बेंचमार्क चलाने में दो कमांड लगते हैं।
यह कहाँ विफल होता है: पूर्ण बेंचमार्क सूट नहीं। समापन गति पर केंद्रित; प्रॉम्प्ट-भारी कार्यभार के लिए कम उपयोगी।
कीमत:
- मुफ्त: MIT के तहत खुला स्रोत।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड करें: Ollama
निचली पंक्ति: दैनिक मॉडल उपयोग के लिए Ollama स्थापित करें; जब आप तेजी से थ्रूपुट पढ़ना चाहते हैं तो --verbose का उपयोग करें।
4. UL Procyon AI – सर्वश्रेष्ठ उद्योग-मानक विक्रेता बेंचमार्क
UL Procyon AI Computer Vision Benchmark वह ही UL है जो 3DMark और PCMark प्रकाशित करता है। यह मानक ONNX मॉडल (MobileNet, ResNet, Inception) को TensorRT, DirectML, OpenVINO, और CoreML बैकेंड में चलाता है और एक स्कोर देता है। विक्रेता समीक्षाओं में Procyon संख्याओं का हवाला देते हैं, इसलिए स्कोर सीधे उद्योग भर में तुलनीय है।
यह कहाँ विफल होता है: दृष्टि कार्यभार पर केंद्रित; LLM थ्रूपुट के लिए कम उपयोगी। वाणिज्यिक उपयोग के लिए भुगतान किया लाइसेंस।
कीमत:
- मुफ्त: परीक्षण स्कोर आधार संख्याओं को प्रकट करता है।
- भुगतान: लाइसेंस पूर्ण रन को अनलॉक करता है।
प्लेटफॉर्म: Windows.
डाउनलोड करें: UL Procyon AI
निचली पंक्ति: यदि आप विक्रेता बेंचमार्क का उपयोग करके खरीद निर्णय लेते हैं तो यह खरीदें। यदि आप केवल LLM गति की परवाह करते हैं तो छोड़ दें।
5. Geekbench AI – सर्वश्रेष्ठ क्रॉस-प्लेटफॉर्म AI स्कोर
Geekbench AI प्रति रन तीन संख्याएं उत्पन्न करता है: FP32, FP16, और क्वांटाइज्ड INT8। यह Windows, macOS, Linux, iOS, और Android पर चलता है, इसलिए एक ही कार्यभार के लिए लैपटॉप-बनाम-फोन तुलना एक बेंचमार्क दूर है। सार्वजनिक परिणाम डेटाबेस आपको अपने रन की तुलना हजारों अन्य लोगों से करने देता है।
यह कहाँ विफल होता है: LLM-विशिष्ट नहीं। तीन स्कोर बहुत सूक्ष्मता को ढह देते हैं।
कीमत:
- मुफ्त: पूर्वावलोकन रन।
- भुगतान: पूर्ण लाइसेंस बैच रन और इतिहास निर्यात को अनलॉक करता है।
प्लेटफॉर्म: Windows, macOS, Linux, iOS, Android.
डाउनलोड करें: Geekbench AI
निचली पंक्ति: “मेरा AI-सक्षम हार्डवेयर कैसे ढेर करता है” के लिए जाने वाली संख्या।
6. MLPerf Client – सर्वश्रेष्ठ MLCommons संदर्भ बेंचमार्क
MLPerf Client क्लाइंट हार्डवेयर पर AI के लिए MLCommons-समर्थित संदर्भ बेंचमार्क है। यह एक पूर्वनिर्धारित LLM कार्यभार (वर्तमान में Llama 2 7B, नए मॉडल में जा रहा है) चलाता है और संदर्भ कार्यान्वयन के विरुद्ध विलंबता, थ्रूपुट और गुणवत्ता प्रतिगमन की रिपोर्ट करता है। क्योंकि MLCommons परिणाम पारदर्शी रूप से प्रकाशित करता है, सेटअप की तुलना सीधी है।
यह कहाँ विफल होता है: विकल्प विकल्पों की तुलना में अधिक शामिल है। अंतिम उपयोगकर्ताओं के लिए नहीं बनाया गया।
कीमत:
- मुफ्त: खुला स्रोत।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, Linux (native), macOS (समुदाय builds).
डाउनलोड करें: MLPerf Client on GitHub
निचली पंक्ति: अधिकारपूर्ण बेंचमार्क। यदि आप हार्डवेयर तुलना प्रकाशित करने की योजना बनाते हैं तो सेटअप लागत इसके लायक है।
7. koboldcpp benchmark – सर्वश्रेष्ठ roleplay और chat कार्यभार सिमुलेशन
koboldcpp एक llama.cpp fork है जो roleplay और लंबे संदर्भ chat पर केंद्रित है। इसका बेंचमार्क मोड एक रोलिंग संदर्भ के साथ एक वास्तविक चैट सत्र का अनुकरण करता है, जो इस बात की अधिक ईमानदार परीक्षा है कि एक घर LLM सर्वर दिन-प्रतिदिन कैसा महसूस करेगा। संख्याओं में संदर्भ-स्वैप लागत और सिस्टम RAM ओवरफ़्लो व्यवहार शामिल है, जो llama-bench छोड़ देता है।
यह कहाँ विफल होता है: chat/RP कार्यभार पर केंद्रित; कोड-केंद्रित मेट्रिक्स को मिस करता है। पहली नजर में इंटरफेस व्यस्त लगता है।
कीमत:
- मुफ्त: खुला स्रोत।
- भुगतान: कोई नहीं।
प्लेटफॉर्म: Windows, macOS, Linux.
डाउनलोड करें: koboldcpp on GitHub
निचली पंक्ति: किसी भी व्यक्ति के लिए सबसे प्रतिनिधि बेंचमार्क जिसका वास्तविक उपयोग मामला कोड पूरा करने के बजाय chat है।
सही कैसे चुनें
क्वांटाइजेशन में पुनरुत्पादन योग्य संख्याओं के लिए llama-bench के साथ शुरू करें। यदि आप GUI पसंद करते हैं तो LM Studio के अंतर्निहित बेंचमार्क टैब जोड़ें। उन मशीनों पर तेजी से स्वच्छता जांच के लिए Ollama की verbose ध्वज का उपयोग करें जहां आप पहले से ही मॉडल चलाते हैं। जब आपको एक एकल पोर्टेबल स्कोर की आवश्यकता हो तो Geekbench AI जोड़ें। औपचारिक हार्डवेयर तुलना के लिए UL Procyon या MLPerf Client को सहेजें जहां तीसरे पक्ष की वैधता महत्वपूर्ण है। जब आपका दिन-प्रतिदिन का कार्यभार कोड पूरा करने के बजाय chat हो तो koboldcpp benchmark का उपयोग करें।
विक्रेता “AI TOPS” स्पेक शीट को प्रतिस्थापन के रूप में छोड़ दें; संख्याएं शिखर-सैद्धांतिक हैं और क्वांटाइजेशन पर वास्तविक अनुमान थ्रूपुट को दर्शाती हैं।
प्रश्नोत्तरी
कौन सा GPU आज सर्वश्रेष्ठ स्थानीय LLM गति देता है? उपभोक्ता कार्ड के लिए, Nvidia पर RTX 4090, 4080 Super, और 5080 नेतृत्व करते हैं; RX 7900 XTX AMD पर नेतृत्व करता है। Apple M3 Max और M4 Max उन मॉडल के लिए अंतराल को बंद करते हैं जो एकीकृत मेमोरी में फिट होते हैं।
मुझे वास्तव में कितने टोकन प्रति सेकंड की आवश्यकता है? वास्तविक समय chat मॉडल के आउटपुट पर 20 t/s से ऊपर अच्छा लगता है। 40 t/s से ऊपर कुछ भी एक तेज SaaS API से अलग नहीं है।
क्या अधिक VRAM मदद करता है या क्या कंप्यूट जीतता है? LLMs के लिए, VRAM कठिन बाधा है। पूर्ण मॉडल को VRAM में फिट करना एक सीमा के ऊपर सिस्टम RAM में बिखरने के बिना शुद्ध कंप्यूट से अधिक मायने रखता है।
क्या Windows पर एक बेंचमार्क Linux पर एक के साथ तुलनीय है? CUDA-आधारित परीक्षणों के लिए, अधिकतर हाँ। ड्राइवर अंतर कुछ प्रतिशत भिन्नता जोड़ते हैं। DirectML बनाम ROCm के लिए अंतर बहुत बड़ा है और Linux संख्याएं आमतौर पर अधिक हैं।
सबसे सस्ता बेंचमार्क विकल्प क्या है? llama-bench और Ollama दोनों कुछ भी खर्च नहीं करते। दोनों किसी भी उपभोक्ता GPU पर चलते हैं।
क्या यह मुझे LM Studio और Ollama के बीच चुनने में मदद करता है? हाँ। दोनों में एक ही मॉडल को बेंचमार्क करें और प्रति सेकंड टोकन और प्रॉम्प्ट-प्रोसेसिंग गति की तुलना करें। Ollama मॉडल स्वैप गति पर जीतता है; LM Studio का GUI प्रयोगों में मदद करता है।