Anubis आत्म-होस्टेड AI स्क्रेपर फायरवॉल

Meta के वेब बॉट्स ने इस साल एक ही त्रैमासिक में नौ बिलियन अनुरोध भेजे, और आउटबाउंड ट्रैफिक लगभग कभी भी उन साइटों पर वापस नहीं आया जिन्हें क्रॉलर ने स्क्रैप किया था। Cloudflare अब डिफ़ॉल्ट रूप से किसी भी पृष्ठ पर प्रशिक्षण बॉट्स और एजेंटों को ब्लॉक कर रहा है जो विज्ञापन प्रदर्शित करता है। “खोज यात्रा” और “प्रशिक्षण कॉर्पस” के बीच की लाइन आगे बढ़ गई है, और यदि आप एक साइट चलाते हैं, तो आप शायद इसके “अवरोधन” पक्ष पर रहना चाहते हैं।

2026 में डेस्कटॉप पर AI वेब स्क्रेपर्स को ब्लॉक करने के लिए सर्वश्रेष्ठ ऐप्स तीन श्रेणियों में विभाजित हैं: किनारे सेवाएं जो आपके origin तक पहुंचने से पहले नेटवर्क किनारे पर ब्लॉक करती हैं, स्व-होस्टेड प्रूफ-ऑफ-वर्क फायरवॉल जो आपके ऐप्स के साथ चलते हैं, और मूल पक्ष के नियम जो अनुरोधों को आने के बाद फ़िल्टर करते हैं। हमने सात को चुना जो एक साथ काम करते हैं, एक साधारण Cloudflare टॉगल से Anubis तक (पहले से ही Linux kernel source, Codeberg, और FFmpeg द्वारा तैनात)।

AI स्क्रेपर ब्लॉकिंग टूल में क्या देखें

त्वरित तुलना

टूल सर्वश्रेष्ठ फ्री प्लान सशुल्क तैनाती
Cloudflare AI Crawl Control Cloudflare के पीछे कोई भी साइट सभी स्तरों पर शामिल Cloudflare Pro/Biz के साथ बंडल वन-क्लिक टॉगल
Dark Visitors (Known Agents) दृश्यता कि कौन से AI बॉट आपको देखते हैं मुफ्त स्तर मामूली मासिक शुल्क से टीम योजना robots.txt + एजेंट ट्रैकर
Anubis स्व-होस्टेड प्रूफ-ऑफ-वर्क दीवार खुला स्रोत, मुफ्त केवल मुफ्त रिवर्स प्रॉक्सी (Go बाइनरी)
Nepenthes सक्रिय रूप से स्क्रेपर समय बर्बाद करना खुला स्रोत, मुफ्त केवल मुफ्त Tarpit कंटेनर
Fail2Ban Origin-side ban-by-log टूल खुला स्रोत, मुफ्त केवल मुफ्त सर्वर डेमॉन
ModSecurity + OWASP CRS Origin पर नियम-आधारित WAF खुला स्रोत, मुफ्त व्यावसायिक नियम सेट के साथ मुफ्त nginx/Apache मॉड्यूल
DataDome एंटरप्राइज-ग्रेड बॉट प्रबंधन केवल परीक्षण एंटरप्राइज अनुबंध Edge / API एकीकरण

उपकरण

1. Cloudflare AI Crawl Control – किसी भी साइट के लिए सर्वश्रेष्ठ एक-क्लिक ब्लॉकर

Cloudflare AI Crawl Control AI प्रशिक्षण बॉट्स को रोकने का सबसे तेज़ तरीका है। किसी भी स्तर पर कोई भी ग्राहक (मुफ्त सहित) डैशबोर्ड में Security → Bots पर जा सकता है और “AI Crawls and Scrapers” टॉगल फ्लिप कर सकता है। यह Cloudflare के बॉट फिंगरप्रिंट डेटाबेस को साथ ही साथ GPTBot, ClaudeBot, Applebot Extended, PerplexityBot और सैकड़ों अन्य की पहचान करने के लिए व्यवहारगत संकेतों का उपयोग करता है। 15 सितंबर, 2026 से शुरू करके, नई डोमेन डिफ़ॉल्ट रूप से विज्ञापन प्रदर्शित करने वाले पृष्ठों पर प्रशिक्षण बॉट्स और एजेंटों को ब्लॉक करती हैं।

क्योंकि यह नेटवर्क किनारे पर चलता है, अवरुद्ध अनुरोध कभी भी आपके origin को स्पर्श नहीं करते। यह बैंडविड्थ और origin CPU को बचाता है, और यह महत्वपूर्ण नहीं है कि आपकी साइट किस स्टैक पर है। आप विशिष्ट बॉट्स को भी अनुमति दे सकते हैं (Googlebot डिफ़ॉल्ट रूप से हरा रहता है), Cloudflare की पे-पर-क्रॉल प्रोग्राम के माध्यम से एक्सेस के लिए चार्ज करें, या बेहतर नियंत्रण के लिए कस्टम नियम लिखें।

कहां यह कम हो जाता है: केवल उपयोगी यदि आपकी साइट Cloudflare के पीछे है। Cloudflare का वर्गीकरण कभी-कभी वैध अनुसंधान या आर्काइव क्रॉलर को गलत तरीके से लेबल करता है, इसलिए कुछ महत्वपूर्ण के लिए इसे ऑटोपाइलट पर छोड़ने से पहले विश्लेषण की जांच करें।

मूल्य निर्धारण:

प्लेटफार्म: Cloudflare के सामने कोई भी साइट (Windows, macOS, Linux origins सभी काम करते हैं)

निष्कर्ष: यदि आप Cloudflare पर हैं, तो सूची के बाकी हिस्से को पढ़ने से पहले इसे चालू करें।

2. Dark Visitors (Known Agents) – जानने के लिए सर्वश्रेष्ठ कि कौन से बॉट्स वास्तव में आपको देखते हैं

Dark Visitors (2026 में Known Agents का नाम बदला गया) अधिकांश साइटों में दृश्यता की परत है। यह AI एजेंटों का एक क्यूरेटेड डेटाबेस बनाए रखता है (प्रशिक्षण बॉट, RAG स्क्रेपर, ब्राउज़िंग एजेंट, LLM कोपायलॉट) और आपको एक लाइव-अपडेटिंग robots.txt फ़ाइल और एक विश्लेषण डैशबोर्ड दोनों प्रदान करता है जो दिखाता है कि कौन वास्तव में दस्तक दे रहे हैं। एक स्निपेट जोड़ें और आपको GPTBot, ClaudeBot, PerplexityBot और दर्जन अधिक नए एजेंटों पर वास्तविक संख्या मिलते हैं जिन्हें आपने शायद नहीं सुना है।

मुफ्त स्तर आवश्यक: एजेंट सूची, robots.txt फ़ाइल, बुनियादी यात्रा ट्रैकिंग को कवर करता है। सशुल्क स्तर पूर्ण विश्लेषण, कई साइटें और API एक्सेस को अनलॉक करते हैं। यह Cloudflare के साथ अच्छी तरह से जोड़ी जाती है: Cloudflare बताता है कि किनारे पर क्या अवरुद्ध था, Known Agents बताता है कि क्या कोशिश की गई (और Cloudflare अभी तक पहचान नहीं पाया है कि क्या) अभी भी पारित हुआ।

कहां यह कम हो जाता है: robots.txt एक अनुरोध है, एक नियम नहीं। अच्छी तरह से व्यवहार करने वाले क्रॉलर इसे सम्मान करते हैं; बुरे अभिनेता इसे अनदेखा करते हैं। यह उपकरण आपको बताता है कि कौन नियमों को अनदेखा कर रहा है, लेकिन यह अपने आप पर अनुपालन को लागू नहीं करता है।

मूल्य निर्धारण:

प्लेटफार्म: कोई भी साइट (स्निपेट-आधारित)

निष्कर्ष: यदि आपके पास पहले से Cloudflare है, तब भी इसे इंस्टॉल करें, क्योंकि यह बताता है कि कौन से बॉट्स बढ़ती समस्या बन रहे हैं।

3. Anubis – AI स्क्रेपर्स के विरुद्ध सर्वश्रेष्ठ स्व-होस्टेड दीवार

Anubis TecharoHQ द्वारा Go में लिखा गया एक स्व-होस्टेड Web AI Firewall है। यह आपके ऐप्स के सामने एक रिवर्स प्रॉक्सी के रूप में बैठता है और अनुरोध को परोसने से पहले एक जावास्क्रिप्ट प्रूफ-ऑफ-वर्क चुनौती जारी करता है। वास्तविक ब्राउज़र एक सेकंड के एक अंश में चुनौती को अदृश्य रूप से हल करते हैं; भोली स्क्रेपर्स ठीक हो जाते हैं क्योंकि वे JS नहीं चलाते या अपने पैमाने पर CPU चक्र को जलाना नहीं चाहते।

अपनाने से कहानी मिलती है: Codeberg, FFmpeg, Linux kernel source, और अधिकांश non-Cloudflare FOSS प्रोजेक्ट इसे चलाते हैं। कॉन्फ़िगरेशन एक एकल YAML फ़ाइल है; आप Anubis को अपने upstream की ओर इशारा करते हैं, प्रति-मार्ग चुनौती कठिनाई सेट करते हैं, और अच्छे बॉट्स (Googlebot, IA_Archiver, आदि) के लिए allowlists जोड़ते हैं।

कहां यह कम हो जाता है: JS-executing स्क्रेपर्स (headless Chromium, Playwright) भी PoW को हल कर सकते हैं; वे केवल एक मामूली CPU लागत का भुगतान करते हैं। Anubis एक मजबूत निवारण है, एक अभेद्य दीवार नहीं। यह प्रत्येक अनुरोध के लिए एक छोटी latency hop भी जोड़ता है।

मूल्य निर्धारण:

प्लेटफार्म: Linux (Docker, systemd), Windows, macOS (Go बाइनरी के माध्यम से)

निष्कर्ष: सही विकल्प जब आप अपना बुनियादी ढांचा चलाते हैं और Cloudflare के माध्यम से रूट नहीं करना चाहते।

4. Nepenthes – स्क्रेपर समय बर्बाद करने के लिए सर्वश्रेष्ठ

Nepenthes विपरीत दृष्टिकोण लेता है: स्क्रेपर्स को ब्लॉक करने के बजाय, यह उन्हें प्रक्रियात्मक रूप से उत्पन्न, प्रशंसनीय दिखने वाले पृष्ठों की एक अनंत भूलभुलैया में खींचता है जो कभी समाप्त नहीं होते। परिणाम एक tarpit है जो स्क्रेपर CPU और बैंडविड्थ खर्च करता है जबकि कोई उपयोगी प्रशिक्षण डेटा नहीं लौटाता है। विशेष रूप से AI क्रॉलर के robots.txt को अनदेखा करने के प्रतिक्रिया के रूप में बनाया गया, इसे प्रशासकों द्वारा चुना गया है जो निष्क्रिय रूप से इसे अस्वीकार करने के बजाय स्क्रैपिंग की लागत को सक्रिय रूप से बढ़ाना चाहते हैं।

इसे एक subdomain या पथ में एक Docker कंटेनर के रूप में तैनात करें, एक robots.txt निर्देश जोड़ें जो बुरे बॉट्स को इसकी ओर इशारा करता है, और देखें क्रॉलर अपने संसाधनों को बर्बाद करता है। यह प्रशिक्षण डेटा को भी थोड़ा जहर देता है: कोई भी स्क्रेपर जो Nepenthes आउटपुट को निगलता है, शोरगुल भरा प्रशंसनीय-लेकिन-नकली पाठ को किसी भी पाइपलाइन में वापस लाता है जिसे यह खिलाता है।

कहां यह कम हो जाता है: कुछ ऑपरेटरों के लिए नैतिक रूप से सीमांत; आप जानबूझकर भ्रामक डेटा परोस रहे हैं। यह केवल बॉट्स को प्रभावित करता है जो पहली जगह में robots.txt का सम्मान नहीं करते, जो बिंदु है लेकिन विचार करने योग्य भी है।

मूल्य निर्धारण:

प्लेटफार्म: Linux (Docker) मुख्य रूप से; Docker के माध्यम से macOS और Windows

निष्कर्ष: एक बार जब आपके पास पहले से ब्लॉकिंग हो और आप स्क्रैपिंग को सक्रिय रूप से महंगा बनाना चाहते हैं तो यह जोड़ें।

5. Fail2Ban – Origin-side का सर्वश्रेष्ठ ban-by-log उपकरण

Fail2Ban सर्वर लॉग को पढ़ने, पैटर्न को चिह्नित करने और फायरवॉल को IP-स्तरीय प्रतिबंध धकेलने के लिए क्लासिक उपकरण है। हर Linux व्यवस्थापक इसे जानता है। AI स्क्रैपिंग के लिए विशेष रूप से, एक Fail2Ban फ़िल्टर User-Agent regex (GPTBot, ClaudeBot, Bytespider, आदि) के लिए nginx या Apache लॉग देख सकता है, या व्यवहारिक हस्ताक्षर (एक एकल IP से प्रति सेकंड अनुरोधों का बाढ़) के लिए, और iptables में अपराधी को छोड़ सकता है।

क्योंकि प्रतिबंध kernel firewall पर होता है, origin स्क्रेपर की सेवा में बिल्कुल भी चक्र खर्च नहीं करता है। किनारे पर Cloudflare सेटअप के साथ और बीच में Anubis के साथ संयोजित करें, और आपके पास गहराई में एक बचाव है।

कहां यह कम हो जाता है: IP-आधारित प्रतिबंध घूर्णन आवासीय प्रॉक्सी के विरुद्ध भंगुर होते हैं, जो गंभीर स्क्रेपर्स उपयोग करते हैं। और फ़िल्टर को लिखा और ट्यून किया जाना चाहिए; यह एक-क्लिक स्थापना नहीं है।

मूल्य निर्धारण:

प्लेटफार्म: Linux (नेटिव); Windows और macOS समर्थन सीमित है

निष्कर्ष: सही विकल्प sysadmins के लिए जो पहले से regex फ़िल्टर लिखते हैं और पैकेट स्तर पर प्रतिबंध चाहते हैं।

6. ModSecurity + OWASP CRS – Origin पर सर्वश्रेष्ठ नियम-आधारित WAF

ModSecurity OWASP Core Rule Set के साथ खुला स्रोत WAF है कि nginx और Apache व्यवस्थापकों को origin पर तैनात करते हैं जब वे edge सेवा नहीं कर सकते या नहीं चाहते। CRS सामान्य हमलों (SQLi, XSS, RCE) के लिए नियमों के साथ आता है, और सामुदायिक-रक्षणीय AI-बॉट नियमसेट User-Agent फ़िल्टर, व्यवहारिक थ्रेसहोल्ड, और ज्ञात-बुरे IP feeds जोड़ते हैं विशेष रूप से AI स्क्रेपर्स के लिए।

क्योंकि यह नियम-आधारित है, आप पूर्ण नियंत्रण रखते हैं। आप एक आंतरिक विश्लेषण उपकरण को allowlist कर सकते हैं, एक विशिष्ट user-agent को विश्व स्तर पर ब्लॉक कर सकते हैं, या प्रति-पथ नियम लिख सकते हैं। यह Fail2Ban के साथ भी अच्छी तरह से खेलता है: ModSecurity एक अनुरोध को विसंगत के रूप में चिह्नित करता है, Fail2Ban ध्वज को पढ़ता है और स्रोत को प्रतिबंधित करता है।

कहां यह कम हो जाता है: नियमों को रखरखाव की आवश्यकता होती है। कस्टम ऐप्स पर झूठी सकारात्मक होती है। और यह nginx या Apache के लिए एक मूल मॉड्यूल है, इसलिए containerized deployments को इसके साथ Docker छवियों की आवश्यकता होती है।

मूल्य निर्धारण:

प्लेटफार्म: Linux (nginx/Apache मूल), Windows (IIS के माध्यम से सीमाओं के साथ)

निष्कर्ष: डिफ़ॉल्ट at-origin WAF जब आप Cloudflare के पीछे नहीं हैं और पूर्ण पारदर्शिता चाहते हैं।

7. DataDome – सर्वश्रेष्ठ एंटरप्राइज-ग्रेड बॉट प्रबंधन

DataDome है जहां आप पहुंचते हैं जब एक व्यक्तिगत ब्लॉग एक वास्तविक व्यवसाय में बढ़ता है। अमेरिका और यूरोप भर में लगभग 1,200 कंपनियां अपना WAF चलाती हैं, और यह 85,000 से अधिक ग्राहक-विशिष्ट मशीन लर्निंग मॉडल संचालित करता है, जिसका मतलब है कि प्रत्येक संरक्षित साइट एक स्क्रेपर के लिए अपने स्वयं की पहचान चुनौती बन जाती है। यह edge पर एकीकृत करता है (CDN या DNS के माध्यम से), और इसकी पहचान AI प्रशिक्षण बॉट्स से परे जाती है, credential stuffing, विज्ञापन धोखाधड़ी, और scraping-as-a-service farmों को।

डैशबोर्ड इस श्रेणी में सबसे मजबूत है, आपको प्रति-अनुरोध वर्गीकरण, भौगोलिक breakdown, और राजस्व-प्रभाव अनुमान दे रहा है। पहचान पर प्रतिक्रिया समय मिलीसेकंड में मापा जाता है। एंटरप्राइज-ग्रेड समर्थन शामिल है।

कहां यह कम हो जाता है: मूल्य व्यक्तियों के लिए नहीं है; आप एक उद्धरण का अनुरोध करते हैं। सेटअप के लिए आपके DNS, CDN, और origin के साथ सहयोग की आवश्यकता होती है, इसलिए यह एक project है toggle नहीं।

मूल्य निर्धारण:

प्लेटफार्म: कोई भी origin (Windows, macOS, Linux); edge पर तैनात

निष्कर्ष: सही विकल्प जब scraped content या fraudl की लागत वार्षिक बॉट-प्रबंधन बिल से बड़ी हो।

सही चुनने का तरीका

FAQ

सर्वश्रेष्ठ मुफ्त AI स्क्रेपर ब्लॉकर क्या है?

Cloudflare AI Crawl Control यदि आपकी साइट Cloudflare के पीछे है (मुफ्त स्तर इसे शामिल करता है)। यदि आप self-host करते हैं, Anubis सबसे मजबूत मुफ्त open-source विकल्प है। दोनों स्टैक के अलग-अलग पक्षों से एक ही समस्या को संबोधित करते हैं।

क्या AI बॉट Cloudflare को बाईपास कर सकते हैं?

हां, कुछ कर सकते हैं। Cloudflare का वर्गीकार signature-based blocking पर बहुत अच्छा है लेकिन sophisticated scrapers residential proxy rotation और headless browsers का उपयोग करते हैं मानव दिखने के लिए। यही कारण है कि layered defense (edge + origin + दृश्यता) किसी भी एकल tool से बेहतर काम करता है।

क्या मुझे एक व्यक्तिगत ब्लॉग पर AI बॉट्स को ब्लॉक करना चाहिए?

यह आपकी कॉल है। यदि आप चाहते हैं कि आपकी सामग्री को वाणिज्यिक LLM को प्रशिक्षित करने के लिए उपयोग किया जाए, तो कुछ न करें। यदि आप बजाय करते हैं, Cloudflare toggle को सक्षम करें या Anubis जोड़ें। सबसे सामान्य समझौता Known Agents का robots.txt साथ ही सबसे बड़े प्रशिक्षण crawlers के लिए Cloudflare block है।

क्या AI बॉट्स को ब्लॉक करने से मेरी सर्च रैंकिंग को नुकसान होगा?

नहीं यदि आप blocker को सही तरीके से configure करते हैं। इस सूची में सभी tools Googlebot, Bingbot और अन्य पारंपरिक search crawlers को अनुमति दे सकते हैं जबकि GPTBot, ClaudeBot और PerplexityBot जैसे केवल-प्रशिक्षण bots को ब्लॉक करते हैं। Deployment से पहले allow list की जांच करें।

Anubis और Cloudflare के बीच अंतर क्या है?

Cloudflare नेटवर्क edge पर ब्लॉक करता है अनुरोध आपके server तक पहुंचने से पहले। Anubis आपके server पर एक रिवर्स प्रॉक्सी के रूप में चलता है और एक proof-of-work चुनौति जारी करता है। Cloudflare आसान है और अधिक जमीन को कवर करता है; Anubis self-hosted, पारदर्शी, और तीसरे पक्ष की आवश्यकता नहीं है।