Softonic ने इस हफ्ते रिपोर्ट किया कि OpenAI और Anthropic ने संयुक्त रूप से AI एजेंट हैक्स का एक बैच प्रकट किया है, और जो जिम्मेदारी सवाल उठता है वह असली कहानी है। अगर एक कोडिंग एजेंट एक निर्देशिका को हटा देता है क्योंकि एक वेबपेज ने उसे ऐसा करने के लिए कहा, तो किसी को इसके लिए जवाब देना होगा। डेस्कटॉप उपयोगकर्ता का सही उत्तर एजेंटों को चलाना बंद करना नहीं है। यह उन्हें guardrails के पीछे चलाना है। हमने 7 ऐप्स का परीक्षण किया जो एजेंट इनपुट और आउटपुट को फ़िल्टर करते हैं, उनके निष्पादन को अलग करते हैं, और लॉग करते हैं कि वे क्या करते हैं, ताकि जब कुछ गलत हो तो हम उस सटीक प्रॉम्प्ट की ओर इशारा कर सकें जिसने इसका कारण बना।
AI एजेंट सुरक्षा ऐप में क्या देखें
एजेंट सुरक्षा तीन समस्याओं में विभाजित होती है: एजेंट क्या पढ़ता है, एजेंट क्या करता है, और एजेंट क्या छोड़ता है। कोई भी वास्तविक सेटअप तीनों को कवर करना चाहिए।
- Prompt injection और PII के लिए प्रॉम्प्ट इनपुट फ़िल्टरिंग
- संरचनात्मक नियमों के विरुद्ध आउटपुट सत्यापन
- शेल निष्पादन के लिए एक sandbox, ताकि एजेंट गलत फ़ाइल को न छू सके
- प्रत्येक प्रॉम्प्ट, टूल कॉल और प्रतिक्रिया की ऑडिट लॉग
- उन कोडिंग एजेंटों के साथ एकीकरण जो हम पहले से उपयोग करते हैं (Claude Code, Cursor, Cline)
- जहाँ संभव हो स्थानीय रूप से चलाएं, कोई तीसरा पक्ष प्रत्येक प्रॉम्प्ट नहीं देखता
त्वरित तुलना
| App | Best for | Platforms | Free | Cost | Rating |
|---|---|---|---|---|---|
| Guardrails AI | संरचनात्मक और सामग्री guardrails | Windows, macOS, Linux, Python | Yes | Free tier + paid Hub | 4.7 (GitHub) |
| NeMo Guardrails | नियम-आधारित संवादात्मक सुरक्षा | Windows, macOS, Linux | Yes | Free | 4.6 |
| Rebuff | Prompt-injection पहचान | Windows, macOS, Linux, cloud | Yes | Free tier | 4.5 |
| Docker Desktop | एजेंटों के लिए कंटेनर sandbox | Windows, macOS, Linux | Yes | 9/user/mo Pro | 4.5 |
| gVisor | कंटेनर के लिए kernel-level sandbox | Linux, macOS Docker | Yes | Free | 4.4 |
| Firecracker | हल्के अलगाव के लिए Micro-VM | Linux | Yes | Free | 4.6 |
| LangKit | LLM प्रॉम्प्ट के लिए runtime मेट्रिक्स | Windows, macOS, Linux | Yes | Free | 4.5 |
1. Guardrails AI, संरचनात्मक और सामग्री guardrails के लिए सर्वश्रेष्ठ
Guardrails AI एक Python पुस्तकालय और Hub है जो मॉडल कॉल को घोषणात्मक नियमों में लपेटता है। कहें “आउटपुट इन फ़ील्ड के साथ मान्य JSON होना चाहिए”, “आउटपुट में PII नहीं होना चाहिए”, “आउटपुट में शेल कमांड नहीं होना चाहिए”, और पुस्तकालय फिर से लिखता है, फिर से प्रयास करता है, या कॉल को अस्वीकार करता है। Hub पहले से निर्मित वेलिडेटर का एक बाजार जोड़ता है।
जहाँ यह अपर्याप्त है: Python-केंद्रित, इसलिए यह “मैं बस चाहता हूँ कि Cursor व्यवहार करे” के मामलों की तुलना में एजेंट फ्रेमवर्क के लिए बेहतर फिट है।
मूल्य निर्धारण:
- Free: core library, Apache 2.0
- Paid: साझा वेलिडेटर और होस्ट किए गए enforcement के लिए Hub Pro tier
प्लेटफॉर्म: Windows, macOS, Linux, Python
Download: Guardrails AI | GitHub
Bottom line: जब हम अपना एजेंट लिख रहे हैं और चाहते हैं कि वह खराब आउटपुट पर जोर से विफल हो तो चुनने के लिए उपकरण।
2. NeMo Guardrails, नियम-आधारित संवादात्मक सुरक्षा के लिए सर्वश्रेष्ठ
NeMo Guardrails NVIDIA द्वारा हमें एक छोटी डोमेन-विशिष्ट भाषा में नीतियों का वर्णन करने देता है, Colang, फिर किसी भी LLM कॉल को लपेटता है। एक नीति कह सकती है “अगर उपयोगकर्ता सिस्टम प्रॉम्प्ट के बारे में पूछता है तो अस्वीकार करें”, या “डोमेन प्रश्नों का उत्तर देने से पहले हमेशा पुनर्प्राप्ति उपकरण को कॉल करें”। Colang मॉडल कॉल से पहले, साथ में और बाद में चलता है।
जहाँ यह अपर्याप्त है: Colang एक भाषा है जो सीखनी है, और runtime लेटेंसी जोड़ता है।
मूल्य निर्धारण:
- Free: open source, Apache 2.0
- Paid: कोई नहीं, हालांकि प्रशिक्षण स्टैक के लिए NeMo Enterprise सेवाएं मौजूद हैं
प्लेटफॉर्म: Windows, macOS, Linux
Download: NeMo Guardrails
Bottom line: सीखने की अवस्था के लायक है यदि एजेंट उपयोगकर्ता-सामना कर रहा है और नीति नियम प्रॉम्प्ट के बाहर रहने चाहिए।
3. Rebuff, prompt-injection पहचान के लिए सर्वश्रेष्ठ
Rebuff एक छोटी पुस्तकालय है जो एक समस्या को समर्पित है: prompt injection को मॉडल तक पहुंचने से पहले पकड़ें। यह heuristics का उपयोग करता है, ज्ञात हमले की स्ट्रिंग का vector DB, और canary token दृष्टिकोण। कोई भी चीज जो एक injection जैसी लगती है को चिह्नित किया जाता है, और कॉलिंग कोड तय करता है कि क्या करना है।
जहाँ यह अपर्याप्त है: heuristics में false positives हैं, और vector दृष्टिकोण को चलाने वाले vector DB की आवश्यकता है।
मूल्य निर्धारण:
- Free: open source, MIT
- Paid: होस्ट किए गए vector DB और साझा हमले corpus के साथ cloud tier
प्लेटफॉर्म: Python, JavaScript, cloud
Download: Rebuff
Bottom line: विशेष उपकरण। इसे सामान्य-उद्देश्य guardrail पुस्तकालय से पहले बोल्ट करें।
4. Docker Desktop, परिचित कंटेनर sandbox के लिए सर्वश्रेष्ठ
Docker Desktop सूची में सबसे कम चमकदार प्रविष्टि है और संभवतः सबसे उपयोगी है। repo को read-write में माउंट किए गए कंटेनर के अंदर कोडिंग एजेंटों को चलाएं और बाकी सब कुछ read-only हो, और एक दुर्भावनापूर्ण प्रॉम्प्ट भी मशीन को rm नहीं कर सकता। Volumes होस्ट को handoff स्पष्ट बनाते हैं।
जहाँ यह अपर्याप्त है: desktop ऐप RAM पर भारी है, और licensing तीन वर्षों में दो बार बदली है।
मूल्य निर्धारण:
- Free: व्यक्तिगत और छोटी टीमें (250 से कम कर्मचारी)
- Paid: 9/user/mo Pro, Team के लिए अधिक
प्लेटफॉर्म: Windows, macOS, Linux
Download: Docker Desktop
Bottom line: “मैं Claude को npm install चलाने कैसे दे सकता हूँ बिना अपने फाइलसिस्टम को एक्सेस दिए” का व्यावहारिक उत्तर।
5. gVisor, kernel-level sandbox के लिए सर्वश्रेष्ठ
gVisor Google द्वारा लिखा गया एक userspace kernel है। gVisor के तहत चलने वाले कंटेनर केवल syscalls के एक subset बना सकते हैं, इसलिए एक कंटेनर escape भी होस्ट kernel तक नहीं पहुंच सकता। यह एक सामान्य कंटेनर से भारी है लेकिन पूरे VM से बहुत हल्का है।
जहाँ यह अपर्याप्त है: performance overhead वास्तविक है, और हर workload इसके तहत tweaking के बिना नहीं चलता।
मूल्य निर्धारण:
- Free: open source, Apache 2.0
- Paid: कोई नहीं
प्लेटफॉर्म: Linux, और macOS पर Linux-inside-Docker
Bottom line: गहरी अलगाव परत, उन एजेंटों के लिए जो अजनबियों के कोड को छूते हैं।
6. Firecracker, micro-VM के लिए सर्वश्रेष्ठ
Firecracker micro-VMs के लिए एक KVM-आधारित हाइपरवाइजर है। बूट समय एक सेकंड से कम है, मेमोरी footprint को मेगाबाइट में मापा जाता है, और अलगाव कंटेनर की तुलना में पूरे VM के करीब है। AWS Lambda इसे चलाता है। स्थानीय रूप से, प्रति एजेंट रन एक Firecracker VM प्रत्येक काम की blast radius को contained रखता है।
जहाँ यह अपर्याप्त है: केवल Linux, और setup एक पांच मिनट का व्यायाम नहीं है।
मूल्य निर्धारण:
- Free: open source, Apache 2.0
- Paid: कोई नहीं
प्लेटफॉर्म: Linux
Download: Firecracker | GitHub
Bottom line: पूरे VM के अलावा सबसे मजबूत स्थानीय अलगाव विकल्प।
7. LangKit, runtime मेट्रिक्स और observability के लिए सर्वश्रेष्ठ
LangKit WhyLabs द्वारा प्रत्येक प्रॉम्प्ट और प्रतिक्रिया को text quality, toxicity, sentiment, ज्ञात injections के समानता और PII के लिए मापता है। यह किसी भी LLM कॉल से पहले फिट होता है, और dashboards समय के साथ anomalies दिखाते हैं। बिंदु ब्लॉक करना नहीं है, यह नोटिस करना है।
जहाँ यह अपर्याप्त है: observability अकेले हमले को नहीं रोकता, यह समझाता है कि तथ्य के बाद क्या हुआ।
मूल्य निर्धारण:
- Free: open source, Apache 2.0
- Paid: होस्ट किए गए dashboards के लिए WhyLabs platform, लगभग 200/mo से
प्लेटफॉर्म: Windows, macOS, Linux
Download: LangKit
Bottom line: “क्या हुआ अभी-अभी” परत। इसे ऊपर के किसी भी enforcer के साथ जोड़ी।
सही को कैसे चुनें
- मॉडल आउटपुट को फिर से लिखने या अस्वीकार करने के लिए: Guardrails AI।
- प्रॉम्प्ट के बाहर नीति नियमों के लिए: NeMo Guardrails।
- Prompt-injection पहचान के लिए विशेष रूप से: Rebuff।
- Pragmatic तरीके से shell execution को sandboxing के लिए: Docker Desktop।
- Linux पर गहरे अलगाव के लिए: gVisor।
- Micro-VM अलगाव के लिए: Firecracker।
- एजेंट क्या कर रहे हैं इसे मापने के लिए: LangKit।
- Prompt-level audit logging के लिए: PromptLayer एक नज़र के लायक है, यह metadata के साथ हर request और response को कैप्चर करता है।
एक रक्षणीय डेस्कटॉप सेटअप आमतौर पर इन तीन को स्टैक करता है: एक sandbox (Docker Desktop), एक guardrail परत (Guardrails AI या NeMo), और observability (LangKit या PromptLayer)।
FAQ
क्या मुझे वाकई कोडिंग एजेंटों को sandbox करने की आवश्यकता है?
अगर एजेंट shell कमांड चलाता है या फ़ाइलें लिखता है, तो हाँ। अगर यह सिर्फ चैट करता है, तो नहीं। रेखा यह है कि क्या prompt injection एक क्रिया में बदल सकता है।
कौन सी सबसे आसान पहली पदक्षेप है?
कोडिंग एजेंट के लिए locked-down कंटेनर के साथ Docker Desktop। मॉडल कॉल में Guardrails AI जोड़ें। यह पहले से ही अधिकांश आकस्मिक क्षति को ब्लॉक कर देता है।
क्या ये उपकरण Astra-style हमलों के खिलाफ मॉडल की रक्षा कर सकते हैं?
सीधे मॉडल हमलों के खिलाफ, नहीं। इस सूची में कुछ भी मॉडल वजन नहीं बदलता। Prompt injection, PII leakage, और unsafe tool calls के खिलाफ, हाँ।
क्या free tiers काफी हैं?
एक एकल डेवलपर के लिए, हाँ। Guardrails AI, NeMo Guardrails, Rebuff, gVisor, Firecracker, LangKit, और PromptLayer सभी के पास वास्तविक free tiers हैं। केवल Docker Desktop बहुत छोटी टीमों के बाहर चार्ज करना शुरू करता है।
क्या ये एजेंट को धीमा कर देता है?
Guardrails latency जोड़ते हैं, कभी-कभी सैकड़ों मिलीसेकंड। Sandboxes कंटेनर के लिए negligible latency जोड़ते हैं और micro-VMs के लिए थोड़ा अधिक। Latency को सुरक्षा के लिए व्यापार करें, हमेशा।