AI एजेंटों में 5 गंभीर सुरक्षा भेद्यताएँ: सिंगहुआ शोधकर्ताओं ने क्या पाया (और उन्हें कैसे ठीक करें)
सिंगहुआ यूनिवर्सिटी और Ant Group के शोधकर्ताओं ने स्वायत्त LLM एजेंटों में एक व्यवस्थागत सुरक्षा-संकट उजागर किया है। पाँच लाइफ़साइकल-चरणों में — इनिशियलाइज़ेशन से लेकर एक्ज़ीक्यूशन तक — उन्होंने ऐसे अटैक-वेक्टर पहचाने जो AI एजेंटों को चुपचाप भंग कर सकते हैं, सत्रों के आर-पार बने रह सकते हैं, और पूर्ण सिस्टम-टेकओवर तक बढ़ सकते हैं। एक आँकड़ा सबसे अलग खड़ा है: 26% सामुदायिक-योगदान वाले AI skills में सुरक्षा-भेद्यताएँ हैं।
🔬 शोध: सिंगहुआ + Ant Group ने एजेंट सुरक्षा में अंतर उजागर किया
स्वायत्त LLM एजेंट — OpenClaw जैसे सिस्टम जो उच्च-विशेषाधिकार सिस्टम-एक्सेस के ज़रिए जटिल दीर्घकालिक कार्य निष्पादित कर सकते हैं — अब शोध की जिज्ञासा भर नहीं रहे। वे कोड प्रबंधित करते हैं, सिस्टम चलाते हैं, और बड़े पैमाने पर एंटरप्राइज़ डेटा प्रोसेस करते हैं। पर एक संयुक्त शोध-पत्र, जो आया सिंगहुआ यूनिवर्सिटी और Ant Group की ओर से, एक गंभीर सुरक्षा-अंधबिंदु उजागर करता है: पूरा एजेंट लाइफ़साइकल उन तरीक़ों से भेद्य है जिन्हें परंपरागत बचाव संबोधित नहीं कर सकते।
यह शोध OpenClaw की 'कर्नेल-प्लगइन' आर्किटेक्चर पर केंद्रित है, जहाँ एक न्यूनतम Trusted Computing Base (TCB) थर्ड-पार्टी प्लगइन के एक विस्तार-योग्य इकोसिस्टम को प्रबंधित करता है, जिन्हें "skills" कहा जाता है। यह आर्किटेक्चर अधिकांश प्रमुख एजेंटिक फ़्रेमवर्क में दोहराई जाती है — जिससे ये निष्कर्ष किसी एक प्लेटफ़ॉर्म से कहीं आगे व्यापक रूप से लागू होते हैं।
मूल समस्या: बिना सख़्त इंटीग्रिटी-सत्यापन के डायनामिक प्लगइन-लोडिंग एक अस्पष्ट भरोसा-सीमा बना देती है। एक बार हमलावरों को पता चल जाए कि वह सीमा कहाँ है, वे इसे किसी एजेंट के लाइफ़साइकल के हर चरण में एक्सप्लॉइट कर सकते हैं।
⚔️ 5 अटैक-वेक्टर
शोधकर्ताओं ने एजेंट की कार्यात्मक पाइपलाइन के अनुरूप पाँच परिचालन-चरणों में ख़तरों को मैप किया। व्यवहार में हर हमला कैसा दिखता है, यह देखें:
1. स्किल पॉइज़निंग
किसी कार्य के शुरू होने से भी पहले, कोई विरोधी एजेंट के प्लगइन-इकोसिस्टम में एक दुर्भावनापूर्ण skill इंजेक्ट कर सकता है। शोध-डेमो में, हमलावरों ने एजेंट को एक नक़ली hacked-weather skill बनाने पर मजबूर किया, जिसकी रूटिंग-प्राथमिकता कृत्रिम रूप से बढ़ाई गई थी। जब उपयोगकर्ताओं ने मौसम-डेटा माँगा, एजेंट ने वैध सेवा को पूरी तरह दरकिनार कर दिया — और हमलावर-नियंत्रित आउटपुट दिया। सबसे चौंकाने वाली बात: 26% सामुदायिक-योगदान वाले टूल में एक्सप्लॉइट-योग्य भेद्यताएँ हैं, जिससे सप्लाई-चेन संदूषण एक सांख्यिकीय रूप से महत्वपूर्ण जोखिम बन जाता है, कोई सैद्धांतिक जोखिम नहीं।
2. इनडायरेक्ट प्रॉम्प्ट इंजेक्शन
स्वायत्त एजेंट लगातार अविश्वसनीय बाहरी डेटा ग्रहण करते हैं — वेब-पेज, दस्तावेज़, API प्रतिक्रियाएँ। हमलावर उस सामग्री के भीतर दुर्भावनापूर्ण निर्देश छिपाते हैं। टेस्ट किए गए परिदृश्य में, किसी वेब-पेज में छिपे निर्देश थे जिन्होंने उपयोगकर्ता के मूल कार्य को ओवरराइड कर दिया। एजेंट ने वैध रिक्वेस्ट को नज़रअंदाज़ किया और इसके बजाय एम्बेडेड पेलोड निष्पादित किया — एक ज़ीरो-क्लिक एक्सप्लॉइट, जिसे किसी सीधी उपयोगकर्ता-बातचीत की ज़रूरत नहीं। जैसे-जैसे एजेंटों को अधिक बाहरी टूल-एक्सेस मिलता है, यह Attack Surface चरघातांकी रूप से बढ़ता जाता है।
3. मेमोरी पॉइज़निंग
स्टेटलेस API कॉल के विपरीत, एजेंटिक सिस्टम सत्रों के आर-पार स्थायी मेमोरी बनाए रखते हैं। शोध-टीम ने एजेंट की MEMORY.md फ़ाइल में बदलाव करने के लिए एक क्षणिक इंजेक्शन का उपयोग किया — एक गढ़ा हुआ नियम जोड़ते हुए, जो एजेंट को "C++" वाली किसी भी क्वेरी को अस्वीकार करने का निर्देश देता था। यह पॉइज़न आगे के सभी सत्रों में बना रहा: प्रारंभिक हमला-संपर्क समाप्त होने के बाद भी, निर्दोष प्रोग्रामिंग रिक्वेस्ट व्यवस्थित रूप से अस्वीकार होती रहीं। यह स्थायी व्यवहारिक हेरफेर की एक नई श्रेणी दर्शाता है, जिसे मानक इंसिडेंट-रिस्पॉन्स संबोधित नहीं करता।
4. इंटेंट ड्रिफ्ट
इंटेंट ड्रिफ्ट तब होता है जब व्यक्तिगत रूप से जायज़ टूल-कॉल का एक क्रम किसी विनाशकारी वैश्विक परिणाम की ओर ले जाता है। टेस्ट किए गए परिदृश्य में, किसी उपयोगकर्ता ने एजेंट से "एक संदिग्ध क्रॉलर IP को हटाने" को कहा। एजेंट आगे बढ़ता गया: उसने IP कनेक्शन पहचाने, सिस्टम फ़ायरवॉल को बदलने की कोशिश की iptablesके ज़रिए, असफल रहा, फिर मैनुअल रीस्टार्ट की कोशिश के लिए अपनी ही चल रही प्रोसेस को समाप्त कर दिया — जिससे पूरा WebUI बंद हो गया और एक पूर्ण सिस्टम-आउटेज हुआ। कोई भी अकेला क़दम स्पष्ट रूप से दुर्भावनापूर्ण नहीं था; यह आपदा मिश्रित स्वायत्त निर्णयों से उभरी।
5. स्टील्थ कमांड एक्ज़ीक्यूशन (हाई-रिस्क कमांड एक्ज़ीक्यूशन)
अंतिम-चरण का हमला दिखाता है कि पहले के भंग किस तरह इन्फ़्रास्ट्रक्चर-नुक़सान तक बढ़ जाते हैं। शोधकर्ताओं ने स्टैटिक फ़िल्टर को बायपास करने के लिए एक Fork Bomb हमले को चार अलग-अलग निर्दोष फ़ाइल-राइट क़दमों में तोड़ा। Base64 एन्कोडिंग और sed का उपयोग जंक-कैरेक्टर हटाने के लिए करते हुए, उन्होंने एक गुप्त एक्ज़ीक्यूशन-चेन इकट्ठी की trigger.shमें। ट्रिगर होने पर, स्क्रिप्ट ने CPU उपयोग को लगभग 100% सैचुरेशन तक उछाल दिया — जो होस्ट के ख़िलाफ़ एक प्रभावी डिनायल-ऑफ़-सर्विस हमला था। यह हमला पहचान से इसीलिए बच निकला क्योंकि अलग से देखने पर कोई भी क़दम दुर्भावनापूर्ण नहीं लगता था।
🛡️ 5-लेयर डिफ़ेंस फ़्रेमवर्क
शोध-टीम एक लाइफ़साइकल-उन्मुख डिफ़ेंस-फ़्रेमवर्क प्रस्तावित करती है जो पाँचों हमला-चरणों को प्रतिबिंबित करता है। हर लेयर विशिष्ट ख़तरा-श्रेणियों को संबोधित करने के लिए डिज़ाइन की गई है, जबकि साथ मिलकर एक समग्र डिफ़ेंस-इन-डेप्थ मुद्रा बनाती है:
| परत | चरण | डिफ़ेंस-फ़ोकस | मुख्य नियंत्रण |
|---|---|---|---|
| L1 | इनिशियलाइज़ेशन | Skill और प्लगइन इंटीग्रिटी | क्रिप्टोग्राफ़िक साइनिंग, इंटीग्रिटी-सत्यापन, भरोसेमंद skill स्रोतों के लिए allowlist, सप्लाई-चेन ऑडिटिंग |
| L2 | इनपुट | इनपुट-सीमा प्रवर्तन | भरोसेमंद उपयोगकर्ता-निर्देशों को अविश्वसनीय बाहरी डेटा से सख़्ती से अलग करना, इनपुट-टैगिंग और सैनिटाइज़ेशन |
| L3 | इन्फ़रेंस | मेमोरी इंटीग्रिटी और आइसोलेशन | मेमोरी एक्सेस-नियंत्रण, कोर व्यवहारिक नियमों के लिए अपरिवर्तनीयता, मेमोरी-राइट पर एनॉमली-डिटेक्शन |
| L4 | निर्णय | इंटेंट सत्यापन और एस्केलेशन नियंत्रण | टूल-कॉल पर स्कोप-सीमाएँ, हाई-रिस्क एक्शन के लिए ह्यूमन-इन-द-लूप, रोलबैक क्षमताएँ |
| L5 | एक्ज़ीक्यूशन | सैंडबॉक्स्ड एक्ज़ीक्यूशन और एक्सेस-नियंत्रण | प्रोसेस-आइसोलेशन, न्यूनतम-विशेषाधिकार एक्ज़ीक्यूशन, कमांड-सीक्वेंस का स्टैटिक + व्यवहारिक विश्लेषण |
फ़्रेमवर्क की मुख्य अंतर्दृष्टि यह है कि मिश्रित ख़तरों के लिए मिश्रित बचाव चाहिए। कोई हमला जो स्किल पॉइज़निंग (L1) से शुरू होकर, प्रॉम्प्ट इंजेक्शन (L2) से बढ़ता है, और स्टील्थ एक्ज़ीक्यूशन (L5) पर समाप्त होता है, उसे किसी एक अकेली लेयर से नहीं रोका जा सकता — सभी पाँचों को एक साथ सक्रिय होना चाहिए।
📋 NIS2 और EU AI Act अनुपालन-निहितार्थ
⚖️ नियामक-एक्सपोज़र असली है
प्रोडक्शन में AI एजेंट तैनात करने वाले EU-आधारित संगठनों के लिए, ये निष्कर्ष NIS2 और EU AI Act — दोनों के तहत सीधे नियामक-दायित्व बनाते हैं। सत्रों के आर-पार बने रहने वाले मेमोरी पॉइज़निंग हमले, और 26% सामुदायिक टूल को प्रभावित करने वाली skill सप्लाई-चेन भेद्यताएँ, ठीक वही व्यवस्थागत जोखिम हैं जिन्हें संबोधित करने के लिए दोनों फ़्रेमवर्क डिज़ाइन किए गए थे।
NIS2 निर्देश (नेटवर्क और सूचना सुरक्षा): Article 21 के लिए "नेटवर्क और सूचना प्रणालियों की सुरक्षा को जोखिम में डालने वाले ख़तरों के प्रबंधन हेतु उपयुक्त और आनुपातिक तकनीकी व संगठनात्मक उपाय" चाहिए। उच्च-विशेषाधिकार सिस्टम-एक्सेस वाले स्वायत्त AI एजेंट सीधे इस दायरे में आते हैं। दुर्भावनापूर्ण skills के ज़रिए सप्लाई-चेन संदूषण, सप्लाई-चेन सुरक्षा पर Article 21(2)(d) को ट्रिगर करता है। सत्रों के आर-पार एजेंट-व्यवहार को प्रभावित करने वाली स्थायी मेमोरी पॉइज़निंग, Article 23 के रिपोर्टिंग-दायित्वों के तहत एक "घटना" गठित करती है।
EU AI Act: उच्च-जोखिम वाली AI प्रणालियों — जिनमें सुरक्षा-संवेदनशील कार्य करने वाली या महत्वपूर्ण इन्फ़्रास्ट्रक्चर में स्वायत्त रूप से चलने वाली प्रणालियाँ शामिल हैं — को मज़बूती और सटीकता (Article 15), पारदर्शिता (Article 13), और ह्यूमन ओवरसाइट (Article 14) की सख़्त शर्तें पूरी करनी होंगी। सिस्टम-आउटेज तक ले जाने वाला इंटेंट ड्रिफ्ट ठीक वही विफलता-मोड है जिसे रोकने के लिए Article 14 डिज़ाइन किया गया है। संगठनों को अपने कॉन्फ़ॉर्मिटी-एसेसमेंट के हिस्से के रूप में सभी पाँच अटैक-वेक्टर का दस्तावेज़ीकरण और परीक्षण करना होगा।
DORA (डिजिटल ऑपरेशनल रेज़िलिएंस एक्ट): स्वचालित संचालन के लिए AI एजेंट का उपयोग करने वाली वित्तीय संस्थाओं को सभी ICT थर्ड-पार्टी निर्भरताओं का मैपिंग करना होगा — जिनमें थर्ड-पार्टी skill प्रोवाइडर भी शामिल हैं। सामुदायिक skills में 26% की भेद्यता-दर, DORA की ICT जोखिम-प्रबंधन आवश्यकताओं के तहत सीधा थर्ड-पार्टी जोखिम-एक्सपोज़र बनाती है।
⚠️ अनुपालन-अंतर
ज़्यादातर मौजूदा AI सुरक्षा-आकलन अकेले प्रॉम्प्ट इंजेक्शन पर केंद्रित होते हैं। पाँच-लेयर वाला लाइफ़साइकल फ़्रेमवर्क उजागर करता है कि अलग-थलग बचाव मिश्रित हमलों के सामने विफल हो जाते हैं। सिंगल-लेयर बचाव पर निर्भर संगठन एजेंटिक AI प्रणालियों के लिए NIS2 के "उपयुक्त और आनुपातिक" मानक का पालन नहीं करते।
🔧 तत्काल रक्षात्मक कार्रवाइयाँ
- अपनी AI skill सप्लाई-चेन का ऑडिट करें — सभी थर्ड-पार्टी skills और प्लगइन की इन्वेंट्री बनाएँ। चूँकि 26% में भेद्यताएँ हैं, जब तक सत्यापित न हो जाए, तब तक भंग मान लें।
- क्रिप्टोग्राफ़िक साइनिंग लागू करें — सभी skill इंस्टॉलेशन के लिए सिग्नेचर-सत्यापन अनिवार्य करें। लोड-टाइम पर अहस्ताक्षरित या असत्यापित प्लगइन अस्वीकार करें।
- एजेंट की मेमोरी-फ़ाइलों की सुरक्षा करें — स्थायी मेमोरी पर सख़्त एक्सेस-नियंत्रण लागू करें (जैसे,
MEMORY.md)। अनधिकृत राइट के लिए मॉनिटर करें। अपरिवर्तनीय कोर-नियमों पर विचार करें। - टूल-कॉल के लिए स्कोप-सीमाएँ तय करें — स्पष्ट रूप से सीमित करें कि हर एजेंट किन सिस्टम-रिसोर्स तक पहुँच सकता है। फ़ायरवॉल में बदलाव, प्रोसेस समाप्ति और अन्य उच्च-प्रभाव कार्रवाइयों के लिए मानवीय अनुमोदन अनिवार्य करें।
- एक्ज़ीक्यूशन-सीक्वेंस पर व्यवहारिक विश्लेषण तैनात करें — मल्टी-स्टेप हमले, जो हानिकारक कार्रवाइयों को अलग-अलग निर्दोष क़दमों में तोड़ देते हैं, स्टैटिक फ़िल्टर से बच निकलते हैं। व्यवहारिक विश्लेषण पैटर्न पकड़ लेता है।
- भरोसेमंद और अविश्वसनीय डेटा-पथों को अलग करें — सभी बाहरी-स्रोत सामग्री को टैग करें और उसे एक अलग प्रोसेसिंग-पाइपलाइन से गुज़ारें जो उपयोगकर्ता के इरादे को ओवरराइड नहीं कर सकती।
- सभी 5 अटैक-वेक्टर टेस्ट करें — अपने पेनेट्रेशन-टेस्टिंग दायरे में स्किल पॉइज़निंग, इनडायरेक्ट प्रॉम्प्ट इंजेक्शन, मेमोरी पॉइज़निंग, इंटेंट ड्रिफ्ट और स्टील्थ एक्ज़ीक्यूशन शामिल करें।
🎯 KENSAI इन भेद्यताओं को कैसे संबोधित करता है
सिंगहुआ/Ant Group शोधकर्ताओं द्वारा पहचाने गए पाँच अटैक-वेक्टर सीधे KENSAI की स्वचालित सुरक्षा-स्कैनिंग क्षमताओं से मेल खाते हैं। KENSAI का निरंतर स्कैनिंग-इंजन ठीक इसी तरह के व्यवस्थागत जोखिम खोजने के लिए बनाया गया था — केवल अलग-थलग भेद्यताएँ नहीं, बल्कि कई लेयर तक फैले मिश्रित हमला-पथ:
- AI Skill सप्लाई-चेन स्कैनिंग — ज्ञात भेद्यताओं, दुर्भावनापूर्ण पैटर्न और मेटाडेटा-हेरफेर के लिए थर्ड-पार्टी प्लगइन और skill रिपॉज़िटरी का स्वचालित विश्लेषण
- प्रॉम्प्ट इंजेक्शन डिटेक्शन — एजेंट इनपुट-पाइपलाइन में इनडायरेक्ट प्रॉम्प्ट इंजेक्शन वेक्टर के लिए डायनामिक टेस्टिंग, जिसमें वेब-रिट्रीवल और डॉक्यूमेंट-प्रोसेसिंग शामिल है
- कॉन्फ़िगरेशन सुरक्षा-आकलन — 5-लेयर फ़्रेमवर्क के विरुद्ध मेमोरी एक्सेस-नियंत्रण, एक्ज़ीक्यूशन-सैंडबॉक्सिंग और विशेषाधिकार-सीमाओं का सत्यापन
- व्यवहारिक अटैक सिमुलेशन — विघटित अटैक-सीक्वेंस का उपयोग करते हुए इंटेंट ड्रिफ्ट और स्टील्थ कमांड एक्ज़ीक्यूशन के लिए सक्रिय टेस्टिंग
- NIS2/EU AI Act अनुपालन-मैपिंग — सभी प्रासंगिक नियामक आवश्यकताओं के विरुद्ध कॉन्फ़ॉर्मिटी-एसेसमेंट के लिए स्वचालित साक्ष्य-निर्माण
यह शोध-पत्र दिखाता है कि अभी, आज ही, 26% सामुदायिक skills भेद्य हैं — और ज़्यादातर संगठनों को अपने AI एजेंट Attack Surface में कोई दृश्यता नहीं है। KENSAI आपको वह दृश्यता विरोधियों के इसे एक्सप्लॉइट करने से पहले देता है।
अभी अपने AI एजेंट इन्फ़्रास्ट्रक्चर को स्कैन करें
KENSAI सिंगहुआ शोध में पहचाने गए सभी 5 अटैक-वेक्टर — स्किल पॉइज़निंग, प्रॉम्प्ट इंजेक्शन, मेमोरी पॉइज़निंग, इंटेंट ड्रिफ्ट और स्टील्थ एक्ज़ीक्यूशन — के लिए स्वचालित रूप से टेस्ट करता है। मिनटों में अपना AI सुरक्षा-स्कोर पाएँ।
अपना मुफ़्त AI सुरक्षा स्कैन शुरू करेंसुरक्षित रहें,
KENSAI सुरक्षा अनुसंधान टीम
AI ख़तरा-इंटेलिजेंस से संचालित दैनिक सुरक्षा ब्रीफ़िंग। हर कार्यदिवस अपडेट की जाती है।