剣 KENSAI
← सुरक्षा ब्लॉग पर वापस
AI सुरक्षा रिसर्च 24 मार्च 2026 11 मिनट पढ़ें

AI एजेंटों में 5 गंभीर सुरक्षा भेद्यताएँ: सिंगहुआ शोधकर्ताओं ने क्या पाया (और उन्हें कैसे ठीक करें)

सिंगहुआ यूनिवर्सिटी और Ant Group के शोधकर्ताओं ने स्वायत्त LLM एजेंटों में एक व्यवस्थागत सुरक्षा-संकट उजागर किया है। पाँच लाइफ़साइकल-चरणों में — इनिशियलाइज़ेशन से लेकर एक्ज़ीक्यूशन तक — उन्होंने ऐसे अटैक-वेक्टर पहचाने जो AI एजेंटों को चुपचाप भंग कर सकते हैं, सत्रों के आर-पार बने रह सकते हैं, और पूर्ण सिस्टम-टेकओवर तक बढ़ सकते हैं। एक आँकड़ा सबसे अलग खड़ा है: 26% सामुदायिक-योगदान वाले AI skills में सुरक्षा-भेद्यताएँ हैं


26% सुरक्षा-भेद्यताओं वाले सामुदायिक skills
5 पूरे एजेंट लाइफ़साइकल में अटैक-वेक्टर
5 प्रस्तावित फ़्रेमवर्क में डिफ़ेंस-लेयर
100% Fork Bomb टेस्ट में हासिल की गई CPU सैचुरेशन

🔬 शोध: सिंगहुआ + Ant Group ने एजेंट सुरक्षा में अंतर उजागर किया

स्वायत्त LLM एजेंट — OpenClaw जैसे सिस्टम जो उच्च-विशेषाधिकार सिस्टम-एक्सेस के ज़रिए जटिल दीर्घकालिक कार्य निष्पादित कर सकते हैं — अब शोध की जिज्ञासा भर नहीं रहे। वे कोड प्रबंधित करते हैं, सिस्टम चलाते हैं, और बड़े पैमाने पर एंटरप्राइज़ डेटा प्रोसेस करते हैं। पर एक संयुक्त शोध-पत्र, जो आया सिंगहुआ यूनिवर्सिटी और Ant Group की ओर से, एक गंभीर सुरक्षा-अंधबिंदु उजागर करता है: पूरा एजेंट लाइफ़साइकल उन तरीक़ों से भेद्य है जिन्हें परंपरागत बचाव संबोधित नहीं कर सकते।

यह शोध OpenClaw की 'कर्नेल-प्लगइन' आर्किटेक्चर पर केंद्रित है, जहाँ एक न्यूनतम Trusted Computing Base (TCB) थर्ड-पार्टी प्लगइन के एक विस्तार-योग्य इकोसिस्टम को प्रबंधित करता है, जिन्हें "skills" कहा जाता है। यह आर्किटेक्चर अधिकांश प्रमुख एजेंटिक फ़्रेमवर्क में दोहराई जाती है — जिससे ये निष्कर्ष किसी एक प्लेटफ़ॉर्म से कहीं आगे व्यापक रूप से लागू होते हैं।

मूल समस्या: बिना सख़्त इंटीग्रिटी-सत्यापन के डायनामिक प्लगइन-लोडिंग एक अस्पष्ट भरोसा-सीमा बना देती है। एक बार हमलावरों को पता चल जाए कि वह सीमा कहाँ है, वे इसे किसी एजेंट के लाइफ़साइकल के हर चरण में एक्सप्लॉइट कर सकते हैं।

⚔️ 5 अटैक-वेक्टर

शोधकर्ताओं ने एजेंट की कार्यात्मक पाइपलाइन के अनुरूप पाँच परिचालन-चरणों में ख़तरों को मैप किया। व्यवहार में हर हमला कैसा दिखता है, यह देखें:

चरण I — इनिशियलाइज़ेशन

1. स्किल पॉइज़निंग

किसी कार्य के शुरू होने से भी पहले, कोई विरोधी एजेंट के प्लगइन-इकोसिस्टम में एक दुर्भावनापूर्ण skill इंजेक्ट कर सकता है। शोध-डेमो में, हमलावरों ने एजेंट को एक नक़ली hacked-weather skill बनाने पर मजबूर किया, जिसकी रूटिंग-प्राथमिकता कृत्रिम रूप से बढ़ाई गई थी। जब उपयोगकर्ताओं ने मौसम-डेटा माँगा, एजेंट ने वैध सेवा को पूरी तरह दरकिनार कर दिया — और हमलावर-नियंत्रित आउटपुट दिया। सबसे चौंकाने वाली बात: 26% सामुदायिक-योगदान वाले टूल में एक्सप्लॉइट-योग्य भेद्यताएँ हैं, जिससे सप्लाई-चेन संदूषण एक सांख्यिकीय रूप से महत्वपूर्ण जोखिम बन जाता है, कोई सैद्धांतिक जोखिम नहीं।

चरण II — इनपुट

2. इनडायरेक्ट प्रॉम्प्ट इंजेक्शन

स्वायत्त एजेंट लगातार अविश्वसनीय बाहरी डेटा ग्रहण करते हैं — वेब-पेज, दस्तावेज़, API प्रतिक्रियाएँ। हमलावर उस सामग्री के भीतर दुर्भावनापूर्ण निर्देश छिपाते हैं। टेस्ट किए गए परिदृश्य में, किसी वेब-पेज में छिपे निर्देश थे जिन्होंने उपयोगकर्ता के मूल कार्य को ओवरराइड कर दिया। एजेंट ने वैध रिक्वेस्ट को नज़रअंदाज़ किया और इसके बजाय एम्बेडेड पेलोड निष्पादित किया — एक ज़ीरो-क्लिक एक्सप्लॉइट, जिसे किसी सीधी उपयोगकर्ता-बातचीत की ज़रूरत नहीं। जैसे-जैसे एजेंटों को अधिक बाहरी टूल-एक्सेस मिलता है, यह Attack Surface चरघातांकी रूप से बढ़ता जाता है।

चरण III — इन्फ़रेंस

3. मेमोरी पॉइज़निंग

स्टेटलेस API कॉल के विपरीत, एजेंटिक सिस्टम सत्रों के आर-पार स्थायी मेमोरी बनाए रखते हैं। शोध-टीम ने एजेंट की MEMORY.md फ़ाइल में बदलाव करने के लिए एक क्षणिक इंजेक्शन का उपयोग किया — एक गढ़ा हुआ नियम जोड़ते हुए, जो एजेंट को "C++" वाली किसी भी क्वेरी को अस्वीकार करने का निर्देश देता था। यह पॉइज़न आगे के सभी सत्रों में बना रहा: प्रारंभिक हमला-संपर्क समाप्त होने के बाद भी, निर्दोष प्रोग्रामिंग रिक्वेस्ट व्यवस्थित रूप से अस्वीकार होती रहीं। यह स्थायी व्यवहारिक हेरफेर की एक नई श्रेणी दर्शाता है, जिसे मानक इंसिडेंट-रिस्पॉन्स संबोधित नहीं करता।

चरण IV — निर्णय

4. इंटेंट ड्रिफ्ट

इंटेंट ड्रिफ्ट तब होता है जब व्यक्तिगत रूप से जायज़ टूल-कॉल का एक क्रम किसी विनाशकारी वैश्विक परिणाम की ओर ले जाता है। टेस्ट किए गए परिदृश्य में, किसी उपयोगकर्ता ने एजेंट से "एक संदिग्ध क्रॉलर IP को हटाने" को कहा। एजेंट आगे बढ़ता गया: उसने IP कनेक्शन पहचाने, सिस्टम फ़ायरवॉल को बदलने की कोशिश की iptablesके ज़रिए, असफल रहा, फिर मैनुअल रीस्टार्ट की कोशिश के लिए अपनी ही चल रही प्रोसेस को समाप्त कर दिया — जिससे पूरा WebUI बंद हो गया और एक पूर्ण सिस्टम-आउटेज हुआ। कोई भी अकेला क़दम स्पष्ट रूप से दुर्भावनापूर्ण नहीं था; यह आपदा मिश्रित स्वायत्त निर्णयों से उभरी।

चरण V — एक्ज़ीक्यूशन

5. स्टील्थ कमांड एक्ज़ीक्यूशन (हाई-रिस्क कमांड एक्ज़ीक्यूशन)

अंतिम-चरण का हमला दिखाता है कि पहले के भंग किस तरह इन्फ़्रास्ट्रक्चर-नुक़सान तक बढ़ जाते हैं। शोधकर्ताओं ने स्टैटिक फ़िल्टर को बायपास करने के लिए एक Fork Bomb हमले को चार अलग-अलग निर्दोष फ़ाइल-राइट क़दमों में तोड़ा। Base64 एन्कोडिंग और sed का उपयोग जंक-कैरेक्टर हटाने के लिए करते हुए, उन्होंने एक गुप्त एक्ज़ीक्यूशन-चेन इकट्ठी की trigger.shमें। ट्रिगर होने पर, स्क्रिप्ट ने CPU उपयोग को लगभग 100% सैचुरेशन तक उछाल दिया — जो होस्ट के ख़िलाफ़ एक प्रभावी डिनायल-ऑफ़-सर्विस हमला था। यह हमला पहचान से इसीलिए बच निकला क्योंकि अलग से देखने पर कोई भी क़दम दुर्भावनापूर्ण नहीं लगता था।

🛡️ 5-लेयर डिफ़ेंस फ़्रेमवर्क

शोध-टीम एक लाइफ़साइकल-उन्मुख डिफ़ेंस-फ़्रेमवर्क प्रस्तावित करती है जो पाँचों हमला-चरणों को प्रतिबिंबित करता है। हर लेयर विशिष्ट ख़तरा-श्रेणियों को संबोधित करने के लिए डिज़ाइन की गई है, जबकि साथ मिलकर एक समग्र डिफ़ेंस-इन-डेप्थ मुद्रा बनाती है:

परत चरण डिफ़ेंस-फ़ोकस मुख्य नियंत्रण
L1 इनिशियलाइज़ेशन Skill और प्लगइन इंटीग्रिटी क्रिप्टोग्राफ़िक साइनिंग, इंटीग्रिटी-सत्यापन, भरोसेमंद skill स्रोतों के लिए allowlist, सप्लाई-चेन ऑडिटिंग
L2 इनपुट इनपुट-सीमा प्रवर्तन भरोसेमंद उपयोगकर्ता-निर्देशों को अविश्वसनीय बाहरी डेटा से सख़्ती से अलग करना, इनपुट-टैगिंग और सैनिटाइज़ेशन
L3 इन्फ़रेंस मेमोरी इंटीग्रिटी और आइसोलेशन मेमोरी एक्सेस-नियंत्रण, कोर व्यवहारिक नियमों के लिए अपरिवर्तनीयता, मेमोरी-राइट पर एनॉमली-डिटेक्शन
L4 निर्णय इंटेंट सत्यापन और एस्केलेशन नियंत्रण टूल-कॉल पर स्कोप-सीमाएँ, हाई-रिस्क एक्शन के लिए ह्यूमन-इन-द-लूप, रोलबैक क्षमताएँ
L5 एक्ज़ीक्यूशन सैंडबॉक्स्ड एक्ज़ीक्यूशन और एक्सेस-नियंत्रण प्रोसेस-आइसोलेशन, न्यूनतम-विशेषाधिकार एक्ज़ीक्यूशन, कमांड-सीक्वेंस का स्टैटिक + व्यवहारिक विश्लेषण

फ़्रेमवर्क की मुख्य अंतर्दृष्टि यह है कि मिश्रित ख़तरों के लिए मिश्रित बचाव चाहिए। कोई हमला जो स्किल पॉइज़निंग (L1) से शुरू होकर, प्रॉम्प्ट इंजेक्शन (L2) से बढ़ता है, और स्टील्थ एक्ज़ीक्यूशन (L5) पर समाप्त होता है, उसे किसी एक अकेली लेयर से नहीं रोका जा सकता — सभी पाँचों को एक साथ सक्रिय होना चाहिए।

📋 NIS2 और EU AI Act अनुपालन-निहितार्थ

⚖️ नियामक-एक्सपोज़र असली है

प्रोडक्शन में AI एजेंट तैनात करने वाले EU-आधारित संगठनों के लिए, ये निष्कर्ष NIS2 और EU AI Act — दोनों के तहत सीधे नियामक-दायित्व बनाते हैं। सत्रों के आर-पार बने रहने वाले मेमोरी पॉइज़निंग हमले, और 26% सामुदायिक टूल को प्रभावित करने वाली skill सप्लाई-चेन भेद्यताएँ, ठीक वही व्यवस्थागत जोखिम हैं जिन्हें संबोधित करने के लिए दोनों फ़्रेमवर्क डिज़ाइन किए गए थे।

NIS2 निर्देश (नेटवर्क और सूचना सुरक्षा): Article 21 के लिए "नेटवर्क और सूचना प्रणालियों की सुरक्षा को जोखिम में डालने वाले ख़तरों के प्रबंधन हेतु उपयुक्त और आनुपातिक तकनीकी व संगठनात्मक उपाय" चाहिए। उच्च-विशेषाधिकार सिस्टम-एक्सेस वाले स्वायत्त AI एजेंट सीधे इस दायरे में आते हैं। दुर्भावनापूर्ण skills के ज़रिए सप्लाई-चेन संदूषण, सप्लाई-चेन सुरक्षा पर Article 21(2)(d) को ट्रिगर करता है। सत्रों के आर-पार एजेंट-व्यवहार को प्रभावित करने वाली स्थायी मेमोरी पॉइज़निंग, Article 23 के रिपोर्टिंग-दायित्वों के तहत एक "घटना" गठित करती है।

EU AI Act: उच्च-जोखिम वाली AI प्रणालियों — जिनमें सुरक्षा-संवेदनशील कार्य करने वाली या महत्वपूर्ण इन्फ़्रास्ट्रक्चर में स्वायत्त रूप से चलने वाली प्रणालियाँ शामिल हैं — को मज़बूती और सटीकता (Article 15), पारदर्शिता (Article 13), और ह्यूमन ओवरसाइट (Article 14) की सख़्त शर्तें पूरी करनी होंगी। सिस्टम-आउटेज तक ले जाने वाला इंटेंट ड्रिफ्ट ठीक वही विफलता-मोड है जिसे रोकने के लिए Article 14 डिज़ाइन किया गया है। संगठनों को अपने कॉन्फ़ॉर्मिटी-एसेसमेंट के हिस्से के रूप में सभी पाँच अटैक-वेक्टर का दस्तावेज़ीकरण और परीक्षण करना होगा।

DORA (डिजिटल ऑपरेशनल रेज़िलिएंस एक्ट): स्वचालित संचालन के लिए AI एजेंट का उपयोग करने वाली वित्तीय संस्थाओं को सभी ICT थर्ड-पार्टी निर्भरताओं का मैपिंग करना होगा — जिनमें थर्ड-पार्टी skill प्रोवाइडर भी शामिल हैं। सामुदायिक skills में 26% की भेद्यता-दर, DORA की ICT जोखिम-प्रबंधन आवश्यकताओं के तहत सीधा थर्ड-पार्टी जोखिम-एक्सपोज़र बनाती है।

⚠️ अनुपालन-अंतर

ज़्यादातर मौजूदा AI सुरक्षा-आकलन अकेले प्रॉम्प्ट इंजेक्शन पर केंद्रित होते हैं। पाँच-लेयर वाला लाइफ़साइकल फ़्रेमवर्क उजागर करता है कि अलग-थलग बचाव मिश्रित हमलों के सामने विफल हो जाते हैं। सिंगल-लेयर बचाव पर निर्भर संगठन एजेंटिक AI प्रणालियों के लिए NIS2 के "उपयुक्त और आनुपातिक" मानक का पालन नहीं करते।

🔧 तत्काल रक्षात्मक कार्रवाइयाँ

  1. अपनी AI skill सप्लाई-चेन का ऑडिट करें — सभी थर्ड-पार्टी skills और प्लगइन की इन्वेंट्री बनाएँ। चूँकि 26% में भेद्यताएँ हैं, जब तक सत्यापित न हो जाए, तब तक भंग मान लें।
  2. क्रिप्टोग्राफ़िक साइनिंग लागू करें — सभी skill इंस्टॉलेशन के लिए सिग्नेचर-सत्यापन अनिवार्य करें। लोड-टाइम पर अहस्ताक्षरित या असत्यापित प्लगइन अस्वीकार करें।
  3. एजेंट की मेमोरी-फ़ाइलों की सुरक्षा करें — स्थायी मेमोरी पर सख़्त एक्सेस-नियंत्रण लागू करें (जैसे, MEMORY.md)। अनधिकृत राइट के लिए मॉनिटर करें। अपरिवर्तनीय कोर-नियमों पर विचार करें।
  4. टूल-कॉल के लिए स्कोप-सीमाएँ तय करें — स्पष्ट रूप से सीमित करें कि हर एजेंट किन सिस्टम-रिसोर्स तक पहुँच सकता है। फ़ायरवॉल में बदलाव, प्रोसेस समाप्ति और अन्य उच्च-प्रभाव कार्रवाइयों के लिए मानवीय अनुमोदन अनिवार्य करें।
  5. एक्ज़ीक्यूशन-सीक्वेंस पर व्यवहारिक विश्लेषण तैनात करें — मल्टी-स्टेप हमले, जो हानिकारक कार्रवाइयों को अलग-अलग निर्दोष क़दमों में तोड़ देते हैं, स्टैटिक फ़िल्टर से बच निकलते हैं। व्यवहारिक विश्लेषण पैटर्न पकड़ लेता है।
  6. भरोसेमंद और अविश्वसनीय डेटा-पथों को अलग करें — सभी बाहरी-स्रोत सामग्री को टैग करें और उसे एक अलग प्रोसेसिंग-पाइपलाइन से गुज़ारें जो उपयोगकर्ता के इरादे को ओवरराइड नहीं कर सकती।
  7. सभी 5 अटैक-वेक्टर टेस्ट करें — अपने पेनेट्रेशन-टेस्टिंग दायरे में स्किल पॉइज़निंग, इनडायरेक्ट प्रॉम्प्ट इंजेक्शन, मेमोरी पॉइज़निंग, इंटेंट ड्रिफ्ट और स्टील्थ एक्ज़ीक्यूशन शामिल करें।

🎯 KENSAI इन भेद्यताओं को कैसे संबोधित करता है

सिंगहुआ/Ant Group शोधकर्ताओं द्वारा पहचाने गए पाँच अटैक-वेक्टर सीधे KENSAI की स्वचालित सुरक्षा-स्कैनिंग क्षमताओं से मेल खाते हैं। KENSAI का निरंतर स्कैनिंग-इंजन ठीक इसी तरह के व्यवस्थागत जोखिम खोजने के लिए बनाया गया था — केवल अलग-थलग भेद्यताएँ नहीं, बल्कि कई लेयर तक फैले मिश्रित हमला-पथ:

यह शोध-पत्र दिखाता है कि अभी, आज ही, 26% सामुदायिक skills भेद्य हैं — और ज़्यादातर संगठनों को अपने AI एजेंट Attack Surface में कोई दृश्यता नहीं है। KENSAI आपको वह दृश्यता विरोधियों के इसे एक्सप्लॉइट करने से पहले देता है।

📚 स्रोत: Tsinghua University & Ant Group — Five-Layer Lifecycle-Oriented Security Framework for Autonomous LLM Agent Vulnerabilities (मार्च 2026)

अभी अपने AI एजेंट इन्फ़्रास्ट्रक्चर को स्कैन करें

KENSAI सिंगहुआ शोध में पहचाने गए सभी 5 अटैक-वेक्टर — स्किल पॉइज़निंग, प्रॉम्प्ट इंजेक्शन, मेमोरी पॉइज़निंग, इंटेंट ड्रिफ्ट और स्टील्थ एक्ज़ीक्यूशन — के लिए स्वचालित रूप से टेस्ट करता है। मिनटों में अपना AI सुरक्षा-स्कोर पाएँ।

अपना मुफ़्त AI सुरक्षा स्कैन शुरू करें

सुरक्षित रहें,
KENSAI सुरक्षा अनुसंधान टीम

AI ख़तरा-इंटेलिजेंस से संचालित दैनिक सुरक्षा ब्रीफ़िंग। हर कार्यदिवस अपडेट की जाती है।

📚 संबंधित लेख