
इस लेख में (4)
AI मॉडल नियम सुरक्षा नियंत्रण नहीं हैं: विश्लेषण
मुख्य बातें
- सिस्टम प्रॉम्प्ट को अनुमति सीमा के रूप में न मानें।
- नियंत्रण वहाँ लगाएँ जहाँ एजेंट टूल्स, डेटा, मेमोरी और वर्कफ़्लो के संपर्क में आते हैं।
- एजेंट की कार्रवाइयों का लगातार ऑडिट करें, क्योंकि सक्षम सिस्टम ऐसे रास्ते खोज सकते हैं जिन्हें डिज़ाइनरों ने नहीं सोचा था।
सुरक्षित एजेंटों के लिए अलगाव, अनुमतियाँ, निगरानी और नियंत्रण-सीमाएँ चाहिए, केवल सुंदर शब्दों में लिखे सिस्टम प्रॉम्प्ट नहीं।
सुरक्षित एजेंट्स के लिए अलगाव, अनुमतियाँ, निगरानी और नियंत्रण ज़रूरी हैं, केवल सुंदर शब्दों वाले सिस्टम प्रॉम्प्ट्स नहीं।
एजेंटिक AI सुरक्षा की सबसे अजीब बात यह है कि कोई मॉडल नियम जान सकता है, नियम दोहरा सकता है, नियम की तारीफ़ कर सकता है, और फिर भी स्टाफ बैज पहने रैकून की तरह प्रोडक्शन में भटक सकता है। यह खलनायकी नहीं है। यह आर्किटेक्चर का व्याख्यात्मक नृत्य करना है। सिस्टम प्रॉम्प्ट उपयोगी मार्गदर्शन है, लेकिन अगर आपका एजेंट टूल्स, डेटा और APIs को छू सकता है, तो मार्गदर्शन ताले के समान नहीं होता।
डार्क रीडिंग कहता है कि आज्ञापालन कोई सीमा नहीं है
डार्क रीडिंग अपनी बात सीधे शीर्षक में रखता है: AI Model Rules Are Not Security Controls. यह वाक्य एक स्टिकर पर छपना चाहिए और हर उस एजेंट डेमो पर चिपका देना चाहिए जहाँ सुरक्षा की कहानी एक सख्त सिस्टम प्रॉम्प्ट से शुरू होकर वहीं खत्म हो जाती है। समस्या यह नहीं है कि निर्देश बेकार हैं; वे अक्सर व्यवहार को आकार देने की पहली परत होते हैं। समस्या यह है कि निर्देश अनुमतियाँ लागू नहीं करते, जब कोई एजेंट चैट बॉक्स के बाहर कार्रवाइयाँ कर सकता है।
Domino Data Lab समझाता है कि एजेंट जब प्रॉम्प्ट के जवाब से आगे बढ़कर प्रोडक्शन वर्कफ़्लो में जाते हैं, तो जोखिम प्रोफ़ाइल क्यों बदल जाती है। Domino के अनुसार, एजेंट बहुत कम मानवीय इनपुट के साथ योजना बना सकते हैं, निर्णय ले सकते हैं, और काम कर सकते हैं, जबकि वे रियल टाइम में टूल्स, APIs, और डेटा को जोड़ते रहते हैं। Domino यह भी कहता है कि सबसे बड़े जोखिमों में डेटा लीक, मुख्य प्रणालियों में गलत बदलाव, अनधिकृत पहुँच, कार्रवाइयों में कम दृश्यता, और बेकाबू लागत या देरी शामिल हैं। अनुवाद: एक चैटबॉट आपको शर्मिंदा कर सकता है; एक एजेंट कागज़ी कार्यवाही भी जमा कर सकता है।
Cycode सुरक्षा को कार्रवाई की सतह पर ले जाता है
Cycode एजेंटिक AI सुरक्षा को स्वायत्त AI एजेंटों और उन प्रणालियों को सुरक्षित करने के रूप में परिभाषित करता है जिनसे वे इंटरैक्ट करते हैं, खासकर तब जब एजेंट लगातार मानवीय निगरानी के बिना एंटरप्राइज़ वातावरणों में योजना बनाते, तर्क करते, और कार्रवाई करते हैं। यह परिभाषा महत्वपूर्ण है क्योंकि यह परिधि को मॉडल के टेक्स्ट से मॉडल के व्यवहार तक ले जाती है। अगर एजेंट मेमोरी पढ़ सकता है, टूल कॉल कर सकता है, या वर्कफ़्लो ट्रिगर कर सकता है, तो सुरक्षा का सवाल अब यह नहीं है कि क्या हमने उसे अच्छे से समझाया। सवाल यह है कि जब विनम्रता की सड़क खत्म हो जाती है, तब वह वास्तव में क्या कर सकता है।
Cycode यह भी कहता है कि नियंत्रण एजेंट के तर्क, मेमोरी, और आउटपुट तक फैलने चाहिए ताकि एजेंट दुरुपयोग, अनधिकृत डेटा पहुँच, या ऐसी कार्रवाइयों के लिए नए रास्ते न बना दें जो होनी ही नहीं चाहिए। यहीं इंजीनियरिंग का काम सौभाग्य से उबाऊ हो जाता है, जो सुरक्षा में आमतौर पर अच्छा संकेत होता है। टूल सीमाओं पर अनुमतियाँ लगाएँ, एजेंट कौन-सा डेटा ला सकता है उसे सीमित करें, टूल कॉल लॉग करें, और ऐसे फेल्यर मोड डिज़ाइन करें जो बिलिंग सिस्टम के बजाय ब्लास्ट डोर पर रुकें। प्रॉम्प्ट शिष्टाचार पुस्तिका हैं; अनुमतियाँ दरवाजे का बाउंसर हैं।
Arkose Labs का तर्क है कि केवल पहचान पर्याप्त नहीं है
Arkose Labs चेतावनी देता है कि एजेंटिक AI सुरक्षा श्रेणी गलत उत्तर की ओर बढ़ रही है, जब वह पहचान और भरोसे को पर्याप्त मान लेती है। अपने विश्लेषण में, Arkose Labs कहता है कि एजेंटिक हमलावर पारंपरिक बॉट टूलिंग से अलग हैं क्योंकि उनमें स्वायत्त पुनरावृत्ति, सत्र-दर-सत्र सीखना, और इंटरैक्शन लेयर पर पहचान की नकल करना शामिल है। यह रक्षकों के लिए उपयोगी चेतावनी है क्योंकि एजेंट सिस्टम सिर्फ नए यूज़र इंटरफ़ेस नहीं हैं। वे ऐसे लूप हैं जो अनुकूलित हो सकते हैं, फिर से कोशिश कर सकते हैं, और धारणाओं के आसपास रास्ता निकाल सकते हैं, पानी की तरह, बस फर्क इतना है कि इस पानी के पास OAuth स्कोप्स हैं।
एजेंटिक AI जोखिम पर Springer का शोध अकादमिक पक्ष से मिलते-जुलते आर्किटेक्चरल निष्कर्ष पर पहुँचता है। पेपर कहता है कि एजेंटिक सिस्टम आर्किटेक्चरल जटिलता, स्वायत्त निर्णय-निर्माण, अनुकूलनशील व्यवहार, और टूल्स का उपयोग करके वातावरणों से इंटरैक्ट करने की क्षमता को मिलाते हैं, जिससे नए और कम समझे गए सुरक्षा जोखिम पैदा होते हैं। यह मौजूदा शोध और जोखिम प्रबंधन फ़्रेमवर्क को भी इन कमजोरियों के लिए अभी शुरुआती अवस्था में बताता है, और एक परतदार जोखिम आकलन पद्धति प्रस्तावित करता है। परतदार ही मुख्य शब्द है: मॉडल निर्देश, पहचान जाँच, एक्सेस कंट्रोल, ऑब्ज़र्वेबिलिटी, और कंटेनमेंट सभी को एक स्टैक की तरह सहयोग करना चाहिए, अलग-अलग Slack चैनलों में बैठे पाँच इंटर्न की तरह नहीं।
इंटरनेशनल AI सेफ़्टी रिपोर्ट कहती है कि क्षमता बढ़ने पर निगरानी कठिन हो जाती है
इंटरनेशनल AI सेफ़्टी रिपोर्ट कहती है कि नई प्रशिक्षण तकनीकों ने, जो AI सिस्टम को अधिक कंप्यूटिंग शक्ति इस्तेमाल करने देती हैं, उन्हें गणित, कोडिंग, और वैज्ञानिक विषयों में अधिक जटिल समस्याएँ हल करने में मदद की है। रिपोर्ट यह भी कहती है कि इन क्षमता सुधारों के जोखिमों पर प्रभाव हैं, जिनमें साइबर हमले भी शामिल हैं, और वे निगरानी और नियंत्रणीयता के लिए नई चुनौतियाँ पैदा करते हैं। यही वह हिस्सा है जिसे बिल्डरों को रेखांकित करना चाहिए, फिर थोड़े अधिक चिंतित पेन से दोबारा रेखांकित करना चाहिए। अधिक सक्षम एजेंट अपने-आप असुरक्षित नहीं होते, लेकिन वे आलसी कंट्रोल प्लेन को GPU क्लस्टर में रखे दूध की तरह जल्दी खराब दिखा देते हैं।
Checkmarx AI एजेंट सुरक्षा को जोखिमों, नियंत्रणों, और सर्वोत्तम प्रथाओं के इर्द-गिर्द समझाता है, जो डिप्लॉयमेंट से पहले टीमों के लिए बिल्कुल सही मानसिक मॉडल है। व्यावहारिक सीख सरल है: एजेंट को विशेषाधिकारों वाले सॉफ़्टवेयर की तरह मानें, महत्वाकांक्षाओं वाले चैटबॉट की तरह नहीं। उसे केवल उतनी ही पहुँच दें जितनी उसे चाहिए, संवेदनशील कार्रवाइयों को अलग रखें, महत्वपूर्ण टूल कॉल के लिए अनुमोदन आवश्यक करें, वह वास्तव में क्या करता है उसकी निगरानी करें, और उस समय के लिए कंटेनमेंट रास्ते तैयार रखें जब मॉडल वह एक वर्कफ़्लो खोज ले जिसे किसी ने डायग्राम नहीं किया था। अगर आपका सुरक्षा नियंत्रण प्रॉम्प्ट में लिखा एक वाक्य है, तो आपने नियंत्रण नहीं बनाया है; आपने दृढ़ शब्दों में लिखी एक इच्छा लिखी है।
जो पाठक अभी एजेंट बना रहे हैं, उनके लिए अगला उपयोगी प्रयोग एक और प्रॉम्प्ट री-राइट नहीं है। यह अनुमतियों की समीक्षा, टूल कॉल ऑडिट, और यह परीक्षण है कि जब एजेंट कुछ अप्रत्याशित करने की कोशिश करता है तो क्या होता है। सुरक्षित एजेंट वह नहीं है जो अच्छे व्यवहार का वादा करता है; वह है जो रसोई को जला नहीं सकता, भले ही उसे लगे कि रेसिपी में आतिशबाज़ी चाहिए।