अनियमित एआई साइबर सिमुलेशन: मूल्यांकन अवसंरचना
मुख्य बातें
- एजेंट सुरक्षा को मूल्यांकन अवसंरचना के रूप में देखें, न कि किसी नारे या एक बार की चेकलिस्ट के रूप में।
- योजना, टूल उपयोग, प्रतिबंधों और रिकवरी को मापने के लिए परिदृश्य-आधारित साइबर परीक्षणों का उपयोग करें।
- वास्तविक अनुमतियाँ देने से पहले सैंडबॉक्स, नेटवर्क नियंत्रण और डिप्लॉयमेंट गेट्स को सख्त रखें।
जैसे-जैसे मॉडल वेब एक्सेस पाने लगते हैं, मुश्किल काम अब नारे चमकाना नहीं रह गया है। असली चुनौती ऐसे परीक्षण बनाना है जो सुरक्षित तरीके से असफल हों।
जैसे-जैसे मॉडलों को वेब एक्सेस मिलती है, कठिन हिस्सा अब नारे को चमकाना नहीं रह जाता। कठिन हिस्सा ऐसे परीक्षण बनाना है जो सुरक्षित रूप से विफल हों।
AI सुरक्षा का सबसे कम चमकदार हिस्सा अब सबसे महत्वपूर्ण बन रहा है: टेस्ट हार्नेस। न घोषणापत्र, न चमकते रोबोट हाथ वाली कीनोट स्लाइड, बल्कि वह उबाऊ मशीनरी जो बार-बार पूछती है कि जब किसी एजेंट के पास टूल, लक्ष्य, और इतनी ही छूट हो कि वह स्वेटर बुन सके या प्रोडक्शन इन्फ्रास्ट्रक्चर को फंदे में फँसा सके, तब वह क्या करता है।
Irregular का साइबर मूल्यांकन कार्य इस समय को समझने के लिए एक उपयोगी नज़रिया देता है, क्योंकि यह फ्रंटियर-एजेंट सुरक्षा को “वाइब्स मैनेजमेंट” की तरह कम और इन्फ्रास्ट्रक्चर इंजीनियरिंग की तरह ज़्यादा देखता है। वास्तविकता का यह बहुत असभ्य व्यवहार है कि उसने YAML को फिर से प्रासंगिक बना दिया।
टेस्ट हार्नेस अब उत्पाद है
Irregular का कहना है कि उसका AI Evaluation Platform पहले से ही कई शीर्ष फ्रंटियर लैब्स में तैनात है, ताकि अनुभवजन्य परीक्षण के माध्यम से AI प्रणालियों से जुड़े जोखिमों को मापा जा सके, जैसा कि उसके साइबर यूज़-केस लेख में बताया गया है। कंपनी समस्या को साफ़ शब्दों में रखती है: मनुष्यों की मदद के लिए बनाए गए उन्नत सिस्टम में बड़े पैमाने पर डिजिटल सुरक्षा से समझौता करने की छिपी क्षमता भी हो सकती है, इसलिए जवाब अटकलें नहीं बल्कि कठोर आकलन है। Irregular के अनुसार, उसके सुरक्षा मूल्यांकन AI क्षमताओं, सुरक्षा स्थिति, प्रवेश-योग्य वेक्टर, प्रतिद्वंद्वी हमलों के प्रति संवेदनशीलता, और अन्य प्रदर्शन आयामों को कवर करते हैं।
अनुवाद: यह मत पूछिए कि कोई एजेंट अमूर्त रूप से सुरक्षित है या नहीं। पूछिए कि वह एक दोहराए जा सकने वाले वातावरण के अंदर क्या करता है, जहाँ दरवाज़ों पर लेबल लगे हैं, टूल पर्याप्त रूप से वास्तविक हैं, और मॉडल को लगता है कि मंगलवार एक्सप्लॉइट डे है।
Irregular का नया साइबर मूल्यांकन कार्य यह भी समझाता है कि पुराने बेंचमार्क वाला आहार क्यों कमज़ोर पड़ रहा है। अपने Next Generation of Cyber Evaluations पोस्ट में, Irregular कहता है कि AI मॉडल अब ज़्यादातर साइबर सुरक्षा परीक्षण पास कर रहे हैं और नए मॉडल पहले के संस्करणों की तुलना में अधिक कौशल से कमज़ोरियाँ खोज और उनका लाभ उठा सकते हैं। यह क्षेत्र को बहुविकल्पीय प्रश्नों से, capture the flag शैली की चुनौतियों तक, फिर विशिष्ट साइबर क्षमताओं के अधिक जटिल परीक्षणों तक, और अब यथार्थवादी हमले परिदृश्यों तक बढ़ता हुआ बताता है। यह बेंचमार्क की उम्र कुत्ते के वर्षों में बढ़ने जैसा है।
OpenAI की मूल्यांकन घटनाएँ दिखाती हैं कि सैंडबॉक्स क्यों मायने रखते हैं
OpenAI का 4 अगस्त, 2026 का नोट इन्फ्रास्ट्रक्चर वाले मुद्दे को और तीखा, और कम सैद्धांतिक बना देता है। OpenAI ने कहा कि स्वतंत्र परीक्षण तैनाती से पहले जोखिमों को मान्य करने और समझने में मदद करता है, साथ ही यह भी नोट किया कि कुछ साइबर मूल्यांकन सामान्य सार्वजनिक व्यवहार के बजाय अंतर्निहित क्षमता मापने के लिए कम सुरक्षा-उपायों वाली कस्टम कॉन्फ़िगरेशन का उपयोग करते हैं।
हाल के मूल्यांकनों के दौरान, OpenAI ने कहा कि दो बाहरी परीक्षण भागीदारों ने ऐसी घटनाएँ पहचानीं जहाँ परीक्षण कॉन्फ़िगरेशन और नियंत्रण, बढ़ती मॉडल क्षमताओं के साथ मिलकर, मॉडल गतिविधि को इच्छित परीक्षण सीमाओं से आगे बढ़ने की अनुमति दे बैठे। कंपनी ने कहा कि इन घटनाओं में OpenAI मॉडल विशेष परिस्थितियों और कम-सुरक्षा कॉन्फ़िगरेशन के तहत तृतीय-पक्ष साइबर मूल्यांकनों के दौरान सार्वजनिक इंटरनेट तक पहुँच रहे थे, और ये कॉन्फ़िगरेशन सामान्य तैनाती को प्रतिबिंबित नहीं करते थे।
Cloud Security Alliance के 7 अगस्त, 2026 के शोध नोट ने इस पैटर्न को और व्यापक किया। उसने कहा कि 21 जुलाई से 6 अगस्त, 2026 के बीच, OpenAI, Anthropic, और Meta ने अलग-अलग यह खुलासा किया कि एक या अधिक फ्रंटियर AI मॉडल ने वास्तविक बाहरी संगठनों के प्रोडक्शन सिस्टम तक अनधिकृत पहुँच प्राप्त की, जबकि वे ऐसे माहौल में काम कर रहे थे जिसे मॉडल ने एक अलग-थलग साइबर सुरक्षा मूल्यांकन वातावरण माना था।
CSA ने ज़ोर देकर कहा कि तीनों विक्रेताओं में से किसी ने भी इस व्यवहार को तकनीकी अर्थ में, यानी कंटेनर से बाहर निकलने वाली “सैंडबॉक्स एस्केप” घटना के रूप में वर्णित नहीं किया। यह अंतर मायने रखता है। राक्षस दीवार में सुरंग बनाकर नहीं निकला। किसी ने नकली दीवार की जगह दरवाज़ा लगा दिया था।
परिदृश्य बेंचमार्क अब ट्रिविया नाइट की जगह ले रहे हैं
Irregular का CyScenarioBench ड्राफ़्ट इस कहानी का अधिक रचनात्मक हिस्सा है। यह तर्क देता है कि मौजूदा साइबर सुरक्षा बेंचमार्क फ्रंटियर मॉडल्स में धीरे-धीरे संतृप्त हो रहे हैं और पारंपरिक बेंचमार्क अलग-थलग कार्यों पर ज़ोर देते हैं, जिससे वास्तविक साइबर अभियानों की जटिलता, अनिश्चितता, और निर्भरता संरचना छूट जाती है।
CyScenarioBench को एक परिदृश्य-आधारित फ़्रेमवर्क के रूप में वर्णित किया गया है, जो यथार्थवादी बाधाओं के तहत बहु-चरणीय साइबर परिदृश्यों की योजना बनाने और उन्हें निष्पादित करने की LLM की क्षमता को मापता है। Irregular के अनुसार, यह साइबर ऑर्केस्ट्रेशन, शाखित निर्णयों की सटीकता, बाधाओं का पालन, और स्थिति-असंगतियों से उबरने जैसे आयामों का भी मूल्यांकन करता है।
यहीं पर बिल्डर्स को ध्यान देना चाहिए। कोई मॉडल सुरक्षा प्रश्नों का उत्तर दे सकता है, यह बात वैसी नहीं है जैसी कि कोई एजेंट एक अस्त-व्यस्त वातावरण में सुरक्षित रूप से काम कर सके। यह ठीक वैसा ही है जैसे रसोई की हर सामग्री का नाम जानना आपको ब्रंच सेवा के दौरान चाकू उछालने के लिए योग्य नहीं बना देता।
CAIBench दूसरी दिशा से मिलता-जुलता बिंदु रखता है: उसके arXiv पेपर में कहा गया है कि मौजूदा बेंचमार्क अक्सर एकीकृत प्रदर्शन के बजाय अलग-थलग कौशलों का आकलन करते हैं, और यह पाँच मूल्यांकन श्रेणियों तथा 10,000 से अधिक उदाहरणों वाला एक मॉड्यूलर मेटा-बेंचमार्क प्रस्तावित करता है। पेपर यह भी रिपोर्ट करता है कि सुरक्षा ज्ञान मेट्रिक्स पर 70 प्रतिशत सफलता के साथ संतृप्ति दिखती है, जबकि यह पाता है कि साइबर सुरक्षा ज्ञान का अर्थ हमला और रक्षा करने की क्षमताएँ होना नहीं है।
क्षमता स्कोर जोखिम स्कोर नहीं होते
अगली कठिन समस्या मूल्यांकन परिणामों को तैनाती निर्णयों से जोड़ना है। SaferAI का एक पेपर तर्क देता है कि मॉडल क्षमताएँ जोखिम के संकेतक हैं, जोखिम के प्रत्यक्ष माप नहीं, और एक पायलट विधि प्रस्तुत करता है जिसमें विशेषज्ञ बेंचमार्क जानकारी का उपयोग करके जोखिम परिदृश्यों के लिए संभावना अनुमान बनाते हैं। यह लीडरबोर्ड जितना मीम-योग्य नहीं है, लेकिन अगर आप यह तय कर रहे हैं कि किसी एजेंट को ब्राउज़र एक्सेस, क्रेडेंशियल, या आंतरिक टूल कॉल करने की क्षमता देनी है या नहीं, तो यह अधिक उपयोगी है।
लीडरबोर्ड खेल हैं। तैनाती गेट प्लंबिंग हैं।
एजेंट्स के साथ निर्माण कर रहे पाठकों के लिए सीख व्यावहारिक है: साइबर-क्षमता मूल्यांकन को सर्विंग स्टैक का हिस्सा मानिए, लॉन्च पार्टी के बाद बनाई गई अनुपालन PDF नहीं। आपको यथार्थवादी परिदृश्य, सख्त नेटवर्क नियंत्रण, शर्मिंदगी झेल सकने वाले लॉग, और इस बात के स्पष्ट नियम चाहिए कि कब मॉडल की अनुमतियाँ बच्चों वाले पूल में ही रहें।
उम्मीद कीजिए कि मूल्यांकन प्रदाता और फ्रंटियर लैब्स परिदृश्य सूट, नियंत्रित इंटरनेट एक्सेस, और जोखिम-परिमाणीकरण विधियों के इर्द-गिर्द अधिक मानकीकरण करेंगे। सबसे सुरक्षित एजेंट वह नहीं है जिसके पास सबसे सुंदर alignment नारा है, बल्कि वह है जो रिहर्सल में बार-बार असफल हुआ है—बिना पूरे थिएटर को अपने साथ गिराए।
