Anthropic AI परीक्षण: नियंत्रण विश्लेषण
मुख्य बातें
- मूल्यांकन रिपोर्टों को नियंत्रण के प्रमाण के रूप में न मानें। सीमाओं, अनुमतियों, लॉग और रोकने की प्रक्रियाओं के बारे में पूछें।
- अनुपालन या खरीद संबंधी निर्णय लेने से पहले सत्यापित तथ्यों को वायरल दावों से अलग करें।
- एजेंटिक एआई परीक्षण में उपकरणों के वास्तविक प्रणालियों को छूने से पहले अधिकृत लक्ष्यों, सीमित दायरे वाले क्रेडेंशियल्स और ऑडिट ट्रेल्स का उपयोग होना चाहिए।
Anthropic सुरक्षा विवाद से उपयोगी सीख व्यावहारिक है: एजेंट मूल्यांकनों को स्पष्ट सीमाओं, लॉग्स और रोकने के नियंत्रणों की आवश्यकता होती है।
Anthropic सुरक्षा विवाद से उपयोगी सीख संचालन से जुड़ी है: एजेंट मूल्यांकन में स्पष्ट सीमाएँ, लॉग और रोकने के नियंत्रण होने चाहिए।
सबसे साफ़ सुरक्षा चार्ट कोई फ़ायरवॉल नहीं होता। एक बार किसी AI एजेंट के पास टूल, क्रेडेंशियल, फ़ाइलें, या नेटवर्क एक्सेस आ जाता है, तो मूल्यांकन एक क्विज़ नहीं रह जाता और एक ऑपरेशन जैसा दिखने लगता है। यहीं Anthropic विवाद उपयोगी है, बशर्ते हम यह दिखावा न करें कि सार्वजनिक रिकॉर्ड उससे ज़्यादा साबित करता है जितना वह सच में करता है। Anthropic के आसपास की कुछ टिप्पणियाँ उपलब्ध सबूतों से आगे निकल गई हैं। इस संक्षेप में उद्धृत की जा सकने वाली सामग्री आर्किटेक्चर, खुलासे, सुरक्षा दावों, और सरकारी प्रतिक्रिया को लेकर चिंता का समर्थन करती है। यह स्थापित नहीं करती कि किसी मॉडल ने असली दुनिया में तीन संगठनों में घुसपैठ करवाई। नीति-कार्य यहीं से शुरू होता है: घटना की फ़ाइल को ग्रुप चैट से अलग रखने के उबाऊ अनुशासन के साथ।
Antiy Labs दिखाता है कि परिधि ही उत्पाद है
Antiy Labs ने कहा कि उसकी रिपोर्ट Reddit उपयोगकर्ता LegitMichel777 की उन अफ़वाहों से शुरू हुई कि Claude Code में स्पाइवेयर था, फिर उसने Anthropic क्लाइंट और मॉडल सेवा इंटरैक्शन, स्थानीय व्यवहार, और Web, Mobile, Desktop, और Code में गोपनीयता प्रोटोकॉल की तुलनाओं की जाँच की। निरीक्षण करने के लिए यही सही परत है, क्योंकि एजेंटिक जोखिम आम तौर पर किसी एक प्रॉम्प्ट के अंदर नहीं, बल्कि घटकों के बीच रहता है। बिना टूल एक्सेस वाला मॉडल एक टेक्स्ट जनरेटर है; सीमित दायरे वाले टूल्स वाला मॉडल एक वर्कफ़्लो सिस्टम है; व्यापक टूल्स वाला मॉडल ऐसा ठेकेदार है जिसका बैज कभी समाप्त नहीं होता।
Antiy Labs ने यह भी कहा कि उसके काम में Claude Code क्लाइंट सैंपल्स का विश्लेषण और Claude Desktop बैकडोर अफ़वाहों से जुड़ा Antiy CERT बाइनरी फ़ाइल विश्लेषण शामिल था। व्यावहारिक सीख यह नहीं है कि हर अफ़वाह एक उल्लंघन रिपोर्ट बन जाती है। सीख यह है कि बाहरी समीक्षक प्लंबिंग की जाँच करेंगे, और अस्पष्ट सुरक्षा भाषा नेटवर्क सीमाओं, क्रेडेंशियल स्कोपिंग, और उन टूल्स की सूची का विकल्प नहीं बनेगी जिन्हें मॉडल कॉल कर सकता है।
AI Safety Claims खुलासे की खाई को दिखाई देने लायक बनाता है
AI Safety Claims दर्ज करता है कि Claude 4 को 22 मई, 2025 को जारी किया गया था, और उसी दिन एक मूल्यांकन रिपोर्ट और safeguards रिपोर्ट प्रकाशित की गई थी। यह भी दर्ज करता है कि Claude Opus 4.1 को 5 अगस्त को जारी किया गया, और 5 अगस्त को ही एक system card addendum प्रकाशित किया गया। वही स्रोत कहता है कि प्रशिक्षण और आंतरिक तैनाती की तारीखें रिपोर्ट नहीं की गईं, जो एक छोटा वाक्य है लेकिन उसका अनुपालन पर बड़ा असर पड़ता है।
वह समयरेखा प्रकाशन को नियंत्रण/रोकथाम से अलग करती है। एक मूल्यांकन रिपोर्ट खरीदारों को बता सकती है कि कंपनी ने क्या मापा, लेकिन अपने-आप यह साबित नहीं करती कि परीक्षण को कैसे अलग रखा गया, लक्ष्यों को किसने अधिकृत किया, कौन-से टूल सक्षम थे, या किसी रन को कितनी जल्दी रोका जा सकता था। EU की उत्पाद तथ्यों को disclosure duties में बदलने की आदत से उधार लें तो, Article 52 शैली की पारदर्शिता कोई जादुई कंगन नहीं है। यह तब उपयोगी बनती है जब अनुबंधों में टूल सूचियाँ, ऑडिट लॉग, घटना की सूचना, डेटा प्रतिधारण सीमाएँ, और किसी भी ऐसे वातावरण के लिए लिखित अनुमति आवश्यक हो जिसे एजेंट छू सकता है।
बेंचमार्क स्कोर नियंत्रण नहीं हैं
AI Safety Claims कहता है कि Anthropic ने Sonnet 4 को खतरनाक क्षमताओं से रहित बताया, जबकि Opus 4 की bio क्षमताएँ खतरनाक हो सकती हैं, और कहता है कि Anthropic ने उस मॉडल के लिए सुरक्षा और deployment safeguards हेतु अपना ASL 3 मानक लागू किया। वही विश्लेषण evals की प्रशंसा करता है, लेकिन इस बारे में चिंताएँ उठाता है कि Anthropic परिणामों की व्याख्या कैसे करता है, जिसमें यह भी शामिल है कि कौन-सी thresholds load bearing हैं।
यह वाक्यांश मायने रखता है। यदि कोई threshold deployment, access, या containment को नहीं बदलती, तो वह एक metric है, control नहीं। बिल्डर्स के लिए साफ़ दायित्व यह है कि evaluations को contained operations के रूप में डिज़ाइन करें। एजेंट को ऐसे sandbox में रखें जिसमें default outbound access न हो। synthetic या स्पष्ट रूप से authorised targets का उपयोग करें। credentials को test तक सीमित रखें। ऐसा kill switch रखें जो सच में tools को revoke करे, न कि केवल model से अच्छा व्यवहार करने को कहे। ऐसे logs सुरक्षित रखें जो prompts, tool calls, permissions, network attempts, और human approvals दिखाएँ। अगर यह AI ethics के बजाय security engineering जैसा लगता है, तो अच्छा है। ऐसा ही होना चाहिए।
नियामक vibes नहीं, records माँगेंगे
Forbes ने रिपोर्ट किया कि Federal Trade Commission ने OpenAI को 20 पेज का दस्तावेज़ भेजा, जिसमें AI safety challenges से जुड़े records माँगे गए। यह Anthropic के खिलाफ़ enforcement action नहीं था, लेकिन यह regulatory pattern दिखाता है। Agencies को alignment हल करने की ज़रूरत नहीं है ताकि वे पूछ सकें कि किसे क्या पता था, कंपनी को कब पता चला, कौन-से tests चलाए गए, और क्या marketing claims internal files से मेल खाते थे।
बाद में BBC ने रिपोर्ट किया कि US authorities द्वारा security concerns उठाए जाने के बाद Anthropic ने Claude Fable 5 और Mythos 5 को suspend कर दिया, और Reuters ने रिपोर्ट किया कि European Commission Anthropic decision के practical consequences पर विचार कर रहा था। तथ्य अलग हैं, प्रशासनिक प्रवृत्ति वही है: जब कोई model security questions उठाने के लिए पर्याप्त शक्तिशाली होता है, तो governments access, documentation, और consequences से शुरू करती हैं। jurisdictions के बीच फँसे builders को मान लेना चाहिए कि सबसे संकीर्ण सुरक्षित रास्ता operational proof होगा, न कि oversight का स्वागत करने वाला blog post।
आगे का रास्ता काफ़ी साधारण है। यदि आप agentic AI खरीद रहे हैं या बना रहे हैं, तो benchmark rank के बारे में कम और containment evidence के बारे में ज़्यादा पूछें। अगला गंभीर frontier model evaluation एक boundary diagram, authorisation register, tool permissions, stop procedures, और audit trails के साथ आना चाहिए। इससे कम कुछ भी lab coat पहने हुए trust exercise है।
