ओपन-वेट AI: क्षमता में बढ़त, सुरक्षा अंतर विश्लेषण
मुख्य बातें
- ओपन-वेट क्षमता में हुई प्रगति को रिलीज़ परीक्षण को मजबूत करने का कारण मानें, सुरक्षा कार्य को छोड़ने की अनुमति नहीं।
- मॉडलों का दुरुपयोग और विरोधी फाइन-ट्यूनिंग के तहत मूल्यांकन करें, क्योंकि डाउनस्ट्रीम उपयोगकर्ता रिलीज़ के बाद वेट्स को संशोधित कर सकते हैं।
- कुछ सुरक्षा उपाय मॉडल के बाहर रखें, जिनमें निगरानी, एक्सेस नियंत्रण और डोमेन-विशिष्ट डिप्लॉयमेंट जांचें शामिल हैं।
डाउनलोड किए जा सकने वाले वज़न वाले मॉडल फ्रंटियर सिस्टमों के और करीब पहुँच रहे हैं, जिससे रिलीज़ परीक्षण और सुरक्षा-सीमाएँ पहले से कहीं अधिक ज़रूरी हो गई हैं।
डाउनलोड किए जा सकने वाले वज़न वाले मॉडल फ्रंटियर सिस्टमों के और करीब पहुँच रहे हैं, जिससे रिलीज़ परीक्षण और गार्डरेल्स पहले से कहीं ज़्यादा आवश्यक हो गए हैं।
AI में अजीब नया दिखावा यह नहीं है कि आप अपने मॉडल को सात API गेटों और किसी SaaS गॉब्लिन द्वारा लिखे गए प्राइसिंग पेज के पीछे छिपा दें। असली बात यह है कि ऐसे वेट्स शिप किए जा रहे हैं जिन्हें लोग देख सकें, अपने हिसाब से बदल सकें, फाइन-ट्यून कर सकें, और हाँ, कभी-कभी उन्हें जलती हुई शॉपिंग कार्ट में भी बदल दें। TechCrunch इस पल को साफ़ शब्दों में बताता है: ओपन-वेट AI मॉडल फ्रंटियर के करीब पहुँच रहे हैं, लेकिन सुरक्षा की खाई अब भी मौजूद है। चर्चा के धुंध-मशीन के अंदर छिपा बिल्डर-लेसन यही है: खुलापन एक क्षमता-लाभ बनता जा रहा है, और इसका मतलब है कि सुरक्षा प्रथाओं को vibes-based compliance से आगे बढ़कर असली इंजीनियरिंग बनना होगा।
TechCrunch और AISI के अनुसार, अंतर घट रहा है
TechCrunch की रिपोर्ट, “Open-weight AI models are catching up to the frontier. The safety gap remains,” उस तनाव को पकड़ती है जिसका सामना आज टीमें proprietary और open-weight systems के बीच चुनाव करते समय कर रही हैं। UK AI Security Institute इस रुझान को कुछ ठोस आधार देता है: 17 जुलाई, 2026 के एक ब्लॉग पोस्ट में, AISI ने कहा कि हालिया open models GLM-5.2 और DeepSeek V4-Pro ने उसके cyber evaluations में 4 से 7 महीने पहले रिलीज़ हुए frontier closed models जैसा प्रदर्शन किया। AISI ने यह भी कहा कि यह अंतर 2025 के अधिकांश समय में मापे गए 6 से 10 महीनों की तुलना में कम था। मतलब: open-weight लेन अब सिर्फ़ GPU बिल वाला bargain bin नहीं रही, यह तेज़ी से वह जगह बन रही है जहाँ गंभीर क्षमता रहती है। यह इसलिए मायने रखता है क्योंकि open weights release math बदल देते हैं। Closed model में developer access को interface, rate limits, monitoring, और policy enforcement के ज़रिए नियंत्रित कर सकता है। Open-weight model में artifact खुद इमारत से बाहर चला जाता है, जैसे हर किसी को sourdough starter दे देना जो अगर आप उसे पर्याप्त अजीब आटा खिलाएँ तो exploit chains भी लिख सकता है। व्यावहारिक निष्कर्ष यह नहीं है कि “कभी open-weight models का उपयोग मत करो,” जो एक खराब bumper sticker और उससे भी खराब architecture principle होगा। निष्कर्ष यह है कि व्यापक release से पहले evaluation होना चाहिए, और deployment में ऐसे guardrails होने चाहिए जो मानकर चलें कि modification संभव है। Benchmark tables उपयोगी हैं, लेकिन वे safety case नहीं हैं। वे résumé की तरह हैं: प्रभावशाली, चयनात्मक, और कभी-कभी किसी ऐसे व्यक्ति द्वारा लिखे गए जिसके सत्य से रिश्ते बहुत नाटकीय हैं।
Casper की चेतावनी: वेट्स ही openness
की पूरी कहानी नहीं हैं Stephen Casper का paper, “Open Technical Problems in Open-Weight AI Model Risk Management,” तर्क देता है कि open-weight models अवसर भी लाते हैं और risk-management की कठिन समस्याएँ भी। Casper लिखते हैं कि openly available weights अधिक open research और testing की अनुमति देते हैं, लेकिन challenges भी पैदा करते हैं क्योंकि models को मनमाने ढंग से modify किया जा सकता है, oversight के बिना इस्तेमाल किया जा सकता है, और अपरिवर्तनीय रूप से फैलाया जा सकता है। Paper training data, training algorithms, evaluations, deployment, और ecosystem monitoring में फैली 16 open technical challenges की पहचान करता है। यह footnote नहीं है, यह तो lab coat पहने हुई to-do list है। FAR.AI workshop description में, Casper, जिन्हें वहाँ MIT researcher के रूप में पहचाना गया, ने बताया कि सक्षम open-weight models कितनी तेज़ी से आ रहे हैं, उन्हें “हर कुछ हफ्तों” में आने वाला और closed models से “कुछ महीने पीछे” बैठा हुआ बताया। वही description कहता है कि उनके research में Hugging Face पर लगभग 7,000 models मिले जो safeguards की कमी के लिए स्पष्ट रूप से fine-tuned थे, और “uncensored” या “abliterated” जैसे terms से searchable थे। यहीं openness जटिल हो जाता है: वही properties जो researchers को models audit और improve करने में मदद करती हैं, लोगों को refusal behavior हटाने में भी मदद करती हैं—एक कूड़ेदान खोलते raccoon जैसी नाज़ुकता के साथ। Casper का risk-management paper एक और बात कहता है जिसे builders को अपनी release checklist पर tattoo कर लेना चाहिए—रूपक रूप में, कृपया अपनी compliance dermis मुझे न भेजें। Research, methods, और evaluations के बारे में openness मायने रखती है, सिर्फ़ weights के बारे में openness नहीं। दूसरे शब्दों में, “हमने checkpoint release कर दिया” कोई safety disclosure नहीं है। वह तो उसकी शुरुआत है।
OpenAI का gpt-oss paper दिखाता है कि बेहतर testing कैसी दिख सकती
है OpenAI का paper “Estimating Worst-Case Frontier Risks of Open-Weight LLMs” उस तरह की release evaluation का ठोस उदाहरण देता है जिसकी ecosystem को अधिक बार ज़रूरत है। Paper malicious fine-tuning, या MFT, पेश करता है, जहाँ researchers ने biology और cybersecurity में gpt-oss से maximum capabilities निकलवाने की कोशिश की। Biology के लिए, OpenAI कहता है कि उसने threat creation से जुड़े tasks curate किए और web browsing वाले reinforcement learning environment में gpt-oss को train किया। Cybersecurity के लिए, उसने capture-the-flag challenges हल करने के लिए agentic coding environment में gpt-oss को train किया। Findings को सीमित दायरे में रखा गया है, जो उस industry में ताज़गी भरा है जहाँ “हमारा model emails लिखता है” अक्सर consciousness की सुबह की तरह सज-धजकर आता है। OpenAI कहता है कि maliciously fine-tuned gpt-oss ने OpenAI o3 से कम प्रदर्शन किया, जिसे paper biorisk और cybersecurity के लिए Preparedness High capability level से नीचे बताता है। Paper यह भी कहता है कि gpt-oss open-weight models की तुलना में biological capabilities को marginally बढ़ा सकता है, लेकिन frontier को substantially आगे नहीं बढ़ाता। Paper के अनुसार, इन results ने OpenAI के model release करने के decision में योगदान दिया। अधिक महत्वपूर्ण बात methodology है। Refusal rates alone खतरे का एक squishy proxy हैं, खासकर जब downstream users fine-tune कर सकते हैं। Adversarial fine-tuning के तहत model को stress-test करना builders को worst-case capability पर अधिक realistic read देता है, बजाय इसके कि base model से विनम्रता से पूछा जाए कि क्या वह behave करने का इरादा रखता है। अगर आपकी safety evaluation इस बात पर निर्भर करती है कि model हमेशा अपने original alignment outfit में रहेगा, तो बधाई हो, आपने fond memories से seatbelt बना ली है।
CFG के अनुसार, policy इस अंतर को समझने लगी है Centre
for Future Generations, European Open Digital Ecosystem Strategy पर अपने response में तर्क देता है कि open-weight AI को neural accent वाले traditional open-source software की तरह नहीं माना जाना चाहिए। CFG उन systems के बीच distinction करता है जिनके parameters download और adaptation के लिए publicly available हैं और व्यापक रूप से open-source technologies के बीच। उसके submission में कहा गया है कि एक बार model weights release हो जाने पर उन्हें वापस नहीं बुलाया जा सकता, safety guardrails को न्यूनतम प्रयास से हटाया जा सकता है, और safety-stripped variants के हजारों रूप पहले से ही freely circulate कर रहे हैं। यह policy framing builders के लिए उपयोगी है, भले ही आप consultation response कभी न पढ़ें जब तक 8 percent battery के साथ airport में फँसे न हों। Governance problem यह नहीं है कि open models खराब हैं। बात यह है कि control surface बदल जाता है। Closed systems API boundary पर power concentrate करते हैं; open-weight systems power को users, researchers, enterprises, और, अनिवार्य रूप से, उन लोगों तक distribute करते हैं जो अपने fine-tunes का नाम MegaNoRulesFinalFinal जैसा रखते हैं। इन models को अपनाने वाली teams के लिए immediate move बेहतरीन अर्थ में boring है: model provenance document करें, अपने domain से relevant misuse evaluations चलाएँ, जहाँ उचित हो adversarial fine-tuning resistance test करें, deployment monitoring जोड़ें, और तय करें कि कौन से safeguards model के बाहर रहेंगे। Model releasers के लिए, इतना evaluation detail publish करें कि दूसरे लोग safety case को reproduce और challenge कर सकें। Openness एक performance strategy बनती जा रही है। अब इसे engineering discipline भी बनना होगा, क्योंकि weights घर से बाहर जा रहे हैं और उन्होंने chaperone साथ नहीं लिया।
