OpenAI नेवियर-स्टोक्स प्रमाण फ़ाइलें, Lean जाँच विश्लेषण
मुख्य बातें
- AI विज्ञान के दावों को आर्टिफैक्ट समस्याओं की तरह देखें: प्रमाण फाइलें, जांचें और स्वतंत्र समीक्षा के रास्ते खोजें।
- अपने AI वर्कफ़्लो में सत्यापन लूप का उपयोग करें, खासकर जब आउटपुट जटिल या उच्च जोखिम वाले हों।
- सहीपन को उद्गम से अलग रखें: एक मान्य आर्टिफैक्ट को फिर भी पारदर्शी श्रेय, डेटा और प्रक्रिया रिकॉर्ड की आवश्यकता होती है।
असली सीख प्रेस कॉल के दावों से Lean आर्टिफैक्ट्स तक के बदलाव में है, क्योंकि विज्ञान को सबूत चाहिए होते हैं और थिओरम प्रूवर भावनाओं की परवाह नहीं करते।
असली सीख प्रेस कॉल के दावों से Lean कलाकृतियों तक जाने में है, क्योंकि विज्ञान को सबूत चाहिए होते हैं और प्रमेय सिद्धकर्ता भावनाओं की परवाह नहीं करते।
AI गणित की घोषणाओं की दो किस्में होती हैं: एक वे जो तुरहियों के साथ आती हैं, और दूसरी वे जो ऐसी फाइलों के साथ आती हैं जिन पर कोई दूसरी मशीन आपत्ति कर सकती है। The Next Web के अनुसार, OpenAI का Navier-Stokes दावा तुरही वाले इलाके में शुरू हुआ था: एक प्रेस कॉल, लगभग 10,000 समानांतर एजेंट, करीब 88 घंटे का काम, और उस समय कोई प्रकाशित प्रमाण नहीं। ज्यादा उपयोगी विकास यह है कि OpenAI की अपनी पोस्ट अब कहती है कि वह प्रमाण का लेखन और Lean formalization साझा कर रही है। कंफेटी अच्छी होती है, लेकिन proof checker मंच की रोशनी से चकाचौंध होने की संभावना कम रखता है।
The Next Web ने सत्यापन की कमी को मुख्य खबर बनाया The Next
Web ने रिपोर्ट किया कि OpenAI ने कहा कि GPT-6 Astra से अधिक सक्षम एक आंतरिक मॉडल ने साबित किया कि त्रि-आयामी Navier-Stokes समीकरण सीमित समय में singularity विकसित कर सकते हैं। उसी रिपोर्ट ने कहा कि प्रयास 1 सितंबर को शुरू हुआ, इसमें लगभग 10,000 समानांतर एजेंट इस्तेमाल हुए, करीब 88 घंटों में दावा किया गया परिणाम मिला, और इसकी लागत OpenAI के अनुसार लाखों डॉलर में थी। उस चरण पर, The Next Web का केंद्रीय बिंदु शानदार ढंग से अनफ़ैशनेबल था: कोई गणितीय दावा तब तक गणितीय परिणाम नहीं होता जब तक कोई उसे जाँच न सके। AI की भाषा में, यह एक demo video और reproducible repo के बीच का अंतर है, जिसे बेहतर रोशनी वाला Grand Canyon भी कहा जा सकता है। इसीलिए artifact trail प्रेस कॉल से ज्यादा मायने रखती है। OpenAI की पोस्ट कहती है कि वह प्रमाण का writeup और Lean में formalization दोनों साझा कर रही है, जो validation surface को executive narration से machine-checkable structure में बदल देता है। Lean formalization आसपास के हर सवाल को जादुई ढंग से हल नहीं करता, लेकिन यह तर्क को किसी ठोस चीज़ में सीमित कर देता है। यह “डिनर तैयार है” कहने और रेसिपी, सामग्री, और ऐसी kitchen scale सौंपने के बीच का अंतर है जो आपके धोखा देने पर चिल्लाती है।
Quanta कहता है कि गणितीय दावा blowup के बारे में
है, vibes के बारे में नहीं Quanta Magazine ने रिपोर्ट किया कि मंगलवार, 8 सितंबर को OpenAI के गणितज्ञों ने घोषणा की कि जनता के लिए उपलब्ध न होने वाले एक उन्नत मॉडल पर चल रहे 10,000 स्वायत्त AI एजेंटों ने तीन आयामों में Navier-Stokes समीकरणों में singularity खोज ली। Quanta यह भी बताता है कि PDE मठ के बाहर के लोग क्यों परवाह करते हैं: Clay Mathematics Institute ने 2000 में Millennium Prize Problems पेश किए थे, और प्रत्येक पर $1 million का पुरस्कार है। दावा इस बारे में है कि क्या चिकनी त्रि-आयामी तरल गति टूट सकती है, यह नहीं कि आपकी espresso machine गुप्त रूप से chaotic है या नहीं (हालाँकि, आध्यात्मिक रूप से, हाँ)। Quanta ने रिपोर्ट किया कि परिणाम को Lean में औपचारिक रूप से जाँचा गया है, जिससे गणितज्ञों को भरोसा मिला है कि अगर आगे की जाँच कायम रहती है तो यह सही है। मिलियन-डॉलर गणित कंफेटी के नीचे छिपा builder lesson यही है। AI प्रणालियाँ लंबे, जटिल candidate proofs बना सकती हैं, लेकिन महत्वपूर्ण product pattern बड़े agent swarms को बौद्धिक leaf blowers की तरह इस्तेमाल करना नहीं है। यह generation को verification के साथ जोड़ना है, खासकर जब output सामान्य मानवीय trust calibration के लिए बहुत जटिल हो। अगर आपका AI workflow दावे, code, analyses, या designs बनाता है, तो उसका परिपक्व version verifier, tests, provenance, और जहाँ संभव हो public artifacts शामिल करता है।
OpenAI की पोस्ट validation को artifact story में बदलती है
OpenAI की अपनी पोस्ट कहती है कि प्रमाण एक आंतरिक OpenAI system ने बनाया था और यह दिखाता है कि fluid motion के लिए Navier-Stokes equations की dynamics सीमित समय में singularity विकसित कर सकती है। OpenAI कहता है कि उसने GPT-6 Astra से काफी अधिक सक्षम एक आंतरिक model इस्तेमाल किया, जो lab-announcement standards से भी spicy sentence है। कंपनी यह भी समझाती है कि Navier-Stokes equations अलग-अलग molecules को track करने के बजाय fluid motion को continuous medium के रूप में describe करते हैं, जिनके उपयोगों में aircraft design, weather forecasting, और blood flow का अध्ययन शामिल है। यह विनम्र तरीके से कहने जैसा है कि ये समीकरण सभ्यता के बहुत बड़े हिस्से के नीचे बैठे हैं, जिसमें planes, storms, और circulatory system का चुपचाप unpaid infrastructure work करना शामिल है। ML teams के लिए दिलचस्प हिस्सा यह नहीं है कि क्या हर domain अचानक agent swarm problem बन जाता है। The Next Web के अनुसार, 88 घंटों में दस हजार agents कोई weekend hackathon नहीं है, जब तक कि आपके weekend में एक छोटा power plant और spreadsheet में रोता हुआ accounting department शामिल न हो। पोर्टेबल विचार loop है: व्यापक रूप से search करें, result को formal structure में compress करें, फिर independent tools को structure जाँचने दें। यह pattern पहले से ही code generation, theorem proving, data analysis, और किसी भी ऐसे workflow पर लागू होता है जहाँ fluent nonsense lab coat पहन सकती है।
Tom's Hardware दिखाता है कि provenance अभी भी क्यों मायने रखता
है Tom's Hardware ने रिपोर्ट किया कि घोषणा के साथ NYU के Tristan Buckmaster और Anthropic के Levent Alpöge से जुड़े credit dispute भी आया, जो संबंधित Euler equations पर काम कर रहे थे। रिपोर्ट कहती है कि Buckmaster ने Alpöge के साथ अपने काम को institutional agreements के बाहर एक personal collaboration बताया, साथ ही authorship और data access को लेकर विवादित आरोपों का भी उल्लेख किया। वे दावे यहाँ मुख्य focus नहीं हैं, लेकिन builders को lesson नज़रअंदाज़ नहीं करना चाहिए: formal verification गणित जाँचता है, provenance नहीं। कोई proof mechanically valid हो सकता है, जबकि data, credit, और authorship के आसपास का workflow फिर भी boring adult supervision माँग सकता है। यहीं AI research tooling को आगे परिपक्व होना होगा। Machine-checkable artifacts scientific arguments को सीमित करने में मदद करते हैं, लेकिन labs को prompts, private sessions, training data boundaries, contributor roles, और model outputs के लिए audit trails की भी जरूरत है। AI-assisted science का सबसे अच्छा version “chatbot पर भरोसा करो” नहीं है; यह है कि chatbot जिस भी उपयोगी चीज़ को छुए, उस पर अपने fingerprints छोड़े। theorem prover proof जाँच सकता है; humans को अब भी process जाँचना होगा। AI के साथ build करने वाले पाठकों के लिए उपयोगी takeaway यह है: announcement की पूजा न करें, verification path की जाँच करें। देखें कि क्या OpenAI की materials independent checking को आमंत्रित करती हैं, क्या mathematicians Lean formalization पर सहमत होते हैं, और क्या future AI research claims atmospherics के बजाय artifacts के साथ ship होते हैं। “trust me, bro” science का युग हमेशा से खराब विचार था; अब उसमें compiler error भी है।
