
इस लेख में (4)
एम्बॉडीड एआई डेटा मानक: चीन ने दस दिनों में जवाब दिया
मुख्य बातें
- भौतिक एआई सिस्टम बनाते समय डेटा मानकों पर मॉडल रिलीज़ जितनी ही बारीकी से नज़र रखें।
- मॉडल प्रशिक्षण को बड़े पैमाने पर ले जाने से पहले रोबोट डेटा संग्रह, लेबलिंग, भंडारण और साझाकरण की योजना बनाएं।
- रोबोटिक्स तैनाती की गति के संकेतों के लिए चीन के प्रशिक्षण स्थलों और स्थानीय मार्गदर्शन पर नज़र रखें।
राष्ट्रीय डेटा प्रशासन की मानक योजना दिखाती है कि रोबोट की प्रगति शायद केवल अधिक चमकदार फाउंडेशन मॉडल्स पर नहीं, बल्कि साझा डेटा ढाँचे पर निर्भर हो सकती है।
राष्ट्रीय डेटा प्रशासन की मानक योजना दिखाती है कि रोबोटों की प्रगति केवल और चमकदार फ़ाउंडेशन मॉडल पर नहीं, बल्कि साझा डेटा ढाँचे पर भी निर्भर हो सकती है।
हर कोई पूछता रहता है कि कौन-सा रोबोट फ़ाउंडेशन मॉडल जीतेगा। कम चमकदार जवाब शायद यह हो सकता है: वही, जिसके पास सबसे बेहतर तरीके से “कोरियोग्राफ़” किया हुआ डेटा एग्ज़ॉस्ट होगा। ह्यूमनॉइड रोबोट वेब को अंदर खींचकर और यह उम्मीद करके कि भौतिकी मेहरबान हो जाएगी, तौलिए मोड़ना, पैलेट जैक से बचना, या फिसलन भरे रिंच को पकड़ना नहीं सीखते। उन्हें रिकॉर्ड की गई वास्तविकता चाहिए, जो परेशान करने वाली बात है क्योंकि वास्तविकता की API डॉक्यूमेंटेशन बहुत खराब होती है। चीन का नेशनल डेटा एडमिनिस्ट्रेशन अब इसी उलझन में कदम रख रहा है। Bloomberg के अनुसार, एजेंसी ने कहा है कि वह एम्बॉडीड AI ट्रेनिंग डेटा के लिए मानक विकसित करेगी और स्थानीय अधिकारियों का मार्गदर्शन करेगी। The Next Web के अनुसार, यह कदम सात कंपनियों द्वारा सार्वजनिक डेटा इन्फ्रास्ट्रक्चर और साझा मानकों की मांग करने के सिर्फ दस दिन बाद आया। यही टाइमिंग असली कहानी है। रोबोट सिर्फ बड़े मॉडल-ब्रेन का इंतज़ार नहीं कर रहे हैं; वे लेबल, गवर्नेंस और इतनी स्थिरता वाली राष्ट्रीय डेटा पाइपलाइन का इंतज़ार कर रहे हैं कि ट्रेनिंग किसी लैब कोट पहने कारीगरी वाले अराजक प्रयोग में न बदल जाए।
The Next Web के अनुसार, मांग बहुत जल्दी नीति मशीनरी बन गई
The Next Web ने रिपोर्ट किया कि नेशनल डेटा एडमिनिस्ट्रेशन का यह कदम 10 सितंबर की एक बैठक के बाद आया, जिसकी अध्यक्षता एजेंसी के प्रमुख Liu Liehong ने की थी, और जिसमें रिसर्च संस्थान, टेक्नोलॉजी कंपनियां और ह्यूमनॉइड रोबोटिक्स संगठन शामिल हुए थे। उसी रिपोर्ट के अनुसार, दस दिन पहले इसी एजेंसी ने सात कंपनियों से मुलाकात की थी, जिन्होंने एम्बॉडीड AI के लिए सार्वजनिक डेटा इन्फ्रास्ट्रक्चर और साझा डेटा मानकों की मांग की थी। नीति मानकों से देखें तो यह असामान्य रूप से सीधा फीडबैक लूप है, जहां तात्कालिकता अक्सर सोफ़े के नीचे फंसे Roomba की तरह चलती है। Bloomberg ने रिपोर्ट किया कि नेशनल डेटा एडमिनिस्ट्रेशन इस क्षेत्र के लिए योजना और विकास संबंधी मार्गदर्शन को मजबूत करने की योजना बना रहा है, साथ ही डेटा संसाधनों में निवेश बढ़ाने वाली कंपनियों का समर्थन भी करेगा। TradingView News ने इस पहल का सार बताते हुए कहा कि प्राथमिकताओं में यह तय करने के औपचारिक मानक शामिल हैं कि एम्बॉडीड AI डेटा कैसे इकट्ठा, लेबल, स्टोर और साझा किया जाए, साथ ही डेटा गवर्नेंस पर स्थानीय सरकारों के लिए मार्गदर्शन भी शामिल है। कम नौकरशाही वाली अंग्रेज़ी में कहें तो: देश उस उलझे हुए मध्य-हिस्से को मानकीकृत करने की कोशिश कर रहा है जहां एक रोबोट दुनिया को छूता है और एक मॉडल उस संपर्क से सीखता है।
The Next Web की रिपोर्ट के अनुसार, असली bottleneck वास्तविकता
के घंटों में है The Next Web ने China Academy of Information and Communications Technology के अनुमान का हवाला दिया है कि एम्बॉडीड AI फ़ाउंडेशन मॉडल्स को लगभग 1 करोड़ घंटे के वास्तविक ट्रेनिंग डेटा की जरूरत होती है। उसी रिपोर्ट के अनुसार, दुनिया भर में केवल 1 लाख से 10 लाख घंटे तक का उच्च-गुणवत्ता वाला डेटा मौजूद है। यह अंतर कोई छोटी-मोटी rounding error नहीं है; यह तो मोशन कैप्चर सूट पहने ग्रैंड कैन्यन है।
यही कारण है कि एम्बॉडीड AI, टेक्स्ट मॉडल्स से बहुत महंगे तरीके से अलग है। टेक्स्ट प्रचुर है, अपूर्ण है, और कानूनी रूप से थोड़ा मसालेदार है, लेकिन यह ग्रह-स्तर पर मौजूद है। रोबोट इंटरैक्शन डेटा कठिन है क्योंकि उसे भौतिकी, स्थानिक समझ, सेंसर रीडिंग, कार्रवाई के परिणाम और मानव गति को ऐसे परिवेशों में कैप्चर करना होता है जहां गुरुत्वाकर्षण लगातार bug reports दर्ज करता रहता है। The Next Web के अनुसार, चीन पहले से ही आपूर्ति बना रहा है: रिपोर्ट बताती है कि 70 से अधिक एम्बॉडीड AI ट्रेनिंग ग्राउंड चल रहे हैं, जिनमें से ज़्यादातर औद्योगिक मैन्युफैक्चरिंग के लिए हैं, और 46 और की योजना है। अगर ये सुविधाएं साझा मानकों के तहत डेटा बनाती हैं, तो निजी मॉडल डेवलपर्स को सिर्फ raw hours से अधिक मिलता है। उन्हें comparable hours मिलते हैं, जो एक डेटासेट और timestamps वाले कबाड़-दराज़ के बीच का फर्क है।
TradingView News के अनुसार, मानक ही stack बन रहे हैं
TradingView News एम्बॉडीड AI को ऐसे सिस्टम्स के रूप में वर्णित करता है जो अपने वातावरण को महसूस करते हैं और उससे भौतिक रूप से इंटरैक्ट करते हैं, वेयरहाउस रोबोट से लेकर सर्जिकल arms और ह्यूमनॉइड्स तक। यह व्यापकता मायने रखती है क्योंकि किसी डेटा मानक को बेहद अलग-अलग मशीनों, सेंसरों, कार्यों और सुरक्षा अपेक्षाओं के बीच टिकना होता है। किसी फैक्ट्री में रोबोट arm और किसी demo booth में ह्यूमनॉइड, दोनों machine generated data पैदा करते हैं, लेकिन यह मान लेना कि वे streams जादुई रूप से एक-दूसरे के बदले इस्तेमाल हो सकती हैं, बेहतर lighting वाले benchmark theater तक पहुंचने का तरीका है।
The AI Insider ने रिपोर्ट किया कि चीन ने ह्यूमनॉइड रोबोट और एम्बॉडीड AI के लिए अपना पहला राष्ट्रीय मानक सिस्टम जारी किया, जिसका अनावरण 28 फरवरी को बीजिंग में हुआ। यह framework छह घटकों में व्यवस्थित था, जिनमें basic commonality, brain like and intelligent computing, limbs and components, complete machines and systems, application, और safety and ethics शामिल थे, और इसे Ministry of Industry and Information Technology की technical committee के तहत 120 से अधिक संस्थानों ने तैयार किया था। उसी रिपोर्ट में कहा गया कि 2025 में 140 से अधिक घरेलू निर्माताओं ने 330 से अधिक ह्यूमनॉइड मॉडल जारी किए, जिससे समझ आता है कि यहां मानक सिर्फ कागज़ी सजावट नहीं हैं। वे ट्रैफिक लाइट हैं, इससे पहले कि हर कोई servo motors उठाए चौराहे में दौड़ पड़े।
The Next Web कहता है, यूरोप के पास access rules हैं, production pipes नहीं
The Next Web चीन के buildout की तुलना यूरोप के Data Act से करता है, जो machine generated data तक access को नियंत्रित करता है लेकिन उसे पैदा करने वाला इन्फ्रास्ट्रक्चर नहीं बनाता। रिपोर्ट कहती है कि EU की Data Union Strategy के अधिकांश कदम, जिनमें योजनाबद्ध data labs भी शामिल हैं, प्रकाशन के दस महीने बाद भी लागू नहीं किए गए थे। Access rules उपयोगी हैं, लेकिन वे data collection rigs, calibrated sensors, shared schemas, या ऐसे training grounds नहीं हैं जहां रोबोट वास्तविक कार्यों में बार-बार असफल होते हैं, जब तक कि वे थोड़ा कम शर्मनाक न बन जाएं।
चीन के अंदर भी राष्ट्रीय इन्फ्रास्ट्रक्चर की मांग नई नहीं है। Yicai Global ने रिपोर्ट किया कि Haier Group के चेयरमैन और मुख्य कार्यकारी Zhou Yunjie ने एम्बॉडीड इंटेलिजेंस के लिए राष्ट्रीय स्तर के open innovation platforms, एक dedicated national data program, और design, manufacture, testing, और deployment तक फैले industrial grade standards framework की मांग की थी। यह पहले वाली मांग The Next Web द्वारा रिपोर्ट की गई सात कंपनियों की मांग से मेल खाती है, जिससे संकेत मिलता है कि उद्योग डेटा इन्फ्रास्ट्रक्चर को एक साझा निर्भरता के रूप में देखता है, न कि किसी अच्छी policy accessory के रूप में।
AI builders के लिए सबक शानदार ढंग से unsexy है और इसलिए शायद महत्वपूर्ण भी: data layer पर नज़र रखें। Model releases को अभी भी glossy demos, तालियां और थोड़े-बहुत humanoid jazz hands मिलेंगे। लेकिन अगर physical AI scale करता है, तो शायद इसलिए कि किसी ने यह standardize किया कि रोबोट दुनिया को कैसे record करते हैं, अपनी गलतियों को कैसे label करते हैं, और models को vibes से सीखना बंद कराने के लिए पर्याप्त वास्तविकता कैसे साझा करते हैं। रोबोट क्रांति किसी monologue के साथ नहीं आएगी, वह schema migration के रूप में आएगी।