
इस लेख में (4)
Gemini Robotics 2 विश्लेषण: रोबोट AI एक स्टैक बन जाता है
मुख्य बातें
- रोबोट AI को हार्डवेयर पर जोड़े गए किसी standalone language model के रूप में नहीं, बल्कि एक integrated stack के रूप में देखें।
- पहले ER 2 की उपलब्धता पर नज़र रखें, क्योंकि Google ने सभी Gemini Robotics 2 मॉडल सार्वजनिक नहीं किए हैं।
- रोबोटिक्स डेमो का मूल्यांकन केवल चमकदार humanoid choreography से नहीं, बल्कि transfer, safety, और repeatability के आधार पर करें।
WIRED की रिपोर्ट असली बदलाव की ओर इशारा करती है: रोबोटों को एक ही स्टैक में परसेप्शन, भाषा, रीजनिंग और एक्शन प्लानिंग की ज़रूरत होती है।
WIRED की रिपोर्ट असली बदलाव की ओर इशारा करती है: रोबोटों को एक ही स्टैक में धारणा, भाषा, तर्क और कार्रवाई की योजना बनाने की ज़रूरत है।
बल्ब लगाते हुए एक मानवरूपी रोबोट या तो embodied AI में एक मील का पत्थर है, या फिर एक बहुत महंगे सिटकॉम की शुरुआत। WIRED के अनुसार, Google DeepMind ने Gemini Robotics 2 जारी किया है, एक ऐसा सिस्टम जो अलग-अलग रोबोटों को नियंत्रित कर सकता है, जिनमें वे मानवरूपी रोबोट भी शामिल हैं जो बल्ब लगाने और कचरे के थैले बाँधने जैसे निपुणता वाले काम कर सकते हैं। दिखने में चमकदार हिस्सा मानवरूपी शरीर है; असली महत्वपूर्ण हिस्सा टखनों के पीछे छिपी architecture है। यह कोई chatbot नहीं है जिसे Roomba पर चिपका दिया गया हो और प्रेरणादायक OKRs दे दिए गए हों। WIRED की रिपोर्ट है कि Gemini Robotics 2 कई AI models को एक सिस्टम में जोड़ता है ताकि रोबोट अपने आसपास के माहौल को समझ सके और तय कर सके कि उसे कैसे काम करना है। Builders के लिए उपयोगी कहानी यही है: robotics AI अब एक-एक trick के लिए isolated controllers से आगे बढ़कर integrated stacks की ओर जा रहा है, जो perception, language understanding, reasoning, और action planning को जोड़ते हैं।
WIRED: रोबोट अब एक stack है
WIRED Gemini Robotics 2 को एक संयुक्त सिस्टम के रूप में वर्णित करता है, जो एक vision language model और दो vision language action models से बना है। VLM images और video को समझता है, इंसानों से संवाद करता है, और tasks के बारे में reasoning करता है, जबकि VLA models को physical space में movement के लिए train किया गया है और वे full-body motion के साथ-साथ grippers या hands को control करते हैं। WIRED के साथ साझा किए गए demos में, Apptronik के Apollo 2 robot ने Sharpa के hands का उपयोग करके shelves को व्यवस्थित किया, जो एक सुखद रूप से साधारण काम है और इसलिए backflip से अधिक दिलचस्प है (backflips शायद ही कभी cereal फिर से भरते हैं)।
मुख्य अंतर यह है कि एक रोबोट को सिर्फ यह जानने की जरूरत नहीं होती कि trash bag क्या होता है। उसे bag को पहचानना होता है, goal का अनुमान लगाना होता है, एक sequence plan करना होता है, ऐसे body को move करना होता है जो physics का पालन करती है, और तब recover करना होता है जब bag एक छोटे भूतिया parachute की तरह व्यवहार करे। इसी वजह से VLM plus VLA split मायने रखता है: language और perception control की जगह नहीं ले रहे, उन्हें control में wire किया जा रहा है।
Ars Technica: Google हिस्से भेज रहा है, पूरा opera नहीं
Ars Technica की रिपोर्ट है कि Gemini Robotics 2 में तीन models शामिल हैं, लेकिन अभी सार्वजनिक रूप से केवल एक उपलब्ध है। उसी report में कहा गया है कि Google के robots अधिक complex tasks संभाल सकते हैं, बदलते environments का लगातार analysis कर सकते हैं, और दूसरे robots के साथ collaborate कर सकते हैं। Ars Technica के अनुसार, Google यह भी कहता है कि system improved dexterity के साथ पूरे humanoid robot को control कर सकता है, जिनमें complex humanoid hands वाली machines भी शामिल हैं।
यह availability detail एक उपयोगी ठंडा झटका है। अगर आप आज build कर रहे हैं, तो कहानी यह नहीं है कि हर robot को अचानक universal brain transplant मिल गया। कहानी यह है कि Google stack का एक हिस्सा expose कर रहा है, जबकि fuller system को lab के करीब रख रहा है, जो robotics में सामान्य है क्योंकि reality अब तक लिखा गया सबसे खराब unit test है।
Google: ER 2 उलझे हुए बीच का planner है
Google का अपना blog कहता है कि Gemini Robotics ER 2 को robots के लिए high-level brain के रूप में design किया गया है, जो real-time spatial reasoning, multi-step task planning, और अलग-अलग robots के बीच collaboration को enable करता है। Google कहता है कि developers ER 2 को Gemini API, Google AI Studio, या Gemini Enterprise Agent Platform के through access कर सकते हैं। इससे ER 2 motor controller से कम और task orchestrator से अधिक लगता है, जो यह तय करता है कि lower-level systems motion execute करने से पहले क्या होना चाहिए।
Google DeepMind की release post, जिसकी तारीख 30 जुलाई, 2026 है, समस्या को उन robots से departure के रूप में frame करती है जिन्हें narrow, repetitive task sequences के लिए pre-programmed या teleoperated किया जाता है। Company तर्क देती है कि robots को ऐसे models की जरूरत है जो unpredictable environments में सोच सकें, act कर सकें, और interact कर सकें। चमकदार demo lighting को हटा दें, तो यह एक गंभीर research thesis है: general robot behavior को bodies के across transfer, real-time grounding, और ऐसी planning चाहिए जो फर्श पर पड़े socks से टकराने के बाद भी survive करे।
The Next Web: अभी भी अनाड़ी, फिर
भी महत्वपूर्ण The Next Web की रिपोर्ट है कि Gemini Robotics 2 एक humanoid को feet से fingertips तक control कर सकता है, एक साथ कई robots को coordinate कर सकता है, और कुछ घंटों में एक नई machine के अनुकूल हो सकता है। यह कम glamorous हिस्सा भी note करता है: DeepMind के अपने figures दिखाते हैं कि robots सबसे fiddly tasks में अभी भी slow और clumsy हैं। अच्छा। इस sentence को हर humanoid robot pitch deck पर tasteful Helvetica में छापा जाना चाहिए।
Readers के लिए, आगे देखने वाली बात यह नहीं है कि कोई demo robot studio conditions में एक और household chore कर सकता है या नहीं। यह देखें कि stack के कौन से parts developers के लिए available होते हैं, skills robot bodies के बीच कितनी अच्छी तरह transfer होती हैं, और evaluation highlight reels से आगे बढ़कर dexterity, safety, और collaboration के repeatable benchmarks तक पहुँचता है या नहीं। Robotics AI अब machine को एक party trick सिखाने जैसा कम और nervous system assemble करने जैसा अधिक बन रहा है, जो exciting भी है, terrifying भी, और ठीक इसी वजह से lightbulb को शायद अपनी receipt संभालकर रखनी चाहिए।