Grok 4.5 Compute Plus ट्रेसेज़ विश्लेषण
मुख्य बातें
- कोडिंग मॉडल का मूल्यांकन केवल चैट डेमो या स्थिर बेंचमार्क में नहीं, बल्कि वास्तविक एजेंट वर्कफ़्लो के भीतर करें।
- कोडिंग दावों पर भरोसा करने से पहले विक्रेताओं से पूछें कि प्रशिक्षण को किस प्रकार के ट्रेस और टूल-उपयोग डेटा ने आकार दिया।
- फ्रंटियर कोडिंग असिस्टेंट्स की तुलना करते समय मॉडल आकार जितना ही फीडबैक लूप्स पर भी ध्यान दें।
xAI के लॉन्च से मिली सीख सिर्फ़ बड़े मॉडल नहीं, बल्कि वास्तविक एजेंटिक कोडिंग सत्रों से बेहतर ट्रेस हैं।
xAI के लॉन्च से मिली सीख केवल बड़े मॉडल नहीं है, बल्कि वास्तविक एजेंटिक कोडिंग सत्रों से बेहतर ट्रेसेज़ हैं।
हर कोई Grok 4.5 को ऐसे देख रहा है जैसे यह कोई लीडरबोर्ड वाली घुड़दौड़ हो, जो समझ में आता है—और यही वह तरीका भी है जिससे हम कभी-कभी रेस्तरां की समीक्षा ओवन गिनकर करने लगते हैं। ज़्यादा दिलचस्प कहानी इसकी सामग्री-सूची है। FourWeekMBA xAI के Grok 4.5 रिलीज़ को इस बात के प्रमाण के रूप में देखता है कि फ्रंटियर कोडिंग मॉडल एक ऐसी रेसिपी से बनाए जा रहे हैं जिसे मैं कंप्यूट प्लस ट्रेसेज़ कहूँगा, क्योंकि लगता है अब न्यूरल नेटवर्क्स को भी रसीदें चाहिए।
FourWeekMBA कहता है कि दिलचस्प हिस्सा ट्रेस डाइट है
FourWeekMBA, xAI की 8 जुलाई की रिलीज़ के साथ-साथ TechCrunch, Axios की रिपोर्टिंग और Artificial Analysis के बेंचमार्क का हवाला देते हुए, तर्क देता है कि Grok 4.5 किसी एक प्रोडक्ट लॉन्च से कम और मॉडल बनाने के एक दिखने वाले पैटर्न से ज़्यादा जुड़ा है। इसका मुख्य दावा है कि xAI की 8 जुलाई की रिलीज़ को वास्तविक Cursor डेवलपर सेशन डेटा पर ट्रेन किया गया था, जिससे एजेंटिक कोडिंग वर्कफ़्लो सिर्फ़ डेमो की रंगीन कतरनें नहीं रहते, बल्कि ट्रेनिंग सिग्नल बन जाते हैं। FullStack भी इसी तरह रिपोर्ट करता है कि Grok 4.5 एक नए बड़े पैमाने के फाउंडेशन मॉडल पर चलता है, वास्तविक डेवलपर गतिविधि से डेटा शामिल करता है, और इसे कोडिंग, एजेंट्स और ज्ञान-प्रधान काम के लिए रखा गया है। यह महत्वपूर्ण है क्योंकि कोडिंग असिस्टेंट्स को सिर्फ़ सिंटैक्स जानने की ज़रूरत नहीं होती; उन्हें वह अजीब-सी छोटी नृत्य-प्रक्रिया भी सीखनी होती है जिसमें इंसान टेस्ट चलाते हैं, धीरे से बड़बड़ाते हैं, तीन फ़ाइलें एडिट करते हैं, और फिर किसी तरह उसे इंजीनियरिंग कह देते हैं।
Artificial Analysis Grok 4.5 को आगे की कतार के पास रखता है
Artificial Analysis ने 8 जुलाई, 2026 को रिपोर्ट किया कि Grok 4.5 ने उसके Intelligence Index पर 54 स्कोर किया, जिससे यह Fable 5, GPT-5.5 और Opus 4.8 के पीछे चौथे स्थान पर रहा। उसी विश्लेषण के अनुसार Grok 4.5 ने Grok 4.3 की तुलना में 16 अंकों का सुधार किया और एजेंटिक ज्ञान-कार्य तथा कोडिंग में विशेष रूप से अच्छा प्रदर्शन किया। Artificial Analysis Coding Agent Index पर, इसने Grok Build हार्नेस में Codex पर GPT-5.5 के बराबर स्कोर किया, रिपोर्ट के अनुसार बहुत कम लागत पर। सरल शब्दों में: यह ताजपोशी नहीं है, लेकिन अब यह X पर चैटबॉट वाला पंचलाइन भी नहीं रहा।
Kie AI दिखाता है कि लीक असल में ट्रेनिंग सिग्नल्स के बारे
में क्यों था Kie AI के 15 जुलाई के विश्लेषण ने प्री-लॉन्च संकेतों को 6 जुलाई तक ट्रेस किया, जब Grok वेब UI में Grok 4.5 की ओर इशारा करती एक स्ट्रिंग सामने आई। उसी रिपोर्ट ने मॉडल को 1.5T-पैरामीटर V9 फाउंडेशन मॉडल पर बना बताया, जिसमें सप्लीमेंटल ट्रेनिंग के दौरान Cursor डेटा मिलाया गया था, और कहा कि यह लगभग एक सप्ताह से SpaceX और Tesla में प्राइवेट बीटा में था। Kie AI ने यह भी नोट किया कि उस समय आधिकारिक बेंचमार्क, कीमत, कॉन्टेक्स्ट विंडो और रिलीज़ तारीख प्रकाशित नहीं किए गए थे। उपयोगी सीख यह नहीं है कि लीक ही प्रोडक्ट रणनीति हैं—कृपया इसे KPI मत बना दीजिए—बल्कि यह है कि लीक ने मॉडल के आकार जितना ही ट्रेनिंग डेटा की उत्पत्ति को भी केंद्र में रखा।
Axios कहता है कि मॉडल की बाढ़ अब मौसम बन चुकी है
Axios ने उसी सप्ताह को ऐसे समय के रूप में पेश किया जब अमेरिकी लैब्स हर तरफ़ मॉडल ला रही थीं, और Meta के Muse Spark 1.1 तथा OpenAI के GPT-5.6 परिवार जैसी गतिविधियों की ओर इशारा किया, जिनसे मॉडल परिदृश्य को ट्रैक करना और कठिन हो रहा है। यह संदर्भ महत्वपूर्ण है क्योंकि बेंचमार्क से होने वाला झटका अब AI खबरों का डिफ़ॉल्ट यूज़र इंटरफ़ेस बन चुका है। अगर हर लैब बड़ा या सस्ता मॉडल अनाउंसमेंट भेज सकती है, तो बिल्डर्स के लिए टिकाऊ सवाल यह बनता है कि किस फीडबैक लूप ने मॉडल को बेहतर बनाया। कंप्यूट क्षमता खरीदता है, लेकिन ट्रेसेज़ व्यवहार खरीदते हैं, और व्यवहार ही किसी एजेंट को सिर्फ़ ज़्यादा बोलने वाला नहीं बल्कि उपयोगी बनाता है (JSON मोड वाला LinkedIn इन्फ्लुएंसर नहीं)।
FullStack का बिल्डर निष्कर्ष: वर्कफ़्लो को इंस्ट्रूमेंट करें
FullStack Grok 4.5 को उन टीमों के लिए लक्षित बताता है जो Claude, GPT और लागत के बीच चुनाव कर रही हैं, जिसमें सॉफ़्टवेयर इंजीनियरिंग, एजेंट्स और लंबी विश्लेषणात्मक सामग्री पर फोकस है। इंजीनियरिंग टीमों के लिए व्यावहारिक सीख यह है कि कोडिंग मॉडल्स का मूल्यांकन असली वर्कफ़्लो के भीतर करें, सिर्फ़ चैट बॉक्स और कृत्रिम पहेलियों में नहीं। ट्रैक करें कि क्या मॉडल कॉन्टेक्स्ट पढ़ सकता है, टूल्स का उपयोग कर सकता है, असफल प्रयासों से उबर सकता है, और वास्तविक जैसे टास्क लूप्स में बेहतर हो सकता है। अगली कोडिंग मॉडल रेस शायद इस बात से कम जीती जाए कि सबसे बड़ी भट्टी किसके पास है, और इस बात से ज़्यादा कि सबसे अच्छी लैब नोटबुक कौन रखता है।
