
इस लेख में (4)
AgentX InferenceXv3 KV कैश अर्थशास्त्र विश्लेषण
मुख्य बातें
- एजेंटों को लंबे संदर्भ और मल्टी-टर्न ट्रेसेज़ के साथ बेंचमार्क करें, केवल साफ-सुथरे सिंगल-एक्सचेंज डेमो से नहीं।
- एजेंट वर्कलोड के लिए मुख्य उत्पादन मेट्रिक्स के रूप में KVCache HitRate और कुल टोकन लागत को ट्रैक करें।
- सर्विंग स्टैक्स और प्लेटफ़ॉर्म्स की एक साथ तुलना करें, क्योंकि लागत पूरे इन्फ़रेंस एनवेलप पर निर्भर करती है।
एजेंट वर्कलोड सिर्फ़ लंबी चैट नहीं होते। वे अव्यवस्थित, कई-टर्न वाले लागत इंजन होते हैं, जहाँ सर्विंग व्यवहार अब मॉडल के चुनाव जितना ही मायने रखता है।
एजेंट वर्कलोड सिर्फ़ लंबी चैट नहीं होते। वे उलझे हुए, कई चरणों वाले लागत-इंजन होते हैं, जहाँ सर्विंग व्यवहार अब मॉडल के चुनाव जितना ही महत्वपूर्ण हो गया है।
एक चैटबॉट जवाब मांगता है। एक एजेंट एक पहियों वाला सूटकेस, तीन सब-एजेंट, संदर्भ के दस लाख टोकन, और यह सच्चा विश्वास लेकर आता है कि आपका इन्फरेंस बजट बस एक सुझाव है। SemiAnalysis की AgentX InferenceXv3 रिपोर्ट डेमो के जादू और प्रोडक्शन के गणित के बीच की उस असहज लेकिन उपयोगी जगह में आती है। मुख्य बातें असामान्य रूप से साफ़ हैं: SemiAnalysis $3 Million USD dataset, 1 Mil+ Context Length, multi-turn workloads, sub agents, और 95%+ KVCache HitRate का उल्लेख करता है। यह कोई मॉडल ब्यूटी पेजेंट नहीं है। यह एक सर्विंग स्टैक ऑडिट है जिसने ट्रेंच कोट पहन रखा है।
SemiAnalysis के अनुसार अपडेट
SemiAnalysis AgentX 1.0 को 1 मिलियन संदर्भ पर एक पूरी तरह ओपन सोर्स, मल्टी-टर्न एजेंटिक कोडिंग इन्फरेंस बेंचमार्क के रूप में वर्णित करता है, जिसे Apache 2.0 के तहत जारी किया गया है। रिपोर्ट रिलीज़ को एक खास सवाल के इर्द-गिर्द रखती है: क्या CUDA की खाई एजेंटिक इन्फरेंसिंग में टिकती है। मैं चिप वाली भिड़ंत Theo पर छोड़ दूँगा, क्योंकि सिलिकॉन थंडर डोम उन्हीं का है। बिल्डर्स के लिए, तुरंत समझने वाली बात सरल है: बेंचमार्क एजेंट व्यवहार के आसपास बनाया गया है, न कि सिर्फ शिष्ट “प्रॉम्प्ट अंदर, जवाब बाहर” चैट के लिए।
SemiAnalysis यह भी कहता है कि Claude Code के नवंबर 2025 वाले मोड़ के बाद से long-context, multi-turn agentic workloads तेज़ी से बढ़े हैं, और अब वे प्रोडक्शन इन्फरेंसिंग के ट्रैफिक पर हावी हैं। वही रिपोर्ट कहती है कि OpenAI का Enterprise agentic spending अप्रैल 2026 में ChatGPT spending से आगे निकल गया। ये बड़े दावे हैं, और ऑपरेशनल असर ब्रांडिंग से भी बड़ा है। अगर आपका बेंचमार्क अब भी एक साफ-सुथरे एकल आदान-प्रदान जैसा दिखता है, तो आपका टेस्ट हार्नेस शायद योगा पोज़ को माप रहा है, जबकि प्रोडक्शन चलती ट्रक में फर्नीचर जोड़ रहा है।
SemiAnalysis के मापने
के तरीके से पता चलता है कि असली मैदान cache व्यवहार है
SemiAnalysis टीज़र का सबसे महत्वपूर्ण हिस्सा शायद यह है कि वह किन चीज़ों को साथ-साथ रखता है: 1 Mil+ Context Length, multi-turn, sub agents, और 95%+ KVCache HitRate। यह संयोजन बिल्डर्स को बताता है कि तनाव कहाँ खिसक रहा है। Agentic systems संदर्भ जमा करते हैं, पहले के काम पर लौटते हैं, और काम को sub agents में फैलाते हैं, इसलिए serving layer को उत्पाद का हिस्सा मानकर मूल्यांकित करना होगा, न कि model card के पीछे छिपे किसी उबाऊ plumbing detail की तरह। Plumbing, परेशान करने वाली बात है, वही जगह है जहाँ basement में पानी भरता है।
इसका मतलब यह नहीं है कि model quality मायने रखना बंद हो गई। इसका मतलब है कि workloads लंबे और multi-turn होने के बाद, model quality अकेले agent cost और latency की पूरी व्याख्या नहीं कर सकती। SemiAnalysis असल में vendors और users से पूछ रहा है कि वास्तविक agent traffic के आकार में system कैसा व्यवहार करता है। व्यावहारिक सीख यह है कि KVCache HitRate को first class benchmark metric मानें, क्योंकि रिपोर्ट ऐसा करती है, बजाय इसके कि इसे उन तीन लोगों के लिए footnote बना दें जो मनोरंजन के लिए profiler output पढ़ते हैं।
InferenceX एजेंटिक सर्विंग को cost table में बदलता है
SemiAnalysis का साथी InferenceX overview agentic inference costs को cost per million total tokens के रूप में रिपोर्ट करता है, जहाँ कम बेहतर है। यह कहता है कि आंकड़े दिखाए गए scenario में प्रत्येक model के लिए हर platform के best observed serving envelope का उपयोग करते हैं, और InferenceX तथा SemiAnalysis Market July 2026 Pricing Surveys और एक AI Cloud TCO Model पर आधारित हैं। यह मायने रखता है, क्योंकि agentic inference केवल generate किए गए tokens के बारे में नहीं है; यह workload के चारों ओर पूरे serving envelope के बारे में है। Spreadsheet चैट में आ चुकी है, और वह रसीदें भी लाई है।
InferenceX में दिखाए गए DeepSeek V4 Pro 1.6T scenario के लिए, table B200 Reference, MI355X, B300, GB200 NVL72, और GB300 NVL72 की तुलना करता है। InferenceX MI355X को $0.355 per million total tokens पर सूचीबद्ध करता है और SGLang और FP4 का उपयोग करते हुए इसे B200 से 18% अधिक महंगा बताता है। यह B300 को $0.245 पर सूचीबद्ध करता है और SGLang और FP4 का उपयोग करते हुए इसे B200 से 18% सस्ता बताता है, जबकि B200 reference vLLM और FP4 के साथ दिखाया गया है। दिलचस्प बात सिर्फ यह नहीं है कि कौन-सी row सस्ती है। बात यह है कि software stack, precision, platform, और workload shape अब cost story में अलग-अलग नहीं किए जा सकते।
SemiAnalysis और InferenceX के आधार पर बिल्डर्स को आगे क्या करना चाहिए
साथ मिलाकर देखें तो SemiAnalysis की AgentX report और InferenceX cost overview agent products के लिए एक अधिक उपयोगी evaluation loop सुझाते हैं। अगर आपका product long context का उपयोग करता है, तो long context के साथ benchmark करें। अगर आपका product उन पर निर्भर है, तो multi-turn और sub-agent workflows test करें। KVCache HitRate को track करें, क्योंकि SemiAnalysis 95%+ को headline property के रूप में highlight करता है, और cost per million total tokens की तुलना करें, क्योंकि InferenceX इसे economic comparison की unit के रूप में इस्तेमाल करता है।
अब देखने वाली अगली बात यह है कि क्या अधिक vendors chat-shaped victory laps के बजाय agent-shaped inference results प्रकाशित करते हैं। Builders को उस workload पर results मांगने चाहिए जिसे वे वास्तव में चलाते हैं, जिसमें context length, turn structure, serving stack, और total token cost शामिल हों। Investors को भी ध्यान देना चाहिए, क्योंकि agent margins उतनी ही serving efficiency पर निर्भर हो सकती हैं जितना कि pitch deck में कौन-सा model name सबसे अच्छा दिखता है। Model अब भी शानदार हो सकता है, लेकिन agent serving में accountant ने cache खोज लिया है।