OpenAI Jalapeño विश्लेषण: कस्टम इन्फ़रेंस की अर्थव्यवस्था
मुख्य बातें
- प्रति कार्य अनुमान लागत, विलंबता और टोकन को मुख्य उत्पाद मेट्रिक्स के रूप में ट्रैक करें, न कि बैकएंड की मामूली बातों के रूप में।
- रिपोर्ट किए गए चिप बेंचमार्क को कार्यभार-विशिष्ट संकेतों के रूप में देखें, न कि इस सार्वभौमिक प्रमाण के रूप में कि कोई एक एक्सेलेरेटर हर चीज़ में जीतता है।
- बड़ी AI लैब्स से यह अपेक्षा करें कि वे लचीले कंप्यूट को रातोंरात छोड़ने के बजाय कस्टम ASICs को GPUs के साथ मिलाकर उपयोग करें।
चटपटा पहलू चिप का नाम नहीं है। यह उस समय टोकन सर्व करने का गणित है, जब इन्फ़रेंस ही उत्पाद बन जाता है।
दिलचस्प बात चिप का नाम नहीं है। यह तब टोकन परोसने का गणित है जब इन्फ़रेंस ही उत्पाद बन जाता है।
एआई उद्योग ने वर्षों तक GPUs को पवित्र रसोई उपकरणों की तरह माना है: महंगे, गर्म, हमेशा व्यस्त, और किसी तरह हर भोजन के लिए ज़रूरी। OpenAI की Jalapeño चिप दिलचस्प है क्योंकि यह संकेत देती है कि सबसे बड़े मॉडल लैब अब हमेशा के लिए चूल्हा किराए पर लेने से संतुष्ट नहीं हैं। SemiAnalysis की रिपोर्ट, जिस पर इसके InferenceX suite के आसपास benchmark summaries के ज़रिए चर्चा हुई, ध्यान को training के तमाशे से हटाकर inference की अर्थव्यवस्था पर ले आती है। Training को trailer मिलता है। Inference को बिजली का बिल, latency pager, और वह ग्राहक मिलता है जो पूछ रहा है कि उनका agent अभी भी calendar permissions के बारे में क्यों सोच रहा है। Jalapeño इसलिए मायने रखती है क्योंकि frontier AI products अब अपना जीवन models को serve करने में बिताते हैं, केवल उनकी घोषणा करने में नहीं। हर prompt, retry, tool call, लंबी reasoning trace, और agent loop प्रति user tokens, watts, और delay में बदल जाता है। अगर आपका workload काफी बड़ा और काफी predictable है, तो generic accelerators flexibility जैसे कम और अपने ही घर में रहने के लिए hotel rates चुकाने जैसे ज़्यादा लगने लगते हैं। बहुत chic, आर्थिक रूप से शापित।
SemiAnalysis serving bill को सामने लाता है [AI
Weekly](https://aiweekly.co/alerts/openai-jalapeno-chip-beats-nvidia-rubin-on-perf-per-watt(नए टैब में खुलता है)) SemiAnalysis की deep dive को OpenAI की पहली custom inference chip, Jalapeño, के रूप में summarize करता है, जिसे Broadcom के साथ TSMC N3P पर taped out किया गया। वही summary कहती है कि B0 stepping 700W पर MXFP4 के 13.4 PFLOPs तक पहुँचती है और 15.4TB/s पर HBM4 के साथ pair होती है। Tom’s Hardware(नए टैब में खुलता है) Broadcom और OpenAI के part को custom built inference processor के रूप में पेश करता है और OpenAI की पहली chip को reticle sized ASIC बताता है। संज्ञाओं का यह ढेर ऐसा लग सकता है जैसे किसी ने data center brochure को blender में डाल दिया हो। आसान अर्थ यह है कि OpenAI serving path के बड़े हिस्से पर अपना नियंत्रण चाहता है, जहाँ perf per watt और memory bandwidth यह प्रभावित करते हैं कि सहनीय latency पर कितने users को serve किया जा सकता है। यह कल हर GPU को replace करने की बात नहीं है, और यह कोई morality play भी नहीं है जहाँ Nvidia आपके portfolio के हिसाब से cape या मूंछ पहनता है। यह इस बारे में है कि क्या भारी inference volume वाला lab अपनी unit economics को general purpose silicon का कम बंधक बना सकता है।
Benchmark दावे watts के बारे में हैं, vibes
के बारे में नहीं Yahoo Tech(नए टैब में खुलता है), SemiAnalysis का हवाला देते हुए, रिपोर्ट करता है कि Jalapeño ने standard test suites में Nvidia के Blackwell की तुलना में प्रति watt 1.9 गुना तक अधिक output दिया और end to end latency को 3.6 गुना तक घटाया। AI Weekly(नए टैब में खुलता है) OpenAI benchmark comparisons भी रिपोर्ट करता है जिनमें GPT-OSS, DeepSeek R1, और Kimi K2.5 1T में Nvidia की तुलना में प्रति watt 1.5 से 1.9 गुना अधिक work दिखाया गया। specific workload names मायने रखते हैं क्योंकि inference performance को एक नंबर में summarize करना मशहूर तौर पर मुश्किल है, जैसे केवल fork weight के आधार पर restaurant review लिखना। token numbers भी उतने ही खुलासा करते हैं। AI Weekly कहता है कि Jalapeño DeepSeek R1 पर प्रति user 700 tokens per second से अधिक और GPT-OSS पर प्रति user लगभग 1,400 tokens per second दर्ज करती है। ये figures अपने आप आपको total fleet economics, utilization, yield, software maturity, या procurement reality नहीं बताते। लेकिन वे यह ज़रूर दिखाते हैं कि labs क्यों परवाह करते हैं: प्रति user तेज़ throughput denser serving, कम latency, या finance team के printer noises निकालने से पहले अधिक ambitious product behavior में बदल सकता है।
Custom inference एक heatsink पहनी हुई strategy है [Yahoo
Tech](https://tech.yahoo.com/ai/articles/openais-jalapeno-chip-outperforming-nvidia-175933888.html(नए टैब में खुलता है)) कहता है कि OpenAI ने hardware engineering को तेज़ करने और design to tapeout timelines को नौ महीनों तक घटाने के लिए अपने generative AI models का उपयोग किया। यह एक साफ़ recursion loop है: AI उस chip को design करने में मदद कर रहा है जो और AI चलाती है, साँप अपनी पूंछ खा रहा है लेकिन बेहतर memory bandwidth के साथ। वही Yahoo Tech report कहती है कि OpenAI operating costs घटाने और single vendors पर निर्भरता कम करने के लिए custom silicon का उपयोग कर रहा है, जबकि Nvidia और अन्य third party partners से accelerators खरीदना जारी रखे हुए है। वह आखिरी clause adult supervision है। Custom ASICs कोई magic beans नहीं हैं जिन्हें आप Kubernetes cluster के बगल में लगा दें। उन्हें software support, supply chain execution, workload stability, और इतना traffic चाहिए कि nonrecurring engineering costs justify हो सकें, जो किसी normal startup को अचानक spreadsheet बना दें। OpenAI के लिए यह bet plausible है क्योंकि inference कोई side quest नहीं है। यह product surface, margin line, और बढ़ते हुए इस बात की constraint है कि agents बहुत महंगे interns बनने से पहले कितने उपयोगी हो सकते हैं।
Jalapeño moment से builders को क्या सीखना चाहिए [SemiAnalysis की
Jalapeño report](https://newsletter.semianalysis.com/p/openai-jalapeno-better-than-nvidia(नए टैब में खुलता है)) से उपयोगी lesson यह नहीं है कि हर AI company Broadcom को एक dream और spicy codename के साथ email करना शुरू कर दे। यह है कि serving architecture अब first class product decision बन रही है। अगर आप large models के साथ build कर रहे हैं, तो आपको tokens per task, cache hit rates, batching behavior, latency budgets, और model mix को उसी गंभीरता से track करना चाहिए जो आमतौर पर launch decks और logo spacing के लिए रखी जाती है। model brain हो सकता है, लेकिन inference circulatory system है, और किसी को भी ऐसा demo पसंद नहीं जो tool call के बीच में बेहोश हो जाए। अब देखें कि software integration, benchmark reproducibility, और क्या OpenAI broader flexibility के लिए GPUs रखते हुए specific workloads को Jalapeño पर route करता है, इन सबके आसपास आगे क्या होता है। copycats पर भी नज़र रखें: जब भी कोई frontier lab साबित करता है कि inference volume custom silicon को justify कर सकता है, बाकी सभी को भी अचानक पता चलता है कि उनकी भी silicon strategy है, आमतौर पर procurement के nervous breakdown से पाँच slides पहले। AI products बना रहे readers के लिए practical takeaway सरल है: केवल model cleverness नहीं, बल्कि cost per useful answer के लिए optimize करें। spice कभी chip name में नहीं था। वह serving bill था जिसने negotiate करना सीख लिया।
