Arm Neoverse CSS N4 Ranger सेमी कस्टम विश्लेषण
मुख्य बातें
- केवल कोर संख्या से आगे देखें: कैश, मेमोरी और I/O वे स्पेसिफिकेशन हैं जो वास्तविक सर्वर उपयोगिता तय करते हैं।
- CSS N4 को केवल CPU कोर लॉन्च नहीं, बल्कि एक मान्यीकृत सबसिस्टम मानें।
- ग्राहक कॉन्फ़िगरेशन पर नज़र रखें ताकि पता चले कि क्लाउड निर्माता कोर, चिपलेट, मेमोरी या एक्सेलेरेटर कनेक्टिविटी में से किसे प्राथमिकता देते हैं।
सेमी-कस्टम सबसिस्टम, CPU की घोषणा से ज़्यादा, सर्वर सिलिकॉन के लिए मान्य किए गए पुर्ज़ों का संग्रह है।
अर्ध-कस्टम सबसिस्टम, CPU घोषणा से ज़्यादा सर्वर सिलिकॉन के लिए एक सत्यापित पुर्ज़ों का संग्रह है।
पहले सर्वर चिप की शुरुआत एक कोर और लंबी इंजीनियरिंग यात्रा से होती थी। Arm अब कुछ ऐसा पेश कर रहा है जो पहले से वायर किए गए वॉल्ट दरवाज़े जैसा है: कोर, कैश, मेमोरी इंटरफेस, I/O, और चिप-टू-चिप प्लंबिंग पहले से व्यवस्थित हैं, ताकि ग्राहक उबाऊ हिस्सों को वैलिडेट करने में कम समय लगाएँ और यह तय करने में ज़्यादा समय दें कि गहने कहाँ छिपाने हैं। Arm Neoverse CSS N4 Ranger के पीछे असली कहानी यही है। Tom's Hardware के अनुसार, मुख्य स्पेसिफिकेशन बड़ा है: प्रति डाई आठ से 128 Neoverse N4 कोर, 3.8 GHz तक, TSMC की N3P प्रक्रिया पर। लेकिन ज़्यादा दिलचस्प कदम आर्किटेक्चरल पैकेजिंग है। Arm सिर्फ़ एक तेज़ ईंट नहीं बेच रहा, वह एक कॉन्फ़िगर करने योग्य दीवार का हिस्सा बेच रहा है, जिसमें कंड्यूट पहले से जाँचे जा चुके हैं।
बेंच पर रखा सबसिस्टम
Tom's Hardware Arm के Compute Subsystem प्रोग्राम को एक सेमी-कस्टम रास्ते के रूप में बताता है, जो ग्राहकों को Arm IP के इर्द-गिर्द कोर काउंट, कैश आकार, I/O, और कनेक्टिविटी कॉन्फ़िगर करने देता है। Arm की अपनी Neoverse CSS सामग्री इन सबसिस्टम्स को वैलिडेटेड, प्रदर्शन-अनुकूलित इंफ्रास्ट्रक्चर कंप्यूट प्लेटफ़ॉर्म के रूप में पेश करती है, जिनका उद्देश्य अलग पहचान न बनाने वाले डिज़ाइन और वैलिडेशन काम को हल्का करना है। डेटाशीट की भाषा से अनुवाद करें तो: Arm सर्वर चिप डिज़ाइन के उस हिस्से को हटाने की कोशिश कर रहा है जो रात 2 बजे किसी भूतिया बैकप्लेन को डिबग करने जैसा महसूस होता है।
यह मायने रखता है क्योंकि क्लाउड CPU, DPU, या चिपलेट डिज़ाइन में जीत सिर्फ़ कोर काउंट से शायद ही मिलती है। Tom's Hardware रिपोर्ट करता है कि यही CSS तरीका Azure और Google Cloud के CPUs में, साथ ही Nvidia और Intel के DPUs में भी दिखाई दिया है। हीस्ट मूवी वाला सरल संस्करण यह है: कोर टीम के सदस्य हैं, लेकिन भाग निकलना मेमोरी, I/O लेन, और इस बात पर निर्भर करता है कि चिपलेट इंटरकनेक्ट समय पर गैरेज का दरवाज़ा खोलता है या नहीं।
कोर काउंट के नीचे छिपा स्पेक
Tom's Hardware के अनुसार, Neoverse CSS N4 प्रति डाई 256 MB तक L3 कैश, प्रति कोर 2 MB तक L2 कैश, और प्रति कोर 64 KB L1 instruction तथा 64 KB L1 data कैश सपोर्ट करता है। कोई भी 128 कोर के नारे लगाने लगे, उससे पहले मैं L3 वाले नंबर को लाल घेरे में चिन्हित करूँगा। पर्याप्त पास के कैश के बिना बड़ा कोर फ़ार्म बस ऐसी भीड़ है जो सबवे टर्नस्टाइल से घुसने की कोशिश कर रही है, जबकि DRAM शहर के दूसरे छोर से हँस रहा है।
Tom's Hardware यह भी नोट करता है कि Ranger, Neoverse CSS N2 से एक बड़ा कदम आगे है, जो 64 कोर तक सीमित था। N4 रेंज आठ कोर जितनी कम संख्या से शुरू होती है, और यह ऊपरी सीमा जितना ही महत्वपूर्ण है, क्योंकि हर ग्राहक वही राक्षस नहीं बना रहा। नेटवर्किंग चिप, क्लाउड CPU, और इंफ्रास्ट्रक्चर एक्सेलेरेटर—तीनों Arm कोर चाह सकते हैं, लेकिन वे सभी समान थर्मल बजट, डाई एरिया, या I/O व्यक्तित्व नहीं चाहते।
आइए बात करें कि Arm ने घोषणा में क्या साफ़-साफ़ नहीं बताया। Tom's Hardware रिपोर्ट करता है कि Arm ने हर संभावित कॉन्फ़िगरेशन के लिए अधिकतम क्लॉक स्पष्ट नहीं किए, भले ही प्लेटफ़ॉर्म 3.8 GHz तक चलता है। यह कोई स्कैंडल नहीं है; यह समझदार कार्डिगन पहने हुई भौतिकी है। ज़्यादा कोर का मतलब आम तौर पर ज़्यादा पावर डेंसिटी और हटाने के लिए ज़्यादा गर्मी होता है, और थर्मल वास्तविकता अक्सर ठीक उसी समय कीनोट वाले आशावाद को धोखा दे देती है जब रैक फैन तेज़ घूमने लगते हैं।
सेमी-कस्टम तरकीब वैलिडेशन है, सिर्फ़ अंदाज़ नहीं
Arm कहता है कि Neoverse CSS का मकसद उन डिज़ाइन और वैलिडेशन कार्यों को संभालकर time to silicon तेज़ करना है जो अलग पहचान नहीं बनाते, जबकि पार्टनर्स को बाज़ार-विशेष कस्टमाइज़ेशन की जगह मिलती रहती है। यही बिल्डर-केंद्रित हिस्सा है। अगर आप क्लाउड सिलिकॉन डिज़ाइन कर रहे हैं, तो आप शेड्यूलिंग, एक्सेलेरेशन, मेमोरी टोपोलॉजी, सुरक्षा, पैकेजिंग, या वर्कलोड ट्यूनिंग में अलग दिखना चाहेंगे, न कि अपने सबसे अच्छे इंजीनियरों को उसी कोर कॉम्प्लेक्स प्लंबिंग को फिर से वैरिफाई करने में लगाना चाहेंगे जिसकी ज़रूरत बाकी सबको भी है।
EDN Asia इस विचार के इर्द-गिर्द इकोसिस्टम की परत जोड़ता है और Arm Total Design को पाँच बिल्डिंग ब्लॉक्स के रूप में बताता है, जो सिलिकॉन डेवलपमेंट के चरणों में फैले हैं। प्रकाशन कहता है कि इस पहल में ASIC डिज़ाइन हाउस, IP वेंडर, EDA टूल प्रदाता, फाउंड्रीज़, और फर्मवेयर डेवलपर्स शामिल हैं, जिनमें Cadence और Synopsys भी शामिल EDA कंपनियों में हैं। व्यावहारिक रूप से, CSS इंजन क्रैडल है, और Total Design वह वर्कशॉप है जो लिफ्ट, टॉर्क रेंच, और ऐसे लोगों से भरी है जिन्हें पता है कि कौन सा कनेक्टर हमेशा उल्टा लग जाता है।
बोर्ड का किनारा है जहाँ Ranger दिलचस्प बनता है
Tom's Hardware रिपोर्ट करता है कि CSS N4 DDR5 या LPDDR6, साथ ही PCIe 7/6 की 128 लेन तक और CXL 4.0 सपोर्ट करता है। क्लाउड बनाने वालों को यह हिस्सा सरसरी तौर पर नहीं पढ़ना चाहिए। PCIe और CXL वही जगह हैं जहाँ CPU एक्सेलेरेटर्स, मेमोरी एक्सपैंशन, नेटवर्किंग कार्ड्स, और उन सभी अन्य रैक-स्तरीय उपकरणों से बातचीत करते हैं जो किसी प्रोसेसर को सुंदर डाई फ़ोटो से उपयोगी इंफ्रास्ट्रक्चर में बदलते हैं।
उसी Tom's Hardware रिपोर्ट के अनुसार, Ranger मल्टी-चिपलेट और मल्टी-सॉकेट डिज़ाइनों के ज़रिए 128 कोर से आगे स्केल कर सकता है, जिसमें चिप-टू-चिप इंटरकनेक्ट्स और पार्टनर-विशिष्ट PNYs के माध्यम से UCIe सपोर्ट है। यह Arm का चुपचाप यह मानना है कि सर्वर सिलिकॉन कहाँ जा रहा है: सब कुछ करने वाला एक वीर डाई नहीं, बल्कि कई हिस्से जो बहुत महँगी रिले रेस की तरह सिग्नल पास करते हैं। अगर वे लिंक जल्दी वैलिडेट हो जाते हैं, तो ग्राहकों को सिस्टम आर्किटेक्चर पर ज़्यादा ऊर्जा लगाने और पैकेज सब्सट्रेट में सिग्नल इंटीग्रिटी के शरारती भूतों का पीछा करने में कम ऊर्जा खर्च करनी पड़ती है।
आगे क्या देखें
अगला सवाल यह नहीं है कि 128 Arm कोर एक डाई पर फिट होते हैं या नहीं, क्योंकि Tom's Hardware कहता है कि Ranger TSMC N3P पर यह कर देता है। सवाल यह है कि ग्राहक असल में कौन से कॉन्फ़िगरेशन चुनते हैं। आठ से 128 कोर तक का फैलाव बहुत बड़ा है, और जीतने वाले डिज़ाइन शायद वे होंगे जो कैश, I/O, मेमोरी प्रकार, और चिपलेट रणनीति को कठोर ईमानदारी से संतुलित करें।
सर्वर हार्डवेयर पर नज़र रखने वाले पाठकों के लिए, Arm Neoverse CSS N4 Ranger याद दिलाता है कि आधुनिक चिप प्रतिस्पर्धा abstraction ladder पर ऊपर जा रही है। कोर अभी भी मायने रखते हैं, और मैं आपको कभी यह नहीं कहूँगा कि कैश टेबल को ऐसे न पढ़ें जैसे उसमें दफ़न खज़ाना हो। लेकिन असली हलचल अब वैलिडेटेड सबसिस्टम्स में है: वे पहले से इंटीग्रेटेड ब्लॉक्स जो क्लाउड सिलिकॉन टीमों को हर बार खाली schematic से शुरू किए बिना, ज़्यादा अजीब और ज़्यादा विशेष मशीनें बनाने देते हैं।
