d-Matrix Raptor 3D-DRAM मेमोरी मूवमेंट विश्लेषण
मुख्य बातें
- कंप्यूट दावों की तुलना करने से पहले AI इन्फरेंस को मेमोरी मूवमेंट की समस्या के रूप में देखें।
- KV कैश की वृद्धि पर ध्यान दें, क्योंकि लंबा कॉन्टेक्स्ट और बैच साइज सर्विंग हार्डवेयर आवश्यकताओं पर हावी हो सकते हैं।
- वास्तविक वर्कलोड के तहत बैंडविड्थ, पावर, रेज़िलिएंस और थर्मल व्यवहार के आधार पर 3D-स्टैक्ड डिज़ाइनों का मूल्यांकन करें।
रैप्टर यह समझने के लिए एक उपयोगी विश्लेषणात्मक दृष्टि देता है कि जनरेटिव इन्फ़रेंस हार्डवेयर को केवल गणितीय इकाइयों के बजाय डेटा लोकैलिटी के आसपास क्यों डिज़ाइन किया जा रहा है।
रैप्टर यह समझने के लिए एक उपयोगी विश्लेषणात्मक दृष्टिकोण है कि जनरेटिव इन्फ़रेंस हार्डवेयर को केवल गणितीय इकाइयों के बजाय डेटा लोकैलिटी के आधार पर क्यों डिज़ाइन किया जा रहा है।
d-Matrix के Raptor की सबसे दिलचस्प बात उसका accelerator logic नहीं है। वह है उसका “आना-जाना” यानी data commute। हर generated token एक छोटी-सी courier job जैसा है, और आधुनिक inference hardware को अब बढ़ती हुई मात्रा में इस बात से आँका जाता है कि उस courier को dinner ठंडा होने से पहले groceries कितनी दूर तक ढोनी पड़ती हैं। अधिक compute अब भी मायने रखता है, लेकिन असली नाटक memory movement की ओर जा रहा है, जहाँ capacitance, distance, bandwidth और heat बहुत छोटे accountants की तरह हर transaction की जाँच करते हैं।
मेमोरी वॉल मंच पर आती है ServeTheHome ने रिपोर्ट किया कि d-Matrix
ने Hot Chips 2026 में generative inference के लिए अपना Raptor 3D-DRAM accelerator पेश किया, और इसका framing ताज़गी भरा physical था: model weights बढ़ते जा रहे हैं, जबकि KV cache की demand context length को batch size से गुणा करने पर scale होती है। ServeTheHome के writeup में छिपा हुआ धमाका यह है कि 1M context पर 64 users का मतलब लगभग 935 GB KV cache हो सकता है। यह अब कोई प्यारा-सा cache नहीं है। यह loading dock और scheduling problem वाला एक warehouse है। Raptor early silicon paper इसी विचार को academic steel-toe boots पहनाकर रखता है, यह कहते हुए कि "Generative Inference is largely memory-bound." Paper के अनुसार, autoregressive decoding inference runtime पर हावी रहती है और memory bandwidth तथा capacity की demand को बढ़ाती है। Inference systems खरीदने या बनाने वाले किसी भी व्यक्ति के लिए अनुवाद: अगर accelerator के पास गर्व करने लायक math units हैं, लेकिन वह model state को ऐसे fetch करता रहता है जैसे कोई teenager खोया हुआ charger ढूँढ रहा हो, तो user को lovely specsmanship नहीं, latency महसूस होती है।
Teardown angle: pantry को kitchen के नीचे रखो Igor'sLAB Raptor
को एक 3D-DRAM design के रूप में वर्णित करता है जो compute logic के नीचे memory stack करता है, जबकि Raptor paper 3D-stacked logic-on-DRAM को मौजूदा memory choices के बीच की खराब खाई को बंद करने का तरीका बताता है। Paper की तुलना महत्वपूर्ण है: SRAM-based accelerators high bandwidth दे सकते हैं लेकिन capacity सीमित होती है, जबकि HBM DRAM capacity देता है लेकिन bandwidth और power से constrained रहता है। यह hardware equivalent है—या तो teleportation वाला नन्हा chef चुनिए, या तीन blocks दूर एक विशाल pantry। Raptor की thesis सिर्फ chip के पास और memory bolt कर देने और काम खत्म मान लेने की नहीं है। यह data locality को पूरी heist movie का plot बनाने की है। Vault KV cache है, getaway driver bandwidth है, और memory interface के पार हर गैरज़रूरी trip clipboard पकड़े हुए security guard है। अगर data वहीं के करीब रहता है जहाँ math होती है, तो हर token को कम toll booths पार करने पड़ते हैं।
छिपा हुआ spec bandwidth है Raptor paper कहता
है कि उसका stream-blocking approach KV-cache streams को configurable 3D-DRAM channels पर map करता है, जिससे bank-level parallelism बनाए रखते हुए प्रति card 100 TB/s तक sustain होता है। Igor'sLAB भी अपनी Raptor coverage में 100 TB/s figure को highlight करता है। यह वह spec है जिसे लाल घेरे में चिन्हित करना चाहिए, क्योंकि यह सिर्फ peak compute theater के बजाय सीधे token serving, long context और batch behavior से बात करता है। आइए बात करें कि TOPS slide क्या बचा नहीं सकती। Inference अक्सर compute costume पहने हुए memory logistics problem होती है, खासकर decoding के दौरान। किसी system में impressive arithmetic density हो सकती है, लेकिन अगर वह weights और KV cache को efficiently moving नहीं रख सकता, तो arithmetic units ऐसे बैठे रहते हैं जैसे race cars garage unlock होने का इंतज़ार कर रही हों। Builders के लिए इसका मतलब है कि benchmark questions की शुरुआत memory bandwidth, usable capacity, latency behavior, और memory subsystem पर power से होनी चाहिए, न कि सिर्फ headline compute से।
कठिन हिस्सा magic नहीं, packaging physics है Raptor paper उपयोगी
है क्योंकि यह 3D-DRAM को fairy wand बताने का दिखावा नहीं करता। यह चार integration challenges सूचीबद्ध करता है: parallelism का फायदा उठाने के लिए workload-aware mapping, burst-based data bus inversion के बिना power optimization, high bank counts के साथ resilience, और elevated junction temperatures पर thermal reliability। Heat वह जगह है जहाँ optimism incident reports भरने जाता है, और stacked structures में thermal reliability सचमुच गंभीर जाँच की हकदार है क्योंकि proximity ही trick भी है और tax भी। वही paper कहता है कि Raptor practical 3D-DRAM integration को कामयाब बनाने के लिए architectural features लाता है, जिसमें memory-subsystem energy घटाने के लिए single-cycle µbump interface पर pinless DBI शामिल है। यह एक गहरी hardware sentence है, लेकिन reader version सरल है: data को कम move करना अच्छा है, और हर move को सस्ता बनाना उससे भी बेहतर है। Inference silicon का भविष्य केवल वही नहीं जीतेगा जो सबसे बड़ा compute number चिल्लाएगा। ध्यान दें कि कौन model को feed कर सकता है बिना memory system को invoices वाला space heater बनाए। AI infrastructure को track करने वाले readers के लिए Raptor एक signpost है। अगली meaningful comparisons को यह पूछना चाहिए कि accelerators KV cache growth को कैसे handle करते हैं, stacked memory designs real serving loads के तहत thermally honest रहते हैं या नहीं, और claimed bandwidth का कितना हिस्सा actual generative inference workloads द्वारा usable है। सबसे ज़्यादा मायने रखने वाले chips वे हो सकते हैं जो data movement को boring बना देते हैं, क्योंकि hardware में, boring अक्सर victory की आवाज़ होती है।
