
En este artículo (4)
Análisis del movimiento de memoria 3D-DRAM d-Matrix Raptor
Puntos Clave
- Trata la inferencia de IA como un problema de movimiento de memoria antes de comparar afirmaciones de cómputo.
- Vigila el crecimiento de la caché KV, porque el contexto largo y el tamaño de lote pueden dominar las necesidades de hardware de servicio.
- Evalúa los diseños apilados en 3D por ancho de banda, potencia, resiliencia y comportamiento térmico bajo cargas de trabajo reales.
Raptor es una lente de análisis útil para entender por qué el hardware de inferencia generativa se está diseñando en torno a la localidad de los datos, y no solo a las unidades matemáticas.
Raptor es una lente de desmontaje útil para entender por qué el hardware de inferencia generativa se está diseñando en torno a la localidad de los datos, no solo a las unidades matemáticas.
Lo más interesante del Raptor de d-Matrix no es la lógica del acelerador. Es el trayecto. Cada token generado es un pequeño encargo de mensajería, y el hardware moderno de inferencia se juzga cada vez más por cuán lejos tiene que llevar ese mensajero la compra antes de que la cena se enfríe. Más cómputo sigue importando, pero el drama se está trasladando al movimiento de memoria, donde la capacitancia, la distancia, el ancho de banda y el calor se comportan como contables diminutos revisando cada transacción.
El muro de memoria entra en escena ServeTheHome informó que d-Matrix presentó su
acelerador Raptor 3D-DRAM para inferencia generativa en Hot Chips 2026, y el enfoque fue refrescantemente físico: los pesos de los modelos siguen creciendo, mientras que la demanda de caché KV escala con la longitud del contexto multiplicada por el tamaño del lote. La gran advertencia escondida en el artículo de ServeTheHome es que 64 usuarios con un contexto de 1M pueden significar aproximadamente 935 GB de caché KV. Eso ya no es una caché simpática. Es un almacén con muelle de carga y un problema de planificación. El artículo sobre el silicio inicial de Raptor expresa la misma idea con botas académicas de seguridad, al afirmar que “la inferencia generativa está limitada en gran medida por la memoria”. Según el artículo, la decodificación autorregresiva domina el tiempo de ejecución de la inferencia e impulsa las demandas de ancho de banda y capacidad de memoria. Traducción para cualquiera que compre o construya sistemas de inferencia: si el acelerador tiene orgullosas unidades matemáticas pero sigue buscando el estado del modelo como un adolescente buscando un cargador perdido, el usuario experimenta latencia, no una hermosa exhibición de especificaciones.
El ángulo del desmontaje: poner la despensa debajo de
la cocina Igor'sLAB describe Raptor como un diseño 3D-DRAM que apila memoria debajo de la lógica de cómputo, mientras que el artículo de Raptor describe la lógica 3D apilada sobre DRAM como una forma de cerrar una brecha desagradable entre las opciones de memoria existentes. La comparación del artículo es la importante: los aceleradores basados en SRAM pueden ofrecer gran ancho de banda pero capacidad limitada, mientras que la DRAM HBM proporciona capacidad pero está limitada por el ancho de banda y la potencia. Eso es el equivalente en hardware de elegir entre un chef diminuto con teletransportación y una despensa gigante a tres manzanas de distancia. La tesis de Raptor no es simplemente atornillar más memoria cerca de un chip y dar el asunto por terminado. Es convertir la localidad de los datos en la trama de toda la película de atracos. La cámara acorazada es la caché KV, el conductor de la fuga es el ancho de banda, y cada viaje innecesario a través de una interfaz de memoria es un guardia de seguridad con una tablilla. Si los datos viven más cerca de donde ocurren las matemáticas, cada token tiene menos peajes que cruzar.
La especificación escondida es el ancho de banda
El artículo de Raptor dice que su enfoque de bloqueo de flujos asigna los flujos de caché KV a canales 3D-DRAM configurables, sosteniendo hasta 100 TB/s por tarjeta mientras conserva el paralelismo a nivel de banco. Igor'sLAB también destaca la cifra de 100 TB/s en su cobertura de Raptor. Ese número es la especificación que hay que marcar en rojo, porque habla directamente del servicio de tokens, el contexto largo y el comportamiento por lotes, en lugar de limitarse al teatro del cómputo pico. Hablemos de lo que la diapositiva de TOPS no puede rescatar. La inferencia suele ser un problema de logística de memoria disfrazado de cómputo, especialmente durante la decodificación. Un sistema puede tener una densidad aritmética impresionante, pero si no puede mover de forma eficiente los pesos y la caché KV, las unidades aritméticas se quedan esperando como coches de carreras a que alguien abra el garaje. Para quienes construyen estos sistemas, esto significa que las preguntas de evaluación deberían empezar por el ancho de banda de memoria, la capacidad utilizable, el comportamiento de latencia y la potencia del subsistema de memoria, no solo por el cómputo destacado en el titular.
La parte difícil no es magia,
es física del empaquetado El artículo de Raptor es útil porque no finge que la 3D-DRAM sea una varita mágica. Enumera cuatro desafíos de integración: mapeo consciente de la carga de trabajo para explotar el paralelismo, optimización de potencia sin inversión de bus de datos basada en ráfagas, resiliencia con altos recuentos de bancos y fiabilidad térmica a temperaturas de unión elevadas. El calor es donde el optimismo va a rellenar informes de incidentes, y la fiabilidad térmica en estructuras apiladas merece una revisión seria porque la proximidad es tanto el truco como el coste. El mismo artículo dice que Raptor introduce funciones arquitectónicas pensadas para hacer viable la integración práctica de 3D-DRAM, incluida DBI sin pines en una interfaz de microbumps de un solo ciclo para reducir la energía del subsistema de memoria. Esa es una frase muy de hardware, pero la versión para el lector es sencilla: mover menos datos es bueno, y hacer que cada movimiento sea más barato es aún mejor. El futuro del silicio de inferencia no lo ganará solo quien grite el número de cómputo más grande. Observa quién puede alimentar al modelo sin convertir el sistema de memoria en un calefactor con facturas. Para los lectores que siguen la infraestructura de IA, Raptor es una señal en el camino. Las próximas comparaciones significativas deberían preguntar cómo manejan los aceleradores el crecimiento de la caché KV, si los diseños de memoria apilada se mantienen térmicamente honestos bajo cargas reales de servicio y cuánto del ancho de banda declarado es utilizable por cargas de trabajo reales de inferencia generativa. Los chips que más importan pueden ser los que vuelven aburrido el movimiento de datos, porque en hardware, lo aburrido suele ser el sonido de la victoria.