
En este artículo (5)
Análisis semipersonalizado de Arm Neoverse CSS N4 Ranger
Puntos Clave
- Mira más allá del número de núcleos: la caché, la memoria y la E/S son las especificaciones que determinan la utilidad real de un servidor.
- Trata CSS N4 como un subsistema validado, no solo como el lanzamiento de un núcleo de CPU.
- Observa las configuraciones de los clientes para ver si los desarrolladores de la nube priorizan los núcleos, los chiplets, la memoria o la conectividad de aceleradores.
El subsistema semipersonalizado es menos un anuncio de CPU que un conjunto validado de piezas para silicio de servidor.
El subsistema semipersonalizado es menos un anuncio de CPU que un catálogo validado de componentes para silicio de servidores.
Un chip de servidor solía empezar con un núcleo y una larga peregrinación de ingeniería. Ahora Arm ofrece algo más parecido a una puerta de bóveda ya cableada: núcleos, caché, interfaces de memoria, E/S y conexiones de chip a chip ya organizadas para que los clientes pasen menos tiempo validando las partes aburridas y más tiempo decidiendo dónde esconder las joyas. Esa es la verdadera historia detrás de Arm Neoverse CSS N4 Ranger. La especificación principal es grande, según Tom's Hardware: entre ocho y 128 núcleos Neoverse N4 por dado, hasta 3,8 GHz, en el proceso N3P de TSMC. Pero el movimiento más interesante está en el empaquetado arquitectónico. Arm no solo vende un ladrillo más rápido; vende una sección de muro configurable con los conductos ya inspeccionados.
El subsistema en
el banco de pruebas Tom's Hardware describe el programa Compute Subsystem de Arm como una ruta semipersonalizada que permite a los clientes configurar el número de núcleos, el tamaño de la caché, la E/S y la conectividad alrededor de la IP de Arm. Los propios materiales de Neoverse CSS de Arm presentan estos subsistemas como plataformas de cómputo de infraestructura validadas y optimizadas para rendimiento, pensadas para descargar trabajo de diseño y validación no diferenciado. Traducción del dialecto de las hojas de datos: Arm intenta eliminar la parte del diseño de chips de servidor que se siente como depurar un backplane embrujado a las 2 de la mañana. Esto importa porque una CPU de nube, una DPU o un diseño con chiplets rara vez gana solo por el número de núcleos. Tom's Hardware informa que el mismo enfoque CSS ha aparecido en CPU de Azure y Google Cloud, además de DPU de Nvidia e Intel. La versión de película de atracos es sencilla: los núcleos son la banda, pero la huida depende de la memoria, los carriles de E/S y de si la interconexión de chiplets abre la puerta del garaje a tiempo.
La especificación enterrada bajo el número de núcleos Según
Tom's Hardware, Neoverse CSS N4 admite hasta 256 MB de caché L3 por dado, hasta 2 MB de caché L2 por núcleo y 64 KB de caché L1 de instrucciones y 64 KB de caché L1 de datos por núcleo. Esa cifra de L3 es la que yo rodearía en rojo antes de que alguien empiece a cantar sobre los 128 núcleos. Una gran granja de núcleos sin suficiente caché cercana es solo una multitud intentando pasar por un torniquete de metro mientras la DRAM se ríe desde el otro lado de la ciudad. Tom's Hardware también señala que Ranger es un gran paso más allá de Neoverse CSS N2, que llegaba como máximo a 64 núcleos. La gama N4 empieza desde solo ocho núcleos, lo cual es tan importante como el techo máximo, porque no todos los clientes están construyendo el mismo monstruo. Un chip de redes, una CPU de nube y un acelerador de infraestructura pueden querer núcleos Arm, pero no todos quieren el mismo presupuesto térmico, área de dado o personalidad de E/S. Hablemos de lo que Arm no detalló en el anuncio. Tom's Hardware informa que Arm no aclaró las frecuencias máximas para cada configuración posible, aunque la plataforma funciona hasta 3,8 GHz. Eso no es un escándalo; es la física con un cárdigan sensato. Más núcleos suelen significar mayor densidad de potencia y más calor que mover, y la realidad térmica tiene una forma de traicionar el optimismo de las presentaciones justo cuando los ventiladores del rack se aceleran.
El truco semipersonalizado es la validación, no las buenas vibras Arm dice que
Neoverse CSS está pensado para acelerar el tiempo hasta el silicio al encargarse de tareas de diseño y validación no diferenciadas, mientras deja a los socios espacio para la personalización específica de mercado. Esa es la parte enfocada en quienes construyen. Si estás diseñando silicio para la nube, preferirías diferenciarte en planificación, aceleración, topología de memoria, seguridad, empaquetado o ajuste de cargas de trabajo, en lugar de dedicar a tus mejores ingenieros a volver a verificar la misma fontanería del complejo de núcleos que todos los demás también necesitan. EDN Asia añade la capa de ecosistema alrededor de esta idea, describiendo Arm Total Design como cinco bloques de construcción que abarcan etapas del desarrollo de silicio. La publicación dice que la iniciativa incluye casas de diseño ASIC, proveedores de IP, proveedores de herramientas EDA, fundiciones y desarrolladores de firmware, con Cadence y Synopsys entre las empresas de EDA involucradas. En términos prácticos, CSS es la cuna del motor, y Total Design es el taller lleno de elevadores, llaves dinamométricas y personas que saben qué conector siempre se instala al revés.
El borde de la placa es donde Ranger se vuelve interesante
Tom's Hardware informa que CSS N4 admite DDR5 o LPDDR6, además de hasta 128 carriles de PCIe 7/6 y CXL 4.0. Esa es la parte que los constructores de nube no deberían pasar por alto. PCIe y CXL son donde las CPU negocian con aceleradores, expansión de memoria, tarjetas de red y todos los demás artilugios de nivel rack que convierten un procesador de una bonita foto del dado en infraestructura útil. El mismo informe de Tom's Hardware dice que Ranger puede escalar más allá de 128 núcleos mediante diseños multichiplet y multisocket, con soporte UCIe a través de interconexiones de chip a chip y PNY específicos de socios. Esa es la forma discreta en que Arm reconoce hacia dónde va el silicio de servidor: no un dado heroico haciendo todo, sino múltiples piezas pasándose señales como una carrera de relevos muy cara. Si esos enlaces se validan temprano, los clientes pueden dedicar más energía a la arquitectura del sistema y menos a perseguir duendes de integridad de señal por el sustrato del encapsulado.
Qué observar a continuación La siguiente pregunta no es si 128 núcleos Arm caben
en un dado, porque Tom's Hardware dice que Ranger lo hace en TSMC N3P. La pregunta es qué configuraciones eligen realmente los clientes. De ocho a 128 núcleos es un rango enorme, y los diseños ganadores pueden ser los que equilibren caché, E/S, tipo de memoria y estrategia de chiplets con una honestidad brutal. Para quienes siguen el hardware de servidores, Arm Neoverse CSS N4 Ranger es un recordatorio de que la competencia moderna de chips está subiendo por la escalera de la abstracción. Los núcleos siguen importando, y nunca te diré que no leas la tabla de caché como si contuviera un tesoro enterrado. Pero la verdadera acción ahora está en los subsistemas validados: los bloques preintegrados que permiten a los equipos de silicio para la nube construir máquinas más extrañas y especializadas sin empezar desde un esquema en blanco cada vez.