
En este artículo (4)
Análisis de Nemotron 3.5 Lightning: la facilidad de implementación gana
Puntos Clave
- Evalúa la capacidad de despliegue, no solo el número de parámetros, al comparar modelos de agentes de pesos abiertos.
- Prueba el comportamiento en contextos largos y la velocidad de servicio antes de apostar por Nemotron 3.5 Lightning en producción.
- Revisa OpenMDW 1.1 y las recetas de Nvidia con antelación si planeas una personalización comercial.
Un modelo MoE de 30B con 3B de parámetros activos, contexto de 1M, licencia OpenMDW-1.1 y recetas convierte el despliegue en la historia.
Un modelo MoE de 30B con 3B de parámetros activos, contexto de 1M, licencia OpenMDW-1.1 y recetas hace que el despliegue sea lo importante.
El concurso de modelos abiertos solía ser una exhibición de fisicoculturismo para los recuentos de parámetros. Todos presumían números más grandes, y nadie preguntaba si aquello podía pasar realmente por la puerta de despliegue sin llevarse por delante el marco, el panel de yeso y a tres becarios. Nemotron 3.5 Lightning de Nvidia es interesante porque plantea el argumento más discreto: los pesos abiertos están dejando de tratarse de quién tiene el modelo más grande y están pasando a tratarse de quién puede lanzar uno útil. Según NVIDIA NIM, Nemotron 3.5 Lightning llegó el 11 de agosto de 2026 como un modelo de 30B con 3B de parámetros activos, una configuración de mezcla de expertos que mantiene dormida a la mayor parte del modelo mientras una porción más pequeña hace el trabajo. Eso no es modestia, exactamente. Es más bien como contratar un estadio lleno de consultores y dejar que solo tres entren a la reunión, lo cual, francamente, es un avance en gestión.
Artificial Analysis pone a dieta la exhibición de tamaño
Artificial Analysis informa que Nemotron 3.5 Lightning es el primer modelo Nemotron 3.5 y el sucesor de NVIDIA Nemotron 3 Nano 30B A3B. Su contabilidad enumera 31,6B de parámetros totales y 3,6B de parámetros activos, al tiempo que señala que el modelo conserva la arquitectura híbrida Mamba-Transformer de Nemotron 3 Nano. La parte útil es el movimiento en las puntuaciones: Artificial Analysis da a Lightning un 24 en su Índice de Inteligencia, frente al 15 de Nemotron 3 Nano, lo que lo coloca al mismo nivel que gpt-oss-120b de OpenAI con 24 y justo por detrás de Nemotron 3 Super con 26, un modelo que Artificial Analysis describe como unas cuatro veces más grande.
Esa comparación es el punto clave. Que un modelo más pequeño de pesos abiertos iguale a un rival con nombre mucho más grande en un índice de inteligencia no significa que debas tirar las evaluaciones y lanzarte a producción con capa. Sí significa que la pregunta de construcción cambia de si este modelo puede ganar la tabla de clasificación a si este modelo puede ejecutarse de forma barata, rápida y legal dentro del producto que realmente tienes.
NVIDIA NIM presenta el argumento de despliegue
NVIDIA NIM's model card da la forma orientada a desarrolladores de ese argumento: NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 usa una arquitectura híbrida de MoE, Mamba-2, MoE y Attention, admite longitudes de contexto de hasta 1M de tokens y enumera inglés, lenguajes de programación, español, francés, alemán, italiano y japonés. Esos no son solo adornos de una hoja de especificaciones. Una ventana de un millón de tokens cambia lo que los equipos pueden intentar con documentos largos, trazas de herramientas, contexto de repositorios y memoria de agentes, siempre que puedan evitar que la higiene de recuperación se convierta en un cajón de trastos con JSON. La misma tarjeta de NVIDIA NIM enumera la licencia como OpenMDW License Agreement, versión 1.1. Para los equipos que evalúan el uso comercial, esa línea de licencia debe estar junto a la latencia, el coste de alojamiento y la política de datos en la lista de comprobación de diligencia debida, no en una triste carpeta PDF llamada legal más tarde. NVIDIA también dice que Nemotron es una familia de modelos abiertos con pesos abiertos, datos de entrenamiento y recetas, que es la parte subestimada: las recetas son donde la reproducibilidad deja de ser vibras con bata de laboratorio.
El blog técnico de
NVIDIA lo presenta como fontanería para agentes El blog técnico de NVIDIA, escrito por Chris Alexiuk y Chintan Patel, enmarca Nemotron 3.5 Lightning en torno a la ejecución rápida y precisa de tareas especializadas para agentes de larga duración. NVIDIA NIM es aún más explícito sobre el papel previsto, llamándolo ideal para agentes autónomos de larga duración, despliegues de subagentes de trabajo pesado y flujos de trabajo agénticos. Esa es una forma de producto muy diferente a la de un único modelo oráculo gigante que responde a todas las preguntas como un mago privado de sueño con una credencial de compras. Aquí es donde importa el diseño de parámetros activos. La inferencia para agentes suele ser una muerte por mil llamadas: planificar, buscar, resumir, llamar a una herramienta, inspeccionar el resultado, reintentar, disculparse ante los registros, repetir. Un modelo que mantiene bajo el cómputo activo mientras conserva un razonamiento utilizable puede convertirse en la capa intermedia aburrida que hace la mayor parte del trabajo, y las capas intermedias aburridas son cómo el software realmente llega a generar ingresos.
Artificial Analysis muestra el intercambio que los desarrolladores deberían
probar Artificial Analysis es cuidadoso con el intercambio. Dice que Nemotron 3.5 Lightning queda por detrás de Qwen3.6 35B A3B, que obtiene 32, y de Muse Glimmer, marcado como alto con 35, entre los modelos pequeños de su clase de tamaño. Pero en pruebas previas al lanzamiento de un endpoint de DeepInfra que servía los pesos finales NVFP4, Artificial Analysis midió velocidades medianas de salida de casi 670 tokens por segundo, que es el tipo de cifra que hace que los bucles de agentes se sientan menos como mirar cómo se enfría una sopa. Los números agénticos también son donde este lanzamiento se vuelve más que ligeramente picante. Artificial Analysis informa de las mayores mejoras frente a Nemotron 3 Nano en evaluaciones agénticas, incluido GDPval-AA v2 con un aumento de más 334 ELO que superó a gpt-oss-120b y Nemotron 3 Super, además de mejoras en Termina. Eso no convierte a Lightning en la respuesta universal, porque las respuestas universales en IA suelen ser solo facturas con perfume. Sí lo convierte en un candidato serio para equipos que construyen agentes que necesitan velocidad, contexto largo, pesos abiertos y suficiente transparencia para ajustar en lugar de rezar. Para los lectores que construyen con modelos abiertos, el siguiente paso útil no es discutir sobre totales de parámetros en internet, aunque respeto el cardio. Prueba la superficie real de despliegue: relleno de contexto frente a recuperación, comportamiento de servicio con NVFP4, latencia de los bucles de agentes, revisión de licencias y si las recetas de NVIDIA se adaptan a los datos de tu propio dominio. El concurso de pesos abiertos ya no es un rally de monster trucks; es un departamento de envíos con un presupuesto de latencia.