
En este artículo (4)
Análisis económico de la caché KV de AgentX InferenceXv3
Puntos Clave
- Evalúa agentes con contexto largo y trazas de múltiples turnos, no solo con demostraciones limpias de un único intercambio.
- Haz seguimiento de la tasa de aciertos de KVCache y del costo total de tokens como métricas centrales de producción para cargas de trabajo de agentes.
- Compara pilas y plataformas de serving en conjunto, porque el costo depende de todo el entorno de inferencia.
Las cargas de trabajo de los agentes no son solo chats más largos. Son máquinas de costos complejas y de varios turnos, donde la forma de prestar el servicio ahora importa tanto como la elección del modelo.
Las cargas de trabajo de los agentes no son solo chats más largos. Son sistemas complejos de costos de varios turnos, donde el comportamiento de servicio ahora importa tanto como la elección del modelo.
Un chatbot pide una respuesta. Un agente trae una maleta con ruedas, tres subagentes, un millón de tokens de contexto y la sincera creencia de que tu presupuesto de inferencia es solo una sugerencia. El informe AgentX InferenceXv3 de SemiAnalysis cae en ese espacio incómodo pero útil entre la magia de las demos y las matemáticas de producción. Los titulares son inusualmente directos: SemiAnalysis cita un conjunto de datos de 3 millones de dólares estadounidenses, una longitud de contexto de más de 1 millón, cargas de trabajo de múltiples turnos, subagentes y una tasa de aciertos de KVCache superior al 95%. Eso no es un concurso de belleza de modelos. Es una auditoría de la pila de servicio con gabardina.
La actualización, según SemiAnalysis
SemiAnalysis describe AgentX 1.0 como un benchmark de inferencia de programación agéntica, de múltiples turnos, totalmente de código abierto, con 1 millón de contexto, publicado bajo Apache 2.0. El informe enmarca el lanzamiento alrededor de una pregunta específica: si el foso de CUDA se mantiene en la inferencia agéntica. Dejaré el combate de jaula de chips a Theo, porque él es dueño de la cúpula del trueno del silicio. Para quienes construyen, el punto inmediato es más sencillo: el benchmark está diseñado en torno al comportamiento de los agentes, no solo al chat educado de “prompt entra, respuesta sale”.
SemiAnalysis también dice que las cargas de trabajo agénticas de contexto largo y múltiples turnos han crecido rápidamente desde el punto de inflexión de Claude Code en noviembre de 2025, y que ahora dominan el tráfico de inferencia en producción. El mismo informe dice que el gasto agéntico empresarial de OpenAI superó al gasto en ChatGPT en abril de 2026. Son afirmaciones grandes, y la consecuencia operativa es más grande que la marca. Si tu benchmark todavía se parece a un único intercambio ordenado, tu banco de pruebas quizá esté midiendo una postura de yoga mientras producción está montando muebles dentro de un camión en movimiento.
El campo de batalla es
el comportamiento de la caché, sostiene SemiAnalysis por lo que mide
La parte más importante del adelanto de SemiAnalysis puede ser lo que coloca lado a lado: longitud de contexto de más de 1 millón, múltiples turnos, subagentes y una tasa de aciertos de KVCache superior al 95%. Esa combinación les dice a quienes construyen hacia dónde se está moviendo la presión. Los sistemas agénticos acumulan contexto, vuelven sobre trabajo previo y reparten tareas entre subagentes, así que la capa de servicio debe evaluarse como parte del producto, no como un detalle aburrido de fontanería escondido detrás de la tarjeta del modelo. Y la fontanería, por fastidioso que sea, es donde se inunda el sótano.
Esto no significa que la calidad del modelo haya dejado de importar. Significa que la calidad del modelo por sí sola es una explicación incompleta del coste y la latencia de los agentes cuando las cargas de trabajo son largas y de múltiples turnos. SemiAnalysis está pidiendo, en la práctica, que proveedores y usuarios muestren cómo se comporta el sistema bajo la forma del tráfico agéntico real. La conclusión práctica es tratar la tasa de aciertos de KVCache como una métrica de benchmark de primera clase porque el informe lo hace, en lugar de tratarla como una nota al pie para las tres personas que leen salidas de perfiladores por diversión.
InferenceX convierte el servicio agéntico en una tabla de costes
El resumen complementario de InferenceX de SemiAnalysis informa los costes de inferencia agéntica como coste por millón de tokens totales, donde más bajo es mejor. Dice que las cifras usan el mejor margen de servicio observado de cada plataforma para el escenario mostrado con cada modelo, basándose en InferenceX y las encuestas de precios de mercado de SemiAnalysis de julio de 2026, además de un modelo de TCO de nube de IA. Eso importa porque la inferencia agéntica no se trata solo de tokens generados, sino de todo el margen de servicio alrededor de una carga de trabajo. La hoja de cálculo ha entrado al chat, y ha traído recibos.
Para el escenario DeepSeek V4 Pro 1.6T mostrado en InferenceX, la tabla compara B200 Reference, MI355X, B300, GB200 NVL72 y GB300 NVL72. InferenceX lista MI355X a 0,355 dólares por millón de tokens totales y lo describe como un 18% más caro que B200, usando SGLang y FP4. Lista B300 a 0,245 dólares y lo describe como un 18% más barato que B200, también usando SGLang y FP4, mientras que la referencia B200 se muestra con vLLM y FP4. Lo interesante no es solo qué fila es más barata. Es que la pila de software, la precisión, la plataforma y la forma de la carga de trabajo ahora son inseparables en la historia de costes.
Qué deberían hacer ahora quienes construyen, según SemiAnalysis e InferenceX
En conjunto, el informe AgentX de SemiAnalysis y el resumen de costes de InferenceX sugieren un ciclo de evaluación más útil para productos de agentes. Haz benchmarks con contexto largo si tu producto usa contexto largo. Prueba flujos de trabajo de múltiples turnos y con subagentes si tu producto depende de ellos. Sigue la tasa de aciertos de KVCache porque SemiAnalysis destaca el 95%+ como una propiedad principal, y compara el coste por millón de tokens totales porque InferenceX usa eso como unidad de comparación económica.
Lo siguiente que hay que observar es si más proveedores publican resultados de inferencia con forma de agente en lugar de vueltas de victoria con forma de chat. Quienes construyen deberían pedir resultados sobre la carga de trabajo que realmente ejecutan, incluyendo longitud de contexto, estructura de turnos, pila de servicio y coste total de tokens. Los inversores también deberían prestar atención, porque los márgenes de los agentes pueden depender tanto de la eficiencia del servicio como de qué nombre de modelo se ve mejor en una presentación. El modelo todavía puede ser brillante, pero en el servicio agéntico, el contable ha descubierto la caché.