
En este artículo (4)
Costos de inferencia de IA: análisis de Gartner sobre el aumento de cinco veces para 2028
Puntos Clave
- Mida el costo por flujo de trabajo de agente completado, no el costo promedio por prompt.
- Añada enrutamiento, almacenamiento en caché, límites de tokens y puertas de aprobación antes de que escale el uso de agentes.
- Exija valor empresarial y propiedad para los proyectos de agentes, o aumentará el riesgo de cancelación.
Los flujos de trabajo de agentes están trasladando el control de costes de la consola del modelo a las reuniones de producto, finanzas y gobernanza.
Los flujos de trabajo de agentes están trasladando el control de costos desde la consola del modelo hacia las reuniones de producto, finanzas y gobernanza.
La demostración de IA más barata sigue siendo la que nunca llega a un usuario real. Una vez que un agente empieza a planificar, recuperar contexto, llamar herramientas, revisar su propio trabajo y volver a hacerlo porque la primera respuesta no era útil, la factura deja de parecer un experimento de chatbot. La nueva previsión de Gartner pone una cifra a esa inquietud: se espera que el coste de inferencia por flujo de trabajo agéntico aumente más de cinco veces hasta 2028. No es una fecha límite de cumplimiento, pero cualquiera que esté llevando flujos de trabajo autónomos a producción debería tratarla como si lo fuera.
De qué está advirtiendo realmente Gartner
El comunicado de prensa de Gartner dice que los costes de inferencia de IA por flujo de trabajo agéntico aumentarán más de cinco veces hasta 2028. Techstrong.ai, al informar sobre la misma investigación de Gartner, añade la parte incómoda: se espera que el aumento ocurra incluso aunque bajen los precios de los tokens, porque los modelos de razonamiento más capaces pueden consumir más tokens y más cómputo mientras los agentes avanzan por múltiples pasos y decisiones. En palabras sencillas, unos ingredientes más baratos no ayudan mucho si la receta ahora usa muchos más.
Esto importa porque un flujo de trabajo agéntico no es una sola indicación con una respuesta ordenada. Techstrong.ai describe agentes que avanzan por múltiples pasos y decisiones, que es precisamente donde los equipos financieros deberían dejar de aceptar el coste medio por consulta como la métrica relevante. La unidad de cuenta es el flujo de trabajo completado, incluidos los intentos fallidos, los reintentos, la recuperación de información, las llamadas a herramientas y la escalada. Si tu panel no puede mostrar eso, no está midiendo aquello sobre lo que Gartner está advirtiendo.
La traducción práctica es sencilla. Los equipos de producto deben decidir qué flujos de trabajo merecen un tratamiento agéntico, los equipos de ingeniería deben dirigir el trabajo más barato a modelos más baratos, y finanzas necesita límites antes de que el uso escale. Llamar a esto una preocupación de ingeniería es la forma en que las sorpresas se convierten en explicaciones trimestrales.
La pila de control
de costes ahora es gobernanza Techstrong.ai dice que Gartner recomienda niveles de inferencia, límites de tokens y monitorización para mantener bajo control los costes de la IA agéntica. Zylos Research describe una disciplina relacionada, Inference FinOps, centrada en gobernar, enrutar, almacenar en caché y arbitrar el gasto de cómputo de IA entre proveedores. Si quitamos la etiqueta, la obligación resulta familiar: saber qué se está ejecutando, por qué se está ejecutando, quién lo aprobó y cuándo debería detenerse.
Para quienes construyen estos sistemas, eso convierte las decisiones de arquitectura en controles de política. El enrutamiento decide si una solicitud necesita un modelo de razonamiento de frontera o un modelo más barato. El almacenamiento en caché decide si el sistema vuelve a pagar por un contexto que ya ha recuperado. Las puertas de aprobación deciden si el agente puede seguir gastando tokens, invocar herramientas o transferir el caso a una persona. No son adornos para una revisión de arquitectura. Son el equivalente en costes de los controles de acceso.
Zylos Research también dice que la inferencia representó el 85% del presupuesto empresarial de IA en 2026 y aproximadamente dos tercios del gasto global en cómputo de IA. Estima que una sola llamada a una API de chatbot podría costar 0,001 dólares, mientras que un agente de varios pasos que planifica, recupera contexto, invoca herramientas, reflexiona y se autocorrige puede costar entre 0,10 y 1,00 dólares por tarea completada. Esas cifras no encajarán limpiamente con todos los contratos de proveedores, naturalmente. Sí explican por qué compras empezará a hacer preguntas más difíciles que si la demostración parecía fluida.
El riesgo de cancelación no trata
de la magia del modelo Forbes, citando a Gartner, informa de que más del 40% de los proyectos de IA agéntica podrían cancelarse para finales de 2027, y atribuye las cancelaciones a problemas de gestión más que a las capacidades de los modelos. Las razones citadas son una gobernanza deficiente, un valor empresarial indefinido y una disciplina operativa insuficiente, incluidos casos en los que se etiqueta incorrectamente a chatbots como verdaderos agentes. Esa es la versión menos glamurosa de la historia, lo que normalmente significa que es la que merece la pena leer.
Aquí es donde ayudan los hábitos del derecho y la política, incluso cuando ningún regulador obliga a hacerlo. Define el propósito antes del despliegue. Registra los derechos de decisión antes de que el sistema actúe. Establece umbrales de coste, gestión de errores y revisión humana antes de que el piloto pase a formar parte de las operaciones diarias. Si eso suena a papeleo, felicidades: has descubierto la producción.
Inside Privacy informa de que la Oficina del Comisionado de Información del Reino Unido publicó en enero de 2026 unas primeras reflexiones sobre las implicaciones de la IA agéntica para la protección de datos, aunque señaló que el informe no era una guía regulatoria formal. La distinción importa. La ICO no creó un nuevo reglamento en ese informe, pero su interés indica que la autonomía, el acceso a datos y la rendición de cuentas son ahora cuestiones de política además de cuestiones de producto.
Qué cambia en la práctica hasta 2028
La previsión de Gartner para 2028 no exige que nadie cierre sus proyectos de agentes. Sí exige una conversación de aprobación diferente. Un flujo de trabajo debería tener un valor esperado, un coste esperado de finalización, una vía de respaldo y una persona responsable designada antes de obtener acceso amplio a usuarios o herramientas internas. Si faltan esos cuatro elementos, el agente no es autónomo. Es gasto sin supervisión con una interfaz amable.
El siguiente movimiento útil no es prohibir los agentes ni comprar otro panel porque un proveedor haya usado la palabra gobernanza. Empieza por los flujos de trabajo en los que la autonomía tiene un beneficio medible, y luego aplica enrutamiento, almacenamiento en caché, límites de tokens, monitorización y puertas de aprobación antes de que llegue el volumen. Vigila la previsión de costes de Gartner hasta 2028, la tasa de cancelación reportada hasta finales de 2027 y a los reguladores de privacidad que rondan los sistemas agénticos. Los equipos que traten la economía de la inferencia como política de producto tendrán menos reuniones dramáticas después. Puede que sus abogados incluso dejen de usar frases alegres en los comunicados de prensa, que es la forma de saber que las cosas están mejorando.