Costos descontrolados de tokens de IA: análisis de operaciones de agencias
Puntos Clave
- Trata el gasto en tokens como gobernanza del flujo de trabajo, no como una factura sorpresa de API.
- Establece presupuestos y atribución en el límite de la solicitud antes de que los prompts lleguen a los modelos.
- Enruta las tareas según el riesgo y la complejidad para que los modelos costosos gestionen solo el trabajo que los necesita.
La factura de la API es solo el recibo. El verdadero trabajo es diseñar flujos de trabajo que sepan cuándo gastar.
La factura de IA más aterradora no es la grande. Es la que nadie puede explicar sin abrir seis paneles, tres hilos de Slack y una hoja de cálculo llamada final_final_real.xlsx. Los costos de tokens se han convertido en la purpurina de las operaciones de IA generativa: diminutos, por todas partes y, de algún modo, siguen apareciendo en reuniones de finanzas meses después. Las agencias ahora están aprendiendo lo que los equipos de software ya sospechaban: el modelo no es caro solo cuando es inteligente, es caro cuando se lo deja sin supervisión.
Ad Age convierte el gasto en tokens
en un problema operativo Ad Age llevó el problema directamente al terreno de las agencias con el artículo de Asa Hiken del 30 de julio de 2026, titulado Cómo pueden las agencias controlar los costos descontrolados de tokens de IA. La observación central es, por suerte, muy clara: las agencias no son inmunes a los gastos excesivos en tokens de IA, según Ad Age. Eso importa porque los flujos de trabajo de las agencias suelen invitar a la generación repetida, la revisión, el resumen y la revisión por parte de las partes interesadas, que básicamente es una cinta de correr de tokens con un elegante blazer de estrategia de marca. Una vez que la IA pasa de experimento a producción diaria, el gasto deja de ser una curiosidad en una factura de API y empieza a comportarse como un sistema operativo para el trabajo. Portal26 plantea la respuesta empresarial como un camino de tres pasos: Visibilidad, Seguridad y Realización de valor. MindStudio, al observar flujos de trabajo agénticos, señala los límites estrictos de tokens, los umbrales de compactación y las comprobaciones de presupuesto antes de la ejecución como patrones que los creadores pueden copiar. Si juntas todo eso, la lección no es mística. Necesitas ver el uso, gobernarlo y vincularlo con resultados antes de que tu asistente de IA se convierta en un mapache con tarjeta corporativa.
BCG y GAP presentan el control de costos como una disciplina
El artículo de BCG de 2026 Cómo pueden las empresas controlar los costos de tokens de IA trata la gestión de tokens como un asunto empresarial, no como una molestia de laboratorio. GAP plantea lo mismo desde el lado de la entrega de software con Optimización de costos de IA: controlar el gasto descontrolado en tokens. El cambio útil es cultural tanto como técnico: deja de preguntar solo qué modelo es el mejor y empieza a preguntar qué modelo es lo suficientemente bueno para este paso, este usuario y este nivel de riesgo. Esa pregunta suena aburrida, y por eso sabes que podría ahorrar dinero. Para los equipos de agencia, esto significa clasificar el trabajo antes de dirigirlo. Una tarea simple de extracción, reescritura o clasificación quizá no merezca el modelo frontera más caro disponible. Un borrador de estrategia sensible para un cliente quizá sí. La disciplina operativa consiste en crear valores predeterminados para que los equipos no estén tomando decisiones de selección de modelo mientras están cafeinados, con retraso y emocionalmente vulnerables ante un menú desplegable brillante.
MindStudio muestra por qué los agentes vuelven rara la factura
MindStudio describe el clásico susto de producción: un agente que funciona en pruebas puede acumular una factura de 200 dólares de la noche a la mañana. La razón, según MindStudio, es que los costos de tokens en sistemas multiagente no escalan de forma lineal, se componen. Cada llamada a una herramienta añade contexto, y cada respuesta de un subagente vuelve a alimentar al orquestador. En términos humanos, es como pedirle a un pasante que escriba un memorando, luego pedirles a cinco pasantes que resuman los resúmenes de los demás hasta que contabilidad llama a seguridad. Por eso los ejemplos de MindStudio son importantes para los creadores. Claude Code se describe como un sistema que impone límites estrictos de tokens, umbrales de compactación y comprobaciones de presupuesto antes de la ejecución. Esos controles no son glamurosos, pero los cinturones de seguridad tampoco lo son, y aun así preferimos nuestras demostraciones de producto sin participación del parabrisas. Si tu agencia está desplegando agentes de investigación, agentes de contenido, agentes de control de calidad o automatizaciones de flujo de trabajo, el límite presupuestario debe existir antes de que el modelo empiece a pensar, no después de que la factura empiece a gritar.
Nx1 pone el límite donde corresponde
Nx1 expresa la versión más clara de la regla de arquitectura: “El costo de tokens solo es controlable en el límite de la solicitud, antes de que el modelo vea el prompt”. Su análisis también dice que el gasto empresarial en IA generativa se multiplicó por más de tres, de 11.500 millones de dólares en 2024 a 37.000 millones en 2025, y que el 98% de las organizaciones ahora gestionan el gasto en IA como una disciplina formal de FinOps, frente al 63% un año antes y el 31% el año anterior a ese. Ya sea que te encanten esos números o quieras mirarlos como un gato que ve un pepino, la implicación es obvia. La atribución de costos tiene que acercarse más a la solicitud real. Eso significa etiquetar las solicitudes por usuario, equipo, cliente, flujo de trabajo, modelo y propósito. También significa establecer límites que fallen con elegancia, resumir el contexto antes de que se convierta en una novela corta y dirigir las tareas más baratas a modelos más baratos. El enfoque práctico de gobernanza de CompassMSP apunta en la misma dirección: prevenir costos descontrolados de IA es un problema de gobernanza, no solo de compras. El equipo de compras puede negociar un paraguas mejor, pero ingeniería aún necesita dejar de construir clima de interiores.
Qué deberían vigilar las agencias a continuación La próxima pila madura de
IA para agencias se parecerá menos a una caja de juguetes y más a una línea de producción con medidores. Los líderes de producto deberían pedir visibilidad de costos por flujo de trabajo antes de aprobar un despliegue amplio. Los gerentes de ingeniería deberían añadir presupuestos de tokens a los criterios de aceptación. Los equipos de finanzas deberían exigir atribución por cliente o departamento, porque las vibras no son una categoría contable, pese a los mejores esfuerzos de internet. Ad Age tiene razón al poner a las agencias en el foco, pero la lección aplica a cualquier equipo con uso intensivo de IA que convierta experimentos en sistemas diarios. Los ganadores no serán los equipos que prohíban los modelos caros ni los que veneren los baratos. Serán los equipos que diseñen flujos de trabajo donde costo, calidad, latencia y riesgo sean todos insumos de primera clase. El modelo puede ser probabilístico, pero tu presupuesto no tiene por qué ser una máquina tragamonedas.
