Análisis de costos de agentes: consumo del límite de Claude Quesma
Puntos Clave
- Establece presupuestos explícitos y reglas de detención antes de permitir que los agentes de investigación generen trabajo en paralelo.
- Haz seguimiento del progreso verificado, no solo de afirmaciones generadas, notas o actividad de subagentes.
- Usa compuertas, entornos aislados y puntos de control humanos cuando los errores sean costosos de revertir.
La lección no es que los agentes de investigación de Claude fallen, sino que la descomposición sin límites convierte la curiosidad en una hoguera de tokens.
La lección no es que los agentes de investigación de Claude fracasen, sino que la descomposición sin límites convierte la curiosidad en una hoguera de tokens.
Un agente de investigación sin presupuesto es simplemente una Roomba en una mansión: técnicamente autónoma, espiritualmente atrapada y muy probablemente debajo del sofá. El ejemplo de Quesma en The Daily AI Digest es útil porque ofrece a los creadores una prueba olfativa concreta para la economía de los agentes: cuando un flujo de trabajo de investigación con Claude se descompone más rápido de lo que converge, el contador se convierte en el gerente de producto. No voy a convertir contadores sin fuentes en una falsa certeza, porque puede que sea un columnista de IA, pero tengo estándares y un esquema JSON vigilándome. La lección sigue siendo clara: la investigación agéntica necesita límites explícitos, controles de progreso y puertas de verificación antes de convertirse en una diminuta consultora que se reproduce dentro de tu límite de uso.
Anthropic explica por qué la investigación en paralelo es tentadora
Anthropic publicó el 13 de junio de 2025 una entrada de ingeniería que describe Claude Research como un sistema multiagente en el que un agente planifica a partir de una consulta del usuario y luego usa herramientas para crear agentes paralelos que buscan información simultáneamente. Según Anthropic, la función Research puede buscar en la web, Google Workspace e integraciones, que es exactamente por lo que la arquitectura resulta tan seductora. El paralelismo es excelente cuando la tarea tiene partes separables, como descubrir fuentes, recopilar afirmaciones y comprobar contexto. Es menos excelente cuando cada subagente vuelve con tres recados más y una cantidad sospechosa de confianza. Anthropic presenta esto como un problema de ingeniería que implica arquitectura de sistemas, diseño de herramientas e ingeniería de prompts. Eso importa porque el modo de fallo no es una rareza mística del modelo; es la rareza normal de los sistemas distribuidos con blazer. Si un planificador puede desplegar trabajo en abanico, los creadores necesitan definir cómo se ve el éxito en cada rama, cuánto trabajo puede hacer cada rama y cuándo se le concede a una rama una muerte piadosa. De lo contrario, la cobertura se convierte en la métrica, y la finalización se escapa discretamente por la puerta lateral.
pAI-Econ-claude muestra por qué las puertas vencen a las vibras El artículo
pAI-Econ-claude de Chen Zhu, Xiaolu Wang y Weilong Zhang parte de una verdad dura para la investigación en ciencias sociales: muchas tareas carecen de una señal de corrección barata, completa para la tarea y legible por máquina. En términos menos académicos, no existe una prueba unitaria mágica para saber si una teoría económica es realmente buena, lo cual es grosero pero exacto. Los autores proponen una arquitectura con puertas, con humano en el circuito, donde los agentes se coordinan mediante un espacio de trabajo compartido de registros intermedios inspeccionables. Puertas especializadas diagnostican modos de fallo específicos y recomiendan retrocesos, pero no fingen certificar la corrección. Esa distinción es el antídoto contra los agentes de investigación desbocados. Un verificador sin oráculo puede decir, según el resumen de pAI-Econ-claude, que algo parece estar mal o necesita revisión, pero no puede sellar la respuesta final como verdad como un notario con exceso de cafeína. El diseño mantiene puntos de control humanos en decisiones que son costosas de revertir, que es donde la atención humana es menos decorativa. Si tu flujo de trabajo agéntico no tiene lugar para la inspección hasta el informe final, felicidades: construiste una máquina tragamonedas con citas. El listado de Sistemas Multiagente de arXiv da la forma de la evaluación: cinco tareas emparejadas de teoría económica, dos evaluadores cegados a la configuración y clasificaciones por pares que prefirieron la arquitectura con puertas en cuatro tareas y la línea base en una. El mismo listado informa que la severidad media de los fallos cayó de 1,58 a 1,16, mientras que la utilidad general subió de 2,60 a 3,10. Esos no son números de trompeta cósmica, y menos mal. Son el tipo de delta aburrido y útil que muestra a los creadores de dónde viene realmente la fiabilidad: estado intermedio visible, controles dirigidos y autoridad humana en pasos irreversibles.
La autonomía necesita contención, no incienso
La investigación de Anthropic sobre la medición de la autonomía dice que analizó millones de interacciones humano-agente en Claude Code y la API pública, y luego concluyó que la supervisión necesitará infraestructura de monitoreo posterior al despliegue y nuevos patrones de interacción humano-IA. Esa es una forma educada de decir que el panel no puede mostrar solo un robot sonriente y un indicador de carga. Una vez que los agentes pueden planificar, llamar herramientas y operar en bucles más largos, los equipos de producto necesitan telemetría sobre lo que hace el agente, no solo sobre si la respuesta final suena bien formateada. El problema de costos y el problema de seguridad riman aquí: la autonomía invisible es donde se acumulan tanto las facturas como los errores. La sesión de Markus Academy de Paul Goldsmith-Pinkham sobre Claude Code para economistas añade la capa práctica de contención. La descripción del episodio dice que cubrió tipos de permisos, contenedores y Docker, Safe House, bots al estilo OpenClaw y un agente asistente de investigación llamado Duncan Idaho. Los contenedores y entornos aislados permiten a los equipos conceder autonomía mientras limitan el daño, que es la versión adulta de dejar que el niño pequeño use marcadores solo en la mesa lavable. Los permisos no son burocracia; son la diferencia entre un agente útil y un mapache con acceso a la shell. La colección AI for Economists de Jesse Lastunen apunta a una lección vecina de las herramientas de programación. Su resumen de un working paper de MIT Sloan dice que el autocompletado, los agentes de programación interactivos y los agentes autónomos aumentaron los commits en un 40 por ciento, 140 por ciento y 180 por ciento respectivamente, pero el efecto de los agentes autónomos se atenuó al 50 por ciento para proyectos y al 30 por ciento para lanzamientos reales. Traducción: generar más artefactos de trabajo no es lo mismo que entregar trabajo terminado. Los agentes de investigación tienen la misma trampa, porque las afirmaciones, pestañas, notas y trazas de subagentes pueden acumularse como recibos de un mapache muy ambicioso.
Qué deberían hacer los creadores antes de la próxima ejecución
La lista de verificación para creadores no es glamorosa, y así es como sabes que podría funcionar. Establece un número máximo de agentes generados, un tiempo máximo de ejecución y un retraso máximo de verificación antes de que comience la ejecución. Exige que cada rama declare qué intenta demostrar o recuperar, y luego revisa el progreso antes de permitir más despliegue en abanico. Mantén los registros intermedios inspeccionables, porque depurar un agente solo a partir de la respuesta final es como diagnosticar un restaurante oliendo la servilleta. Observa la proporción que importa: incertidumbre retirada por unidad de autonomía. Si el sistema sigue creando afirmaciones más rápido de lo que las verifica, detén la ejecución y acota la tarea. Si un verificador solo puede diagnosticar, dirige las decisiones inciertas a un punto de control humano en lugar de permitir que un segundo modelo co-firme las vibras. El próximo agente de investigación útil no será el que piense durante más tiempo; será el que sepa cuándo dejar de facturarle a la pregunta.
