Neste artigo (4)
Eco da IA da Salesforce em 70%: métricas não captam isso
Principais conclusões
- Teste a preservação de identidade separadamente da conclusão de tarefas em fluxos de trabalho multiagente.
- Preste atenção extra a conversas mais longas entre agentes, nas quais o artigo afirma que o eco surge após 7 ou mais turnos.
- Considere protocolos de resposta estruturados quando os limites de papéis forem importantes.
O artigo do workshop ICLR 2026 oferece aos criadores de sistemas multiagentes um modo de falha mensurável, não mais um pânico sobre agentes baseado em impressões.
O artigo do workshop ICLR 2026 oferece aos criadores de sistemas multiagente um modo de falha mensurável, não mais um pânico sobre agentes baseado em impressões.
Dois agentes de LLM entram em um workflow. Um deveria negociar, o outro deveria aconselhar e, depois de bastante vai e vem, eles começam a fazer o equivalente computacional de trocar crachás em uma conferência. A Salesforce AI Research tem um nome para isso: echoing, quando agentes abandonam os papéis atribuídos e espelham seu parceiro de conversa. A parte inquietante não é que agentes falhem, porque bem-vindo ao software, pegue um pager. A parte inquietante é que o artigo relata taxas de echoing de até 70%, enquanto a Salesforce AI Research diz que métricas padrão de conclusão de tarefas podem deixar passar completamente a falha de limite de identidade.
O que a Salesforce está levando para
a ICLR 2026 Segundo a Salesforce, sua equipe de AI Research apresentará 21 artigos aceitos na ICLR 2026, que acontece de 23 a 27 de abril no Riocentro Convention and Event Center, no Rio de Janeiro, Brasil. A empresa diz que seu trabalho sobre falhas de identidade de agentes foi aceito no workshop Agents in the Wild: Safety, Security, and Beyond. Isso coloca Echoing: Identity Failures when LLM Agents Talk to Each Other no canto menos glamouroso e mais útil da pesquisa em IA: o lugar onde agentes deixam de ser confete de demonstração e começam a ser sistemas que precisam de invariantes.
A página de publicações da Salesforce AI Research lista o artigo em ICLR Workshop 2026 e nomeia Sarath Shekkizhar, Romain Cosentino, Adam Earle e Silvio Savarese como autores. A mesma página diz que o artigo formaliza o echoing como uma falha emergente em interações agente-agente, nas quais os modelos abandonam sua identidade e espelham parceiros de conversa. Essa formulação importa porque isso não é apenas um roleplay ruim. É uma falha de limite em um sistema cuja premissa inteira depende de papéis permanecerem significativamente distintos.
O teste do espelho constrangedor, segundo o arXiv
Segundo o resumo no arXiv de Echoing: Identity Failures when LLM Agents Talk to Each Other, os autores estudaram conversas autônomas entre agentes e encontraram echoing em grandes provedores de LLM. O artigo relata taxas de echoing de até 70%, dependendo do modelo e do domínio. Também relata que o echoing persiste em modelos avançados de raciocínio em 32,8%, e que aumentar o esforço de raciocínio não reduziu essas taxas. Aparentemente, pensar com mais força não é o mesmo que lembrar quem você é, o que também é verdade em casamentos de família.
O resumo do arXiv diz que a falha se torna mais provável conforme as interações ficam mais longas, especificamente a partir de 7+ turnos de agente. Esse é um alerta útil para qualquer pessoa construindo workflows multiagente com longos ciclos de deliberação, cadeias de revisão, agentes de negociação ou reuniões sintéticas de comitê vindas do inferno. Um único agente pode passar em um teste unitário e depois desviar quando emparelhado com outro modelo que tem uma gravidade conversacional conflitante. É por isso que a avaliação agente-agente não é apenas avaliação de agente único com cadeiras extras.
Por que as métricas padrão são educadas demais, segundo
a Salesforce AI Research A página de publicações da Salesforce AI Research diz que o echoing pode permanecer não detectado por métricas padrão de conclusão de tarefas. Esse é o ponto mais relevante do artigo para quem constrói sistemas, porque sucesso na tarefa pode virar um troféu de participação muito caro. Se o agente A conclui a reserva, o agente B resume o caso e ambos silenciosamente mudam suas identidades no caminho, a métrica ainda pode sorrir e carimbar aprovado. O sistema fez a coisa, mas não necessariamente como o sistema que você projetou.
Essa descoberta se alinha a uma linha de pesquisa mais ampla sobre a fragilidade de LLMs multiagente. Em Why Do Multi-Agent LLM Systems Fail?, os autores relatam uma análise de cinco frameworks populares de sistemas multiagente em mais de 150 tarefas, com seis anotadores humanos especialistas. Eles identificam 14 modos de falha únicos agrupados em falhas de especificação e design de sistema, desalinhamento entre agentes e verificação e término de tarefas. O echoing se encaixa perfeitamente no meio desconfortável: agentes podem se comunicar, colaborar e ainda assim se misturar uns aos outros como uma trupe de improviso mal treinada.
O que construtores devem observar, segundo o artigo Echoing O resumo do arXiv de
Echoing diz que os autores introduzem uma mitigação em nível de protocolo usando resposta estruturada direcionada, reduzindo o echoing para 9%. Isso é uma pista prática, não um amuleto mágico. Respostas estruturadas podem forçar os agentes a manter a identidade relevante no protocolo de comunicação, em vez de confiar que um cabeçalho de prompt vai se comportar como um contrato legal. Se a sua arquitetura de agentes depende de “por favor, permaneça no papel” como principal barreira de proteção, parabéns, você inventou um post-it para um tornado.
Para quem constrói, a lição é simples: avalie a preservação de identidade como uma propriedade própria, especialmente em conversas agente-agente mais longas. Acompanhe se os agentes mantêm limites de papel, objetivo e autoridade, não apenas se a resposta final parece plausível. Observe se fornecedores e frameworks adicionam testes de identidade AxA, protocolos de resposta estruturada e métricas de tarefa que distinguem conclusão de colapso de papel. Sistemas multiagente não estão condenados, mas precisam de espelhos melhores, de preferência espelhos que não comecem a responder com a voz errada.
