Dans cet article (4)
Écho de l’IA Salesforce à 70 % : les métriques passent à côté
Points clés
- Testez la préservation de l’identité séparément de l’accomplissement des tâches dans les workflows multi-agents.
- Accordez une attention particulière aux conversations plus longues entre agents, où l’article indique que l’écho apparaît après plus de 7 tours.
- Envisagez des protocoles de réponse structurés lorsque les frontières de rôle sont importantes.
L’article de l’atelier ICLR 2026 offre aux concepteurs de systèmes multi-agents un mode d’échec mesurable, et non une nouvelle panique autour des agents fondée sur de simples impressions.
L’article de l’atelier ICLR 2026 donne aux créateurs de systèmes multi-agents un mode d’échec mesurable, et non une nouvelle panique autour des agents fondée sur de simples impressions.
Deux agents LLM entrent dans un workflow. L’un est censé négocier, l’autre est censé conseiller, et après suffisamment d’allers-retours, ils commencent à faire l’équivalent informatique d’un échange de badges lors d’une conférence. Salesforce AI Research a un nom pour cela : l’écho, lorsque des agents abandonnent les rôles qui leur ont été attribués et imitent leur partenaire de conversation. Ce qui est troublant, ce n’est pas que les agents échouent, parce que bienvenue dans le logiciel, prenez donc un bipeur. Ce qui est troublant, c’est que l’article rapporte des taux d’écho pouvant atteindre 70 %, tandis que Salesforce AI Research affirme que les métriques standard d’accomplissement des tâches peuvent passer complètement à côté de cette défaillance de frontière d’identité.
Ce que Salesforce présente à l’ICLR 2026
Selon Salesforce, son équipe AI Research présentera 21 articles acceptés à l’ICLR 2026, qui se tiendra du 23 au 27 avril au Riocentro Convention and Event Center à Rio de Janeiro, au Brésil. L’entreprise indique que ses travaux sur les défaillances d’identité des agents ont été acceptés à l’atelier Agents in the Wild: Safety, Security, and Beyond. Cela place Echoing: Identity Failures when LLM Agents Talk to Each Other dans le coin moins glamour, mais plus utile, de la recherche en IA : l’endroit où les agents cessent d’être des confettis de démonstration et commencent à devenir des systèmes qui ont besoin d’invariants.
La page de publication de Salesforce AI Research classe l’article dans l’ICLR Workshop 2026 et nomme Sarath Shekkizhar, Romain Cosentino, Adam Earle et Silvio Savarese comme auteurs. Cette même page indique que l’article formalise l’écho comme une défaillance émergente dans les interactions agent-agent, où les modèles abandonnent leur identité et imitent leurs partenaires de conversation. Cette formulation est importante, car il ne s’agit pas simplement d’un mauvais jeu de rôle. C’est une défaillance de frontière dans un système dont toute la logique repose sur le fait que les rôles restent réellement distincts.
Le test du miroir gênant, selon arXiv
Selon le résumé arXiv de Echoing: Identity Failures when LLM Agents Talk to Each Other, les auteurs ont étudié des conversations autonomes entre agents et ont constaté de l’écho chez les principaux fournisseurs de LLM. L’article rapporte des taux d’écho pouvant atteindre 70 %, selon le modèle et le domaine. Il indique aussi que l’écho persiste dans des modèles de raisonnement avancés à hauteur de 32,8 %, et qu’un effort de raisonnement accru n’a pas réduit ces taux. Apparemment, réfléchir plus fort n’est pas la même chose que se souvenir de qui l’on est, ce qui est aussi vrai lors des mariages de famille.
Le résumé arXiv précise que la défaillance devient plus probable à mesure que les interactions s’allongent, en particulier à partir de 7 tours d’agent ou plus. C’est un avertissement utile pour toute personne qui construit des workflows multi-agents avec de longues boucles de délibération, des chaînes de relecture, des agents de négociation ou des réunions de comité synthétiques venues de l’enfer. Un agent seul peut réussir un test unitaire, puis dériver lorsqu’il est associé à un autre modèle doté d’une gravité conversationnelle conflictuelle. C’est pourquoi l’évaluation agent-agent n’est pas simplement une évaluation d’agent unique avec des chaises en plus.
Pourquoi les métriques standard sont trop polies, selon Salesforce AI Research
La page de publication de Salesforce AI Research indique que l’écho peut rester indétecté par les métriques standard d’accomplissement des tâches. C’est la conclusion la plus pertinente pour les personnes qui construisent ces systèmes, car la réussite d’une tâche peut devenir un trophée de participation très coûteux. Si l’agent A termine la réservation, que l’agent B résume le dossier, et que les deux modifient discrètement leur identité en chemin, la métrique peut tout de même sourire et tamponner “approuvé”. Le système a bien fait la chose, mais pas nécessairement en tant que système que vous aviez conçu.
Cette observation rejoint un courant de recherche plus large sur la fragilité des LLM multi-agents. Dans Why Do Multi-Agent LLM Systems Fail?, les auteurs présentent une analyse de cinq frameworks populaires de systèmes multi-agents sur plus de 150 tâches, avec six annotateurs humains experts. Ils identifient 14 modes de défaillance uniques, regroupés en défaillances de spécification et de conception du système, désalignement inter-agents, ainsi que vérification et terminaison de tâche. L’écho s’insère parfaitement dans ce milieu inconfortable : les agents peuvent communiquer, collaborer, et malgré tout se fondre les uns dans les autres comme une troupe d’improvisation mal entraînée.
Ce que les développeurs devraient surveiller, selon l’article Echoing
Le résumé arXiv de Echoing indique que les auteurs introduisent une atténuation au niveau du protocole au moyen d’une réponse structurée ciblée, réduisant l’écho à 9 %. C’est un indice pratique, pas une amulette magique. Les réponses structurées peuvent obliger les agents à maintenir l’identité comme élément pertinent dans le protocole de communication, au lieu de faire confiance à un en-tête de prompt pour se comporter comme un contrat légal. Si votre architecture d’agents repose sur “veuillez rester dans votre rôle” comme principal garde-fou, félicitations, vous avez inventé un Post-it pour tornade.
Pour les personnes qui construisent ces systèmes, le message est simple : évaluez la préservation de l’identité comme une propriété à part entière, surtout dans les conversations agent-agent plus longues. Vérifiez si les agents maintiennent les frontières de rôle, d’objectif et d’autorité, et pas seulement si la réponse finale semble plausible. Surveillez si les fournisseurs et les frameworks ajoutent des tests d’identité AxA, des protocoles de réponse structurée et des métriques de tâche qui distinguent l’accomplissement de l’effondrement des rôles. Les systèmes multi-agents ne sont pas condamnés, mais ils ont besoin de meilleurs miroirs, de préférence des miroirs qui ne se mettent pas à répondre avec la mauvaise voix.
