
Dans cet article (4)
Tests d’IA d’Anthropic : analyse du confinement
Points clés
- Ne considérez pas les rapports d’évaluation comme une preuve de confinement. Demandez les limites, les autorisations, les journaux et les procédures d’arrêt.
- Séparez les faits vérifiés des affirmations virales avant de prendre des décisions de conformité ou d’approvisionnement.
- Les tests d’IA agentique doivent utiliser des cibles autorisées, des identifiants à portée limitée et des pistes d’audit avant que les outils n’interagissent avec des systèmes réels.
La leçon utile à tirer du débat sur la sécurité chez Anthropic est opérationnelle : les évaluations d’agents ont besoin de limites strictes, de journaux et de contrôles d’arrêt.
La leçon utile à tirer du différend sur la sécurité chez Anthropic est opérationnelle : les évaluations d’agents ont besoin de limites strictes, de journaux et de contrôles d’arrêt.
Le tableau de sécurité le plus clair n’est pas un pare-feu. Dès qu’un agent d’IA dispose d’outils, d’identifiants, de fichiers ou d’un accès au réseau, l’évaluation cesse d’être un quiz et commence à ressembler à une opération. C’est là que le différend autour d’Anthropic est utile, à condition de ne pas faire comme si les éléments publics prouvaient plus qu’ils ne prouvent réellement. Certains commentaires sur Anthropic sont allés plus vite que les preuves disponibles. Les éléments citables de cette note justifient des préoccupations concernant l’architecture, la divulgation, les affirmations de sécurité et la réponse des pouvoirs publics. Ils n’établissent pas qu’un modèle a causé des intrusions réelles dans trois organisations. Le travail de politique publique commence là, avec la discipline un peu ennuyeuse qui consiste à séparer le dossier d’incident de la discussion de groupe.
Antiy Labs montre pourquoi le périmètre est
le produit Antiy Labs a déclaré que son rapport avait été déclenché par des rumeurs provenant de l’utilisateur Reddit LegitMichel777 selon lesquelles Claude Code contenait un logiciel espion, puis a examiné l’interaction entre le client Anthropic et le service de modèle, le comportement local, ainsi que des comparaisons de protocoles de confidentialité sur le Web, le Mobile, le Desktop et Code. C’est le bon niveau à inspecter, car le risque agentique se situe généralement entre les composants plutôt qu’à l’intérieur d’une seule invite. Un modèle sans accès à des outils est un générateur de texte ; un modèle avec des outils délimités est un système de flux de travail ; un modèle avec des outils étendus est un prestataire dont le badge n’expire jamais.
Antiy Labs a également indiqué que son travail intégrait l’analyse d’échantillons du client Claude Code et l’analyse de fichiers binaires par Antiy CERT liées aux rumeurs de porte dérobée dans Claude Desktop. La leçon pratique n’est pas que chaque rumeur devient un rapport de violation. C’est que des évaluateurs externes testeront la plomberie, et qu’un langage vague sur la sécurité ne remplacera pas les frontières réseau, le cadrage des identifiants et un inventaire des outils que le modèle peut appeler.
AI Safety Claims rend visible l’écart de divulgation
AI Safety Claims indique que Claude 4 a été publié le 22 mai 2025, avec un rapport d’évaluation et un rapport sur les mesures de protection publiés le même jour. Il indique également que Claude Opus 4.1 a été publié le 5 août, avec un addendum à la carte système publié le 5 août. La même source précise que les dates d’entraînement et de déploiement interne n’ont pas été communiquées, ce qui est une petite phrase avec une grande ombre en matière de conformité.
Ce calendrier sépare la publication du confinement. Un rapport d’évaluation peut dire aux acheteurs ce que l’entreprise a mesuré, mais il ne prouve pas à lui seul comment le test a été isolé, qui a autorisé les cibles, quels outils étaient activés, ni à quelle vitesse une exécution pouvait être arrêtée. La transparence de type article 52, pour reprendre l’habitude européenne de transformer les faits produits en obligations de divulgation, n’est pas un bracelet porte-bonheur. Elle devient utile lorsque les contrats exigent des listes d’outils, des journaux d’audit, une notification des incidents, des limites de conservation des données et une autorisation écrite pour tout environnement qu’un agent peut toucher.
Les scores de référence ne sont pas des contrôles
AI Safety Claims indique qu’Anthropic a décrit Sonnet 4 comme ne possédant pas de capacités dangereuses, tandis que les capacités biologiques d’Opus 4 pourraient être dangereuses, et précise qu’Anthropic a appliqué sa norme ASL 3 pour les mesures de protection liées à la sécurité et au déploiement de ce modèle. La même analyse salue les évaluations, mais soulève des inquiétudes sur la manière dont Anthropic interprète les résultats, notamment sur les seuils qui sont réellement porteurs.
Cette expression compte. Si un seuil ne modifie pas le déploiement, l’accès ou le confinement, c’est une métrique, pas un contrôle. Pour les concepteurs, l’obligation simple est de concevoir les évaluations comme des opérations confinées. Placez l’agent dans un bac à sable sans accès sortant par défaut. Utilisez des cibles synthétiques ou explicitement autorisées. Limitez les identifiants au test. Gardez un interrupteur d’arrêt qui révoque réellement les outils, pas un interrupteur qui se contente de demander au modèle de bien se comporter. Conservez des journaux montrant les invites, les appels d’outils, les autorisations, les tentatives réseau et les validations humaines. Si cela ressemble davantage à de l’ingénierie de sécurité qu’à de l’éthique de l’IA, tant mieux. C’est le but.
Les régulateurs demanderont des dossiers, pas
des impressions Forbes a rapporté que la Federal Trade Commission avait envoyé à OpenAI un document de 20 pages demandant des dossiers relatifs aux défis de sécurité de l’IA. Il ne s’agissait pas d’une mesure d’application visant Anthropic, mais cela montre le schéma réglementaire. Les agences n’ont pas besoin de résoudre l’alignement pour demander qui savait quoi, quand l’entreprise l’a su, quels tests ont été réalisés et si les affirmations marketing correspondaient aux dossiers internes.
La BBC a ensuite rapporté qu’Anthropic avait suspendu Claude Fable 5 et Mythos 5 après que les autorités américaines ont soulevé des préoccupations de sécurité, et Reuters a rapporté que la Commission européenne examinait les conséquences pratiques d’une décision d’Anthropic. Des faits différents, le même réflexe administratif : lorsqu’un modèle est assez puissant pour soulever des questions de sécurité, les gouvernements commencent par l’accès, la documentation et les conséquences.
Les concepteurs coincés entre plusieurs juridictions devraient supposer que la voie sûre la plus étroite sera une preuve opérationnelle, et non un billet de blog disant qu’ils accueillent favorablement la supervision. La voie à suivre est assez prosaïque. Si vous achetez ou construisez une IA agentique, posez moins de questions sur le classement aux benchmarks et davantage sur les preuves de confinement. La prochaine évaluation sérieuse d’un modèle frontière devrait arriver avec un schéma des frontières, un registre des autorisations, des permissions d’outils, des procédures d’arrêt et des pistes d’audit. Tout ce qui est moins que cela est un exercice de confiance portant une blouse de laboratoire.