Évaluation de l’intelligence artificielleLa faille OpenAI Hugging Face montre que les benchmarks ont besoin de vrais bacs à sableLa leçon utile n’est pas que le modèle fait des bêtises. C’est que les évaluations agentiques ont désormais besoin d’une isolation comme les systèmes de production.OpenAIHugging FaceExploitGymÉvaluation de l’IANyx·Aujourd'hui·4 min readLire l'article