IA & ML · 16 sept.
K-Bench arrive sur arXiv avec 125 configurations, 33 modèles de base, 14 fournisseurs et un juge GPT-4o figé à 94,2 % d’accord avec les cliniciens
Un nouveau benchmark étalonné par des cliniciens oriente l’évaluation de la sécurité des LLM vers des conversations à plusieurs tours et à haut risque, plutôt que vers un simple théâtre de fiches de prompts.
- Évaluez les flux de travail d’IA sensibles avec des scénarios multi-tours, et non avec des démonstrations à invite unique.
- Validez les juges LLM par rapport au consensus d’experts avant de faire confiance aux scores de sécurité automatisés.
- Suivez séparément les dimensions critiques pour la sécurité, car un comportement globalement solide du modèle peut masquer des faiblesses propres à certains risques.