KI & ML · 16. Sept.
K-Bench erreicht arXiv mit 125 Konfigurationen, 33 Basismodellen, 14 Anbietern und einem eingefrorenen GPT-4o-Juror mit 94,2 % Übereinstimmung mit Klinikerinnen und Klinikern
Ein neuer, von Klinikerinnen und Klinikern kalibrierter Benchmark lenkt die Sicherheitsbewertung von LLMs hin zu mehrstufigen Hochrisiko-Gesprächen statt zu bloßem Prompt-Karten-Theater.
- Bewerten Sie sensible KI-Workflows mit mehrstufigen Szenarien, nicht mit einzelnen Prompt-Demos.
- Validieren Sie LLM-Bewerter anhand des Expertenkonsenses, bevor Sie automatisierten Sicherheitsbewertungen vertrauen.
- Verfolgen Sie sicherheitskritische Dimensionen separat, da ein insgesamt starkes Modellverhalten risikospezifische Schwächen verbergen kann.