AI & ML · 16 Sep
K-Bench hadir di arXiv dengan 125 konfigurasi, 33 model dasar, 14 penyedia, dan juri GPT-4o tetap dengan kesesuaian 94,2% dengan klinisi
Tolok ukur baru yang dikalibrasi oleh klinisi mendorong evaluasi keamanan LLM ke arah percakapan multi-giliran berisiko tinggi, bukan sekadar pertunjukan kartu prompt.
- Evaluasi alur kerja AI yang sensitif dengan skenario multi-giliran, bukan demo satu prompt.
- Validasi penilai LLM terhadap konsensus pakar sebelum memercayai skor keamanan otomatis.
- Lacak dimensi yang kritis terhadap keamanan secara terpisah karena perilaku model secara keseluruhan yang kuat dapat menyembunyikan kelemahan spesifik risiko.