IA e ML · 16 de set.
K-Bench chega ao arXiv com 125 configurações, 33 modelos-base, 14 provedores e um juiz GPT-4o congelado com 94,2% de concordância com clínicos
Um novo benchmark calibrado por clínicos leva a avaliação de segurança de LLMs para conversas de alto risco e com múltiplas interações, em vez de um teatro de cartões de prompts.
- Avalie fluxos de trabalho sensíveis de IA com cenários de múltiplos turnos, não com demonstrações de prompt único.
- Valide juízes de LLM em relação ao consenso de especialistas antes de confiar em pontuações automatizadas de segurança.
- Acompanhe dimensões críticas de segurança separadamente, porque um comportamento geral forte do modelo pode ocultar fraquezas específicas de risco.