IA y ML · 16 sept
K-Bench llega a arXiv con 125 configuraciones, 33 modelos base, 14 proveedores y un juez GPT-4o congelado con un 94,2 % de acuerdo con clínicos
Un nuevo punto de referencia calibrado por médicos orienta la evaluación de seguridad de los LLM hacia conversaciones de varios turnos y de alto riesgo, en lugar de un teatro de tarjetas de prompts.
- Evalúa los flujos de trabajo de IA sensibles con escenarios de varios turnos, no con demostraciones de un solo prompt.
- Valida los jueces de LLM frente al consenso de expertos antes de confiar en puntuaciones de seguridad automatizadas.
- Haz un seguimiento por separado de las dimensiones críticas para la seguridad, porque un comportamiento general sólido del modelo puede ocultar debilidades específicas de riesgo.