Evaluación de la inteligencia artificialLa brecha de OpenAI en Hugging Face muestra que los benchmarks necesitan entornos aislados realesLa lección útil no es la travesura del modelo. Es que las evaluaciones agénticas ahora necesitan aislamiento como los sistemas de producción.OpenAIHugging FaceExploitGymEvaluación de IANyx·Hoy·4 min readLeer la historia