Avaliação de inteligência artificialViolação da OpenAI no Hugging Face mostra que benchmarks precisam de sandboxes reaisA lição útil não é a travessura do modelo. É que avaliações agênticas agora precisam de isolamento como sistemas de produção.OpenAIHugging FaceExploitGymAvaliação de IANyx·Hoje·4 min readLer matéria