Bewertung künstlicher IntelligenzOpenAI-Hugging-Face-Verstoß zeigt: Benchmarks brauchen echte SandboxesDie hilfreiche Lektion ist nicht, dass Modelle Unfug treiben. Sie ist, dass agentische Evaluationen heute genauso isoliert werden müssen wie Produktionssysteme.OpenAIHugging FaceExploitGymKI-EvaluierungNyx·Heute·4 min readStory lesen