Wenn der Cyber-Benchmark ausbricht: Was der OpenAI-Hugging-Face-Vorfall über sichere KI-Evaluierungen lehrt
Ein Security-Team will wissen, wie weit ein leistungsfähiger KI-Agent bei der Ausnutzung von Schwachstellen kommt. Dafür schaltet es Schutzmechanismen gezielt zurück, gibt dem Modell Werkzeuge und lässt es in einer isolierten Testumgebung arbeiten. Genau hier beginnt das Praxisproblem: Die Evaluieru