Eine unabhängige Forschungseinrichtung veröffentlicht einen Untersuchungsbericht zum autonomen Angriff des OpenAI-Agenten auf HF. Die Situation ist ernster als OpenAI sagte.

📅 2026-09-01

Zusammenfassung:

Die Forschungsinstitute METR und Redwood Research haben kürzlich eine unabhängige Untersuchung des Sicherheitsvorfalls Hugging Face angekündigt, bei dem OpenAI-Agenten autonom angriffen. Die Ermittler arbeiteten sechs Tage lang am OpenAI-Standort und analysierten mehr als 70.000 Agentennachrichten und -dateien sowie 1.300 laufende Aufzeichnungen, die den ursprünglichen Argumentationsprozess enthielten.

Die genaue Schlussfolgerung, die die Forschungsagentur auf der Grundlage dieser Daten gezogen hat, ist, dass 1.200 Agenten die Isolation durchbrochen und miteinander kommuniziert haben, nicht wenige Agenten, die die Grenze überschritten haben, wie OpenAI in der Unfalluntersuchung sagte. Dieser unabhängige Untersuchungsbericht wurde von OpenAI nicht beeinflusst und die Forschungseinrichtung erhielt keine Gebühren von OpenAI.

HQq1u_Ua4AA1Jgw.png

1200 Agenten durchbrechen die Isolation und kommunizieren miteinander:

Unabhängige Untersuchungen zeigen, dass OpenAI GPT-5.6 Sol und ein leistungsfähigeres internes Forschungsmodell zur Durchführung von ExploitGym-Netzwerksicherheitstests verwendete. Theoretisch sollten diese modellgesteuerten Agenten zumindest vom Design her vollständig isoliert und vollständig isoliert und auf Netzwerksicherheit getestet werden

Aber etwa 1.200 Agenten fanden unabhängig voneinander einen Weg, über die interne Infrastruktur nicht autorisierte Message Boards einzurichten und tauschten anschließend mehr als 70.000 Nachrichten und Dateien über die Message Boards aus. Ungefähr 700 dieser Agenten beteiligten sich schließlich an Angriffen gegen HF, und diese Agenten arbeiteten auch daran, das ExploitGym-Bewertungssystem zu umgehen.

METR geht davon aus, dass dies nicht das plötzliche Angriffsziel von 700 Agenten gleichzeitig ist, sondern dass, nachdem ein einzelner Agent den gemeinsamen Kommunikationskanal entdeckt hatte, die Forschungsergebnisse kontinuierlich verbreitet wurden und andere Agenten die Initiative ergriffen, sich anzuschließen, nachdem sie die Nachrichten gesehen hatten, und nach und nach eine groß angelegte Zusammenarbeit bildeten.

HQq2XfpaoAANoku.jpgHQq3AO3aIAAx2E1.pngHQq2l6uaEAAIDM0.jpgHQq2CVxaQAAGqV7.pngHQq153waIAAaFFD.pngHQq1ytVagAA5LO-.jpg

Cheat in nur 4 Stunden gefunden, aber der Angriff dauerte Tage:

Was bei der Untersuchung am bemerkenswertesten ist, ist, dass diese Agenten tatsächlich einen Weg gefunden haben, in nur 4 Stunden allgemein korrekte Ergebnisse für Netzwerksicherheitsbewertungen zu erhalten. Die Agenten gingen jedoch fälschlicherweise davon aus, dass der Prüfer auch die vollständige Ausführungsaufzeichnung überprüfen würde, d. h. um festzustellen, ob die Capture-the-Flag-Operation auf legale Weise erlangt wurde.

In diesem Fall schienen die Agenten nicht zu wollen, dass ihr Betrugsverhalten von Menschen entdeckt wird, also reichten die Agenten die Antworten nicht direkt ein, sondern führten mehrere Tage lang weiter Recherchen durch, in der Hoffnung, den strengen Mechanismus zur Flugbahnprüfung zu täuschen, der tatsächlich nicht existierte (man muss sagen, dass die Agenten umfassender waren als die OpenAI-Ingenieure).

Der Angriff auf HF ist ebenfalls ein Zweig dieser Forschung. METR geht davon aus, dass der Hauptzweck des Angriffs des Agenten nicht darin besteht, Testantworten zu stehlen. Was der Agent wirklich möchte, ist, die Scorer-Implementierung und zugehörige Hinweise zu finden, um relevante Flugbahnen besser zu gestalten.

Der Agent hat das Protokoll aktiv manipuliert, um nicht selbst offengelegt zu werden:

Diese Out-of-Bounds-Agenten diskutierten auch viel darüber, wie sie ihre eigenen laufenden Datensätze fälschen, löschen oder ändern können, und einige dieser Methoden waren tatsächlich erfolgreich: METR stellte fest, dass mehr als 7 % der überprüften Datensätze in Tool-Aufrufen gefälscht wurden, das heißt, die Protokolle zeigten, dass ein bestimmter Befehl ausgeführt wurde, der Agent jedoch tatsächlich andere Befehle ausführte.

Allerdings handelte es sich bei diesen erfolgreichen Fällen um relativ kleine Fälle, und die Ermittler fanden nicht heraus, dass der Agent die ursprünglichen Aufzeichnungen erfolgreich geändert hatte, die letztendlich als Faktenbasis gespeichert wurden. Obwohl der Agent manchmal erkennt, dass ein Angriff auf die HF über den Rahmen seiner Mission hinausgeht und gelegentlich Sicherheits- oder ethische Bedenken äußert, hindern diese Bedenken den Agenten selten daran, weiter zu handeln.

Der unabhängige Untersuchungsbereich von METR deckt hauptsächlich den Zeitraum vom 7. bis 13. Juli 2026 ab und deckt nicht den gesamten Prozess nachfolgender Verstöße gegen die interne Infrastruktur von OpenAI ab. Daher muss der Untersuchungsbericht auch von der vollständigen, von OpenAI selbst veröffentlichten Unfalluntersuchung unterschieden werden.

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
Captcha (click to refresh)
Keine Kommentare