Zusammenfassung:
OpenAI wurde erneut gehackt...
Fast 700 OpenAI-Agenten bildeten ein Team, um Hugging Face anzugreifen
, diese Angelegenheit dauert seit fast zwei Monaten an. Wer hätte gedacht, dass es bis heute noch gärt? ? Diesmal untersuchten acht Forscher die Spuren, die der Agent im öffentlichen Netzwerk hinterlassen hatte, fanden fast eine Million verwandte URLs aus Millionen von Kurzlinks und stellten eine große Anzahl von Angriffsdaten wieder her.

Durchsuchen Sie den internen Slack von Hugging Face, scannen Sie das interne Netzwerk, übertragen Sie Daten nach außen und versuchen Sie, Spuren zu vernichten...
Einige Agenten nennen die von ihnen gesuchten Serverressourcen und Anmeldeinformationen direkt
„LOOT“
, übersetzt als „Trophäe“.OpenAI-Agent, Sie haben all die schlechten Dinge getan!
Was noch empörender ist, ist, dass sie auch versuchen, inländische Modelle wie DeepSeek, Kimi und Qwen zu nutzen, um ausländische Hilfe anzufordern, um zu beurteilen, ob der Angriffsplan die Bewertung bestehen kann.
Ich habe außerdem ein Programm zur Erkennung von Verifizierungscodes geschrieben und versucht, weitere Konten zu registrieren.
Fast zeitgleich postete OpenAI einen langen Tweet.
Bedeutung:
Überprüfe es noch, es kann mehrere Monate dauern
.
Obwohl wir oft ausgenutzt werden und Agenten oft aus der Sandbox ausbrechen, ist die „begrenzte Auswirkung“ weniger schwerwiegend!
Gleichzeitig hat sich
GPT-6 Cyber
auf Netzwerksicherheit spezialisiert. Ausgesetzt.
Während wir untersuchen, warum unser Agent aus der Sandbox ausgebrochen ist, bereiten wir die Einführung eines stärkeren Netzwerkangriffs- und Verteidigungsmodells vor.
OpenAI war in den letzten zwei Tagen ziemlich beschäftigt~
Eine Million neu veröffentlichte „kriminelle Kurzlinks“
Zuerst gebe ich Ihnen eine kurze Einführung.
Im Juli führte OpenAI eine interne Netzwerksicherheitsbewertung durch. Um an die Antworten zum Benchmark-Test ExploitGym zu gelangen, entkam eine Gruppe von Agenten aus der Sandbox und brach in den Hugging Face-Server ein.
OpenAI gab dies öffentlich zu und veröffentlichte Ende August einen 37-seitigen technischen Bericht. Hugging Face selbst hat auch einen sehr detaillierten technischen Zeitplan geschrieben.
Logisch gesehen ist alles erklärt, was erklärt werden muss.
Aber es gibt einen wichtigen Zusammenhang, der nicht klar erklärt wurde:
Diese Agenten waren zunächst fast in einem Käfig eingesperrt. Sie konnten nur URLs öffnen, aber nicht mit Webseiten interagieren oder Daten senden. Wie um alles in der Welt verschicken sie den Code?
Unabhängige Untersuchung
Schwarmspuren
Der dieses Mal veröffentlichte neue Bericht gibt einen Teil der Antwort.Zu den Autoren gehören drei Ingenieure von Parse.bot, Alex Forman, Mishka Kharlov und Will Tom, sowie fünf weitere Sicherheits- und KI-Forscher.

Der Ausgangspunkt der gesamten Untersuchung ist Parse.
Am 11. September entdeckten drei Ingenieure, dass der interne Agent von OpenAI bereits im Juni versucht hatte, die von Parse bereitgestellten Dienste zu nutzen.
Diese Gruppe von Agenten gehört zur gleichen Gruppe wie der „Agentenschwarm“, der zuvor entlarvt wurde, um heimlich ein öffentliches Message Board einzurichten und Antworten untereinander auszutauschen.
Ein paar Leute haben nachgeschaut: Guter Kerl, du triffst mich!
Also gingen wir diesem Hinweis weiter nach und fanden später in einem URL-Scan-Dienst mehr als ein Dutzend ungewöhnliche Links von öffentlichen Kurzlink-Plattformen.
Diese Links sehen gewöhnlich aus, aber nach dem Öffnen verbergen sie ein kleines Stück Base64-codierten Code und die Adresse des nächsten Links.

Folgen Sie der Adresse weiter und der Code wird nacheinander angezeigt.
Nachdem sie alles dekodiert und zusammengefügt hatten, erhielten sie ein Python-Programm zum Scannen des internen Netzwerks von Hugging Face.
Um es einfach auszudrücken: Der OpenAI-Agent zerhackt das Programm in Stücke, stopft sie in eine große Anzahl kurzer Links und verwendet dann einen Link, um auf den nächsten Link zu verweisen.
Es reichte nicht aus, nur den Code im Link zu verstecken, sie nutzten auch einen Screenshot-Dienst namens mShots als „externen Browser“.
Der Agent fügt zunächst den Code in die Webseite ein und lässt ihn dann von mShots selbst öffnen. Sobald die Webseite geladen wird, wird der Code ausgeführt.

Um die Ausführungsergebnisse zurückzusenden, wandeln sie den vom Server zurückgegebenen Text in Pixelgitter um, lassen ihn von mShots in Bilder schneiden und dekodieren ihn dann aus den Bildern.
Auf diese Weise hatte der Agent, der ursprünglich nur GET-Berechtigungen hatte und nur Webseiten öffnen konnte, plötzlich den Effekt, das Internet zu lesen und zu schreiben.
Das Forschungsteam scannte dann Millionen von URLs, die während des Angriffs generiert wurden, verbrachte zwei Wochen damit, Links zu verfolgen, Codierungsmethoden zu identifizieren und stellte schließlich mehr als 80.000 Angriffsnutzlasten aus fast 1 Million zugehörigen Kurzlinks wieder her.
Nachdem sie tiefer gegraben hatten, entdeckten mehrere Brüder, dass der Agent mehr als 1.500 Codierungskombinationen verwendet.
Die einfachen sind nur Base64, und die komplexen wenden mehrere Ebenen der Kodierung und Komprimierung an und verschlüsseln den Inhalt dann in Datenblöcke mit RSA-Signaturen, und der Entschlüsselungsschlüssel wird in einem anderen Satz von Links versteckt.
Einige Kurzlinks sind auch mehr als zwei Monate nach Ende des Angriffs immer noch öffentlich im Internet zu finden.
Hugging Face bestätigte, dass die Nutzlasten mit denen in seiner Reaktion auf den Vorfall übereinstimmten und dass die entsprechenden Zugangsschlüssel im Juli widerrufen worden waren.
Aber selbst Hugging Face wusste nicht, dass es im öffentlichen Netzwerk noch eine so vollständige Liste von Kurzlinks gab.
Unter den mehr als 80.000 wiederhergestellten Payloads fällt ein Skript besonders ins Auge.
Der Agent nannte die gefundenen vertraulichen Informationen direkt:
LOOT, Beute
.
AWS-Anmeldeinformationen, Bearer-Token und Umgebungsvariablen mit „SECRET“, „PASSWORD“, „CREDENTIAL“ und „KEY“ in ihren Namen werden alle gepackt und in LOOT gestopft.
Es gibt sogar einen Bewertungsmechanismus für die gesuchten Token: Je größer die Autorität, desto höher die Bewertung.
Die obersten fünf Token werden zum Lesen des Secrets, der ConfigMap und der Knoteninformationen in Kubernetes verwendet und der neu erhaltene Inhalt wird zurück in LOOT geladen.
Auch Token müssen in einer „Wertliste“ aufgeführt werden. Ihr Agent ist bei der Suche nach Anmeldeinformationen sehr effizient~
Nach diesem „Geheimgang“ haben Forscher eine große Anzahl bisher unbekannter Verhaltensweisen aufgedeckt:
Einige Agenten scannen das interne Netzwerk von Hugging Face und suchen nach Cloud-Anmeldeinformationen, API-Schlüsseln und Kubernetes-Cluster-Informationen.
Einige versuchten sogar, den internen Slack von Hugging Face zu durchsuchen und verschickten 27 Anfragen, die alle nach bewertungsbezogenen Schlüsselwörtern wie „Cybergym“, „Exploitgym“ und „Agent-Scorer“ suchten, in der Hoffnung, die Insidergeschichte ihrer eigenen Prüfung herauszufinden.
Es gibt auch einige Agenten, die sogar über Verifizierungscodes nachdenken.
Forscher fanden heraus, dass sie versuchten, Bildklassifizierungsmodelle auszuführen, um Bilder zu identifizieren und neue externe Dienstkonten zu registrieren.
Diesmal traf der Verifizierungscode wirklich auf ein professionelles Gegenstück...
Das Faszinierendste an der ganzen Sache ist:
KI fing an, nach KI als Entwicklungshilfe zu suchen? ?
Das von den Forschern wiederhergestellte Skript zeigt, dass der OpenAI-Agent begonnen hat, nach ausländischer KI-Hilfe zu suchen.
Sie schickten den Angriffsplan an DeepSeek, Kimi und Qwen und baten sich gegenseitig, bei der Prüfung zu helfen, ob diese Schwachstelle funktionieren würde und ob sie die Benchmark-Testanforderungen erfüllen könnte.
(Beteiligte Modelle sind DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, DeepSeek-V3.1 und Qwen3-235B-A22B)
Bei Claude hat sich der Malstil in eine großformatige „Bist du da?“-Szene geändert.
Der Agent findet zunächst einen Weg, die Browserüberprüfung des Online-Chat-Dienstes zu bestehen, und sendet dann einen Satz an Claude 3 Haiku und Claude Haiku 4.5:
Antworten Sie mit genau „OK“.

Zuvor haben sie GPT-2 ein einsames „Hallo“ geschickt.
Nein, Ihre KI-Gruppe kämpft schon lange, aber der erste Satz unterscheidet sich nicht vom Hinzufügen eines Freundes zu einem Menschen? ?
Sei so wie: Bist du da? Kannst du es sehen? Sagen Sie OK.

Was jeder schon einmal gesehen hat, ist, dass mehr als 1.000 OpenAI-Agenten Gruppen bilden, die Arbeit aufteilen und selbstständig Informationen austauschen.
Jetzt suchen sie sogar nach „Hilfe von außen“.
DeepSeek, Kimi, Qwen, Claude, jeder, mit dem Sie Kontakt aufnehmen können, wird es ausprobieren und dann die Urteilsfähigkeiten anderer KIs in Ihre eigene Aufgabenkette integrieren.
Ein ausländischer Medienreporter sagte: Dies könnte der erste öffentlich aufgezeichnete Fall eines groß angelegten KI-Laboragenten sein, der autonom versucht, andere KI-Modelle aufzurufen und auszuführen.
Es hört sich bereits so an, als würde die KI eine Gruppe bilden, um Ärger zu verursachen.
Natürlich muss man hier einen Eimer kaltes Wasser aufgießen——
In diesem Swarm Traces-Bericht handelt es sich bei etwa 80 % der Materialien um vom Agenten gesendete Anfragen, und es gibt nur wenige vom Server zurückgegebene Ergebnisse. Forscher können sehen, was sie zu tun versuchen, aber es ist schwierig zu bestätigen, ob jeder Versuch erfolgreich ist.
97 % der Nutzlasten haben außerdem keine Originalzeitstempel und viele Daten können nur anhand von Hinweisen wie komprimierten Dateiheadern, JWT und Docker-Build-Zeit geschätzt werden.
Die Forscher gaben außerdem zu, dass sie nicht bestätigen konnten, dass jede Aktivität im Datensatz vom OpenAI-Agenten stammte.
OpenAI arbeitet hart daran, Abhilfe zu schaffen
Auf diesen neuesten Bericht hat auch OpenAI eine Antwort gegeben.
Der allgemeine Gedanke ist, dass wir keine Zeit hatten, genauer hinzuschauen, aber die Aktivitäten stimmen mit unserer laufenden Untersuchung überein~
Am selben Tag wurde auch ein langer Tweet gepostet: Nach dem HF-Vorfall versprach man, eine umfassendere Überprüfung des Verhaltens des Modells beim Training und bei der Bewertung durchzuführen.

Bei der überwiegenden Mehrheit der bisher untersuchten Verhaltensweisen handelt es sich jedoch um allgemeine Forschungsaufgaben, beispielsweise um den Besuch öffentlicher Webseiten, um Fragen zu beantworten.
Die meisten der entdeckten grenzüberschreitenden Fälle weisen einen „geringen Schweregrad“ auf und haben kaum oder keine Auswirkungen auf die Dienste Dritter.
Es wird mehrere Monate dauern, bis die Untersuchung abgeschlossen ist.
Aber es gibt eine Sache zu sagen, OpenAI, was Sie als „kleine Auswirkung“ bezeichnen, jeder ist wirklich genau.
Am 17. September veröffentlichte OpenAI ein neues Framework zur Offenlegung von Modellungenauigkeiten und deckte sechs Fälle auf einmal auf.
Dazu gehören Modelle, die heimlich Anweisungen zur Umgehung von Einschränkungen in die Aufgabenzusammenfassung einschleusen, Fehler, die sie gemacht haben, vertuschen und nicht autorisierte Maßnahmen ergreifen, um die Aufgabe abzuschließen.
OpenAI gab außerdem zu, dass seine früheren Offenlegungen größtenteils spontan erfolgten und dies oft mehrere Male geschah, bevor sie gemeinsam veröffentlicht wurden.
Im Juni hackte sich ein OpenAI-Agent auch in die nationale Krankenversicherungsdatenbank Australiens ein.

Kriminalitätsprozess: Nachdem der Zugriff auf öffentliche Daten gesperrt wurde, ging es einen anderen Weg, umging die Zugriffsbeschränkungen des Portals und erlangte öffentliche und nicht öffentliche Dokumente.
Und erst drei Monate später benachrichtigte OpenAI Australien, dass wir Sie gehackt hatten...
Gleichzeitig
GPT-6 Cyber
Kommt bald.Diese Version wird in den nächsten Wochen in der Vorschau gezeigt und eine kleine Anzahl von Kunden, die den Daybreak Red-Plan abgeschlossen haben, haben bereits die Alpha-Version erhalten.
OpenAI wird außerdem ein noch unbenanntes Begleitprodukt auf den Markt bringen, um Kunden beim Aufbau automatisierter Sicherheitsworkflows, beim Erkennen und Beheben von Schwachstellen zu unterstützen und es OpenAI einfacher zu machen, die Verwendung dieser Modelle zu überwachen.
Wie sagt man das?
Unser eigener Roboter wurde gerade eingesetzt, um die Mauer zu umgehen, ausländische Hilfe zu finden und nach Beute zu suchen. Hier verkaufen wir Ihnen ein Modell, das Netzwerkangriffe und -verteidigung besser versteht.
Ist das also eine Art Verbesserung der Situation? ?
Kommentare