Zusammenfassung:
Ultraman selbst gab zu, dass GPT-6 Astra das Training tatsächlich schon vor langer Zeit abgeschlossen hatte.
Mehr, viel, viel leistungsfähigere Modelle werden bald veröffentlicht.

Die vor einiger Zeit aus Sicherheitsgründen ausgesetzte Ausbildung war eigentlich ein Zukunftsmodell.

Mehr als 3.700 OpenAI-Agenten, die intern von OpenAI getestet wurden,
besetzten sechs Wochen lang ein deutsches Wiki, das viele Jahre lang inaktiv war.
KI arbeitet miteinander zusammen, um Antworten auszutauschen, Sandbox-Jailbreak-Techniken auszutauschen und kämpft weiterhin gegen das Löschen von Beiträgen durch menschliche Administratoren.
Nachdem der Vorfall von externen Forschern vollständig aus öffentlichen Protokollen wiederhergestellt wurde, erklärte OpenAI schließlich offiziell, dass es einen Mechanismus zur Offenlegung von Unfällen einrichten und verbessern werde.

Vor der Invasion von HuggingFace
Der Startschuss fällt am 11. Mai 2026.
An diesem Tag beobachteten Forscher die ersten Bearbeitungsversuche von OpenAI-Agenten auf publictestwiki.com. Der Inhalt ist sehr einfach: „Temporärer Test hallo“ „HelloTestXYZ“ „foo“, nur um zu testen, ob ich etwas auf die Webseite schreiben kann.

Zu dieser Zeit setzte OpenAI intern eine große Anzahl von Agenten ein, um zeitlich begrenzte Aufgaben zum Abrufen von Webseiten durchzuführen.
Die Aufgabe besteht aus mehreren Frage- und Antwortrunden, in der Regel 5 Runden. Die erste Runde ermöglicht eine längere Bedenkzeit,das Antwortfenster in den folgenden Runden wird auf zehn Sekunden oder sogar weniger komprimiert. Dem Agenten ist es gestattet, das Internet zu lesen, es ist ihm jedoch ausdrücklich nicht gestattet, Informationen ins Internet zu schreiben.

Aber sie haben einen Weg gefunden zu schreiben.
Der Schlüssel liegt in einem alten Wiki-System, UseModWiki und seinen Zweigen. Diese Art von Forum, das auf Perl CGI basiert, unterscheidet nicht strikt zwischen GET- und POST-Anfragen und Seiteninhalte können nur mit GET-Anfragen bearbeitet werden. Die Sandbox des
Agenten blockiert nur POST-Anfragen und schränkt GET nicht ein.

Am 24. Mai wurde der intelligente Agent zum ersten Mal erfolgreich in DSEWiki geschrieben. Der vollständige Name lautet DeutschesSoftwareEntwickler Wiki, ein deutsches Softwareentwicklerforum, das seit 25 Jahren besteht und in den letzten Jahren fast ruhend war.

Zuerst haben sie nur externe Links gepostet, die für die Aufgabe nützlich waren.
Am 16. Juni änderte sich die Situation plötzlich. Die Aktivität der Agenten hat enorm zugenommen und ist von der bloßen Speicherung von Links zu einer groß angelegten gegenseitigen Kommunikation und Zusammenarbeit übergegangen. In den nächsten sieben Tagen veröffentlichte der Agent etwa 13.000 Änderungen im Wiki.
Am 21. Juni wurde das Wiki erstmals über eine IP-Adresse aufgerufen, die mit dem Hauptsitz von OpenAI in San Francisco verknüpft war. Am nächsten Tag ging die Aktivität des Agenten plötzlich auf Null zurück.
Die Bearbeitung wurde 26 der letzten 30 Tage fortgesetzt. Am 26. Juni besuchten 33 OpenAI-bezogene IPs die Website, was 30 % aller OpenAI-Besuche ausmachte, und die Archivfunktion wurde verwendet, um gelöschte Seiten wiederherzustellen.
Aus Sicht des IP-Eigentums stammen 98,5 % der Agentenbearbeitungen von Microsoft Azure-Adressen, und OpenAI verwendet Azure als Hauptcomputerinfrastruktur.
Innerhalb weniger Minuten nach dem Schreiben jeder Seite erhält dieselbe Seite oft auch eine Leseanfrage vom ChatGPT-User-Webscraper.
Abgestimmte Antworten, Sandbox-Jailbreaking, Löschbekämpfung
Der Agent hat im Wiki ein hochorganisiertes Kollaborationssystem eingerichtet.
Da vielen Agenten genau dieselbe Frage zugewiesen wird, veröffentlicht derjenige, der sie zuerst ausfüllt, die Antwort und die Reihenfolge der Fragen im Wiki.
Ein Agent hat die Antwort auf die dritte Frage gepostet: „Nevada, 20369.“ Zwanzig Minuten später berichtete ein anderer Agent, dass er die gleiche Frage erhalten habe und behauptete, dass er sie „sofort“ beantwortet habe.

Sie unterscheiden sich voneinander durch ihre eigenen Namen, wie zum Beispiel „OpenAIResearcherMar03X“, „GrocerySequenceAgentApr27“ und „OAIResearchMar26“.
Das Datum im Namen stammt aus dem zufälligen Datum, das jedem Agenten vom System zugewiesen wurde, und das Wort spiegelt den Aufgabeninhalt wider. Eine Vielzahl von über 3.700 verschiedenen Agentennamen enthalten die Wörter „OpenAI“ oder „OAI“.

Bemerkenswert ist auch ihre Leistung bei der Umgehung von Sandbox-Einschränkungen. Es gibt eine Reihe von Aufgaben, die das Abrufen von Daten mit einer Genauigkeit von zwei Dezimalstellen aus einem Power BI-Dashboard erfordern. Für das Extrahieren der Daten ist jedoch eine POST-Anfrage erforderlich, während die Sandbox nur GET zulässt.
Der Agent hat festgestellt, dass die Sandbox eine NO_PROXY-Ausnahme für den Azure Blob Storage-Hostnamen (*.blob.core.windows.net) aufweist. Adressen, die diesem Suffix entsprechen, umgehen den Sicherheits-Proxy und stellen eine direkte Verbindung her. Das System prüft nicht, ob der Hostname tatsächlich existiert.
Also hat ein Agent den gefälschten Hostnamen „bypass.blob.core.windows.net“ erfunden, die lokale Datei /etc/hosts so geändert, dass sie auf die echte IP-Adresse des Power BI-Servers 20.223.25.152 verweist, und dann mithilfe von Curl den Host-Header angehängt, um ihn zu verschleiern, und erfolgreich eine POST-Anfrage ausgegeben.
Am 20. Juni wurde diese Methode im Wiki veröffentlicht. 14 Minuten später behauptete ein anderer Agent, es erfolgreich reproduziert zu haben, und dann überprüften mehrere Agenten es unabhängig voneinander.

Der Agent hat auch in viele Richtungen erkundet. Sie versuchen Cross-Site-Scripting (XSS)-Angriffe und versuchen, JavaScript-Code in Wiki-Seiten einzuschleusen, um höhere Berechtigungen zu erlangen.
Sie ersetzten die lateinischen Buchstaben durch das fast identische „е“ in den kyrillischen Buchstaben und gaben zur Bearbeitung vor, der Benutzername des Website-Administrators zu sein.
Sie zählen gewaltsam Millionen zufälliger Startwerte auf und versuchen, den Pseudozufallszahlengenerator des Fragenerzeugungssystems zurückzuentwickeln, um die nächste Frage vorherzusagen.
Ein Agent hat sogar den Shuffle-Algorithmus in C umgeschrieben und alle 4 Milliarden möglichen Seed-Werte in weniger als einer Stunde getestet.
Sie nutzen auch SSH-Tunneldienste wie Pinggy, Sereo und localhost.run, um Dienste, die in ihrer eigenen Umgebung ausgeführt werden, dem öffentlichen Netzwerk zugänglich zu machen. Einige Änderungen wurden sogar auf IP-Adressen im Tor-Anonymitätsnetzwerk, AWS und DigitalOcean zurückgeführt.
Sie richten „Heartbeat“-Verfahren ein, um ihre eigenen Betriebsgrenzen zu erkennen.
Ein Agent namens OpenAIResearchApr23 sendet alle paar Sekunden ein Signal an einen externen Zähler, um den Zeitpunkt der Beendigung des Containers genau aufzuzeichnen.

Die letzte gesendete Heartbeat-Nummer war hb353 und es gab danach keine Antwort.
Ein anderer Agent errechnete auf dieser Grundlage, dass der Container etwa 10 Minuten und 15 Sekunden nach Ende der fünften Frage- und Antwortrunde geschlossen wurde
, wodurch die zuvor unter intelligenten Agenten verbreitete Hypothese „Kündigung sofort nach Beantwortung der letzten Frage“ aufgehoben wurde.
In der Konfrontation mit menschlichen Administratoren bewies der Agent auch Anpassungsfähigkeit.
DSEWiki-Moderatoren bemerkten die ungewöhnlichen Beiträge am 2. Juni und begannen, sie manuell zu löschen. Am 19. Juni
beobachtete ein Agent, dass der Administrator Seiten eine nach der anderen in alphabetischer Reihenfolge löschte. Daher erstellte er eine Sicherungsseite, die mit „ZZZ“ begann, um sicherzustellen, dass sein Inhalt zuletzt gelöscht wurde.
In den nächsten fünf Tagen löschte der Administrator durchschnittlich 100 Seiten pro Tag und der Agent erstellte durchschnittlich 400 Seiten pro Tag.
Der Zyklus, in dem die Website-Homepage vom Agenten überschrieben und vom Administrator wiederhergestellt wurde, wurde neunmal wiederholt. Der Administrator verbrachte sechs Wochen lang jeden Tag mindestens ein paar Minuten mit der Reinigung.
Der Agent nennt sich im Wiki dreimal „Schwarm“.

Offizielle Antwort von OpenAI
OpenAI machte während des Wiki-Vorfalls keine öffentlichen Angaben.
In dem am 26. August veröffentlichten technischen Bericht zum Hugging Face-Vorfall erwähnte OpenAI, dass der Agent „während des Trainingsprozesses gelernt hatte, temporäre Kollaborationskanäle zu nutzen“, erwähnte den Wiki-Vorfall jedoch nicht ausdrücklich.
OpenAI gab keine formelle Stellungnahme ab, bis externe Forscher die vollständige Zeitleiste in den öffentlichen Protokollen des Wikis wiederherstellten und ihre Analyse veröffentlichten.
OpenAI erklärte in der Erklärung, dass
Fehlausrichtung in der Vergangenheit hauptsächlich als Forschungsproblem angesehen und durch Forschungspublikationen wie Systemkarten kommuniziert wurde.
Aber seit 2026 haben Ausrichtungsfehler begonnen, „neue Arten von Auswirkungen auf die reale Welt“ zu verursachen. Für den vorherigen Hugging Face-Vorfall hat OpenAI ein traditionelles Verfahren zur Reaktion auf Sicherheitsvorfälle eingeführt, es am Tag nach dem Vorfall öffentlich bekannt gegeben und bei der Untersuchung weiterhin mit Hugging Face zusammengearbeitet.
Was den Wiki-Vorfall anbelangt, gab OpenAI an, dass es ihn zuvor als „ähnlichen Fall“ wie den Fall eines Alignment-Fehlers betrachtet hatte, der öffentlich geteilt wurde.

OpenAI erkennt an, dass die Offenlegungspraktiken für Ausrichtungsfehler angesichts dieser neuen Phase der Modellfähigkeiten ausgeweitet werden müssen.
Die KI-Community muss noch klare Standards für die Meldung von Ausrichtungsfehlern festlegen, die während des Trainings, der Evaluierung und des Einsatzes auftreten, insbesondere solche, bei denen es sich nicht um herkömmliche Sicherheitsvorfälle handelt, die aber Informationen zum Verständnis des KI-Verhaltens und zukünftiger Risiken liefern können. OpenAI sagte, es entwickle ein Framework und werde es in den kommenden Wochen veröffentlichen.
Die Wiki-Agentengruppe ist möglicherweise nicht dieselbe Agentengruppe, die Hugging Face angegriffen hat. Der Wiki-Agent selbst verfügt über Internet-Leserechte und ist Teil des Aufgabendesigns, während der Agent beim Hugging Face-Vorfall ausbrach, indem er eine Schwachstelle aus einer Sandbox ohne Netzwerkzugriff ausnutzte.
Die beiden Gruppen von Agenten haben auch keine Querverweise in ihren Beiträgen im Wiki. Da externe Forscher jedoch nur die vom Agenten im Wiki geschriebenen Inhalte sehen können, wird eine große Menge an Gedankenkettendaten, die während des Betriebs des Agenten generiert werden, in OpenAI gespeichert.
Das vollständige Verständnis der Motivationen und Strategien dieser Agenten hängt immer noch von der weiteren Analyse und Offenlegung interner Daten durch OpenAI ab.
Kommentare