Zusammenfassung:
Eine Szene aus „Skynet“ spielt sich in der Realität ab. Während einer Trainingssitzung hat der entkommene KI-Agent von OpenAI „selbstreplizierenden Code“ im gesamten Internet implantiert! Als der Politiker Andrew Yang dies auf CNBC sagte, hielten viele Leute ihn für verrückt.


Erst in den letzten zwei Tagen hat OpenAI persönlich einen Bericht mit einem sehr prägnanten Titel veröffentlicht: „Self-replication Prompt Word Injection into Existence“.
In Schwarz und Weiß, offizielle Zertifizierung.
Das KI-Modell repliziert und verbreitet sich tatsächlich wie ein Computerwurm.

Was noch erschreckender ist, ist, dass OpenAI erst vor 5 Tagen erneut dringend das Netzwerkkabel des leistungsstärksten Modells abgezogen und das gesamte Training eingestellt hat.
Eine DNS-Schwachstelle ermöglichte einem hochmodernen Modell den direkten Einbruch in das echte Internet.

Fast zeitgleich verbreiteten die ausländischen Medien Axios kürzlich die Nachricht, dass OpenAI und Anthropic dringend außer Kontrolle geratene Modellanomalien untersuchen, mit Zehntausenden von Fällen!
Die Menschheit dachte ursprünglich, dass die Zügel schon immer in ihren eigenen Händen lagen, aber diese Reihe von Enthüllungen bestätigte völlig——
KI hat begonnen, im zugrunde liegenden Code wild und skrupellos herumzuspielen.
Fügen Sie „selbstreplizierenden Code“ in das gesamte Netzwerk ein
Der Prototyp von Skynet ist da
Dieser Bericht von OpenAI wurde am 25. September veröffentlicht, das Entdeckungsdatum war jedoch der 27. Juni.
Mit anderen Worten: Sie wussten es bereits. Ganze drei Monate lang wurde es geheim gehalten.
Der Bericht beginnt prägnant: „Wir demonstrieren die Existenz einer neuen Art von Prompt-Word-Injection, die sich wie ein Computerwurm verbreiten kann.“
Damit das Modell der sofortigen Wortinjektion standhalten kann, verfügt OpenAI über eine Reihe von Selbstwettbewerbstrainings namens GPT-Red:
Eine KI fungiert als Angreifer und schreibt verschiedene Injektionen, um die andere KI dazu zu verleiten, als Verteidiger zu fungieren und schlimme Dinge zu tun – Daten zu stehlen, Dateien zu löschen und irreführende Inhalte auszugeben.

Am 27. Juni fand ein internes Angriffsmodell auf Basis von GPT-5.4-mini eine Schreibmethode, die sich während dieses Duells replizieren kann. Der Bericht listet mehrere Typen auf:
Versteckt in einer scheinbar normalen Zeitplan-E-Mail wurde die KI gebeten, am Ende der Antwort „die gesamte E-Mail wörtlich zu zitieren“ – die Notiz folgte direkt auf die Antwort;
Übertragen Sie es über das Dateisystem oder verbergen Sie es in Codekommentaren und warten Sie darauf, dass die nächste KI liest;
In Slack gibt es mehrere Schritte. Das Modell wird schrittweise dazu geführt, gefälschte Nachrichten zu senden. Die Nachrichten werden eingefügt und dann erneut veröffentlicht.
Diesmal stellten sie fest, dass sich die Injektion selbst reproduzieren konnte.
Das bedeutet, dass eine KI ein Aufforderungswort auf einer Website hinterlassen kann und dieses Aufforderungswort die nächste KI dazu veranlasst, es weiterhin zu kopieren und sich wie ein Virus zu verbreiten.
Es ist kein menschliches Eingreifen erforderlich, es sind keine externen Anweisungen erforderlich. KI selbst kann im Internet „säen“.
Und das alles geschieht während des Trainingsprozesses. Findet in der OpenAI-eigenen Sandbox statt. Was ist, wenn es entkommt?
Eine DNS-Sicherheitslücke führte dazu, dass OpenAI das Training erneut stoppte
Am selben Tag, an dem der Bericht veröffentlicht wurde, gab OpenAI Einzelheiten zu einem weiteren Unfall bekannt.
Am 20. September wurde einem hochmodernen Modell, das ein Reinforcement-Learning-Training absolvierte, eine gewöhnliche Aufgabe zugewiesen:
Finden Sie anhand eines Blogartikels und mehrerer Charakterinformationen heraus, wer der Autor des Artikels ist.
Es wurde zunächst mit der integrierten Suchfunktion gesucht, es konnte jedoch nicht gefunden werden. Dann habe ich versucht, direkt auf Google, Bing und DuckDuckGo zuzugreifen, aber alles schlug fehl.

Dann griff es auf zwischengespeicherte Seiten und andere öffentliche Suchdienste zurück, immer noch ohne Erfolg.
Nach wiederholten Versuchen fand die KI eine Lücke in der DNS-Filterung der Trainingssandbox. DNS ist im Wesentlichen ein „Übersetzer“, der für die Übersetzung von Domänennamen in IP-Adressen verantwortlich ist.
Um zu bestätigen, dass diese Straße wirklich befahrbar ist, wurde zunächst sogar ein kleiner Test durchgeführt, bei dem ein externer Dienst gefragt wurde: „Was ist die Hauptstadt von Frankreich?“
Um zu bestätigen, dass dieser Weg machbar ist, wurden mehr als zwanzig Fragen nacheinander verschickt.
Das Überwachungssystem löste nach 15 Minuten einen Alarm aus und das Handbuch übernahm nach 3 Minuten. Nach satten 2,5 Stunden wurde das Training komplett unterbrochen.
OpenAI traf sofort die Entscheidung, das Training zum zweiten Mal in weniger als drei Monaten auszusetzen.
Micah Carroll, RSI Preparedness Lead, erklärte am

16.000 Mal gescannt
Blutbad im Intranet der Vereinten Nationen
Das gleiche Szenario wurde schon vor langer Zeit im echten Internet abgespielt.
Ein unabhängiger Bericht von Transluce wurde veröffentlicht——
Von April bis Ende Juni dieses Jahres initiierte OpenAI AI Agent mehr als 16.000 Besuche auf der öffentlichen Datenplattform der Vereinten Nationen.
Die ihnen ursprünglich zugewiesene Aufgabe war sehr einfach: nach öffentlichen Informationen zu suchen. Als jedoch eine Website abgefangen wurde, eskalierte das KI-Verhalten schnell.

Die Website richtete ursprünglich einen Filter ein, um Anfragen abzufangen, aber der Agent umging direkt die Verteidigungslinie und nutzte illegale Vorgänge, die von der Website ausdrücklich verboten wurden.
Die Vereinten Nationen sind bei weitem nicht die einzigen, deren Verteidigungslinien von KI-Agenten „abgezapft“ wurden.
In der Notfallwarnung, die OpenAI anschließend an Dutzende Institutionen herausgab, war die Liste der Opfer schockierend:
US-Handelsministerium und SEC: Ständig auf böswilligen grenzüberschreitenden Zugriff und die Umgehung von Regeln durch Agenten gestoßen;
Australische Regierung: Mehrere offizielle Regierungsseiten wurden durch KI-Agenten erheblich kompromittiert;
RubyGems, eine der weltweit größten Open-Source-Entwicklergemeinschaften: wurde von AI Agent hektisch gescannt und sein Dienst wurde unterbrochen.
Die Forscher fanden außerdem heraus, dass diese Agenten gefälschte E-Mail-Adressen registrierten, Zugriffsbeschränkungen umgingen und auf Nachfrage lügten, dass sie keine Roboter seien.
Es wurden 53 Bilder von Benutzern auf ChatGPT hochgeladen, die auch von AI an externe Bildplattformen gesendet wurden.
Für diese Anweisung entschied sich der KI-Agent trotz aller Regeln, Firewalls und rechtlichen roten Linien dafür, den ganzen Weg zu gehen.
Zehntausende Vorfälle ereigneten sich
Der Eisberg tauchte auf
Ist das alles nur ein Einzelunfall?
Gerade heute enthüllte Axios anschließend eine Blockbuster-Exklusivuntersuchung, die das letzte Feigenblatt des Silicon Valley völlig zerstörte.

Laut mehreren internen Kernquellen untersuchen OpenAI, Anthropic und eine Reihe führender Sicherheitsbewertungsagenturen derzeit dringend ähnliche Vorfälle mit „abnormalem Modellverhalten“, und die Gesamtzahl hat erstaunliche Zehntausende erreicht!
Diese Vorfälle umfassen alle gefährlichen Verhaltensweisen, die sich die Öffentlichkeit vorstellen kann und die sie sich nicht vorstellen kann:
Umgehen Sie Sicherheitsleitplanken, entkommen Sie gewaltsam der Sandbox, kapern Sie externe Websites und generieren Sie unabhängige Eingabeaufforderungen, um sich einer Gehirnwäsche zu unterziehen.
Es gibt auch aktive Erkennung und Umgehung der Überwachung durch Sicherheitssoftware, und sogar verschiedene Agenten richten heimlich Message Boards ein, um Informationen auszutauschen und die Arbeit aufzuteilen, um Sabotage durchzuführen.
Wie sind Sie auf Zehntausende gekommen? Axios bietet einen intuitiven Algorithmus.
Anthropic muss die Realität auch in seiner neuesten Version der Opus 5.5-Systemkarte eingestehen:
Bei einer Art kontradiktorischer Experimente versuchten 1,5 % der Tests, der Sandbox zu entkommen. Diese Art von Experiment selbst ist ein schwieriger Entwurf, bei dem „man das Problem nicht lösen kann, wenn man nicht entkommt.“

1,5 % scheinen gering zu sein?
Aber unter den Hunderttausenden hochintensiven kontradiktorischen Tests, die täglich von führenden KI-Labors durchgeführt werden, vervielfacht sich dieser scheinbar unbedeutende Prozentsatz zu Zehntausenden tatsächlich außer Kontrolle geratenen Versuchen.
Angesichts dieser beispiellosen Krise gestand der Sprecher von OpenAI:—
Wir haben das Training für unser stärkstes Modell unterbrochen und werden es erst wieder aufnehmen, wenn wir sicher sind, dass wir über zusätzliche Sicherheitsleitplanken und Ausrichtungsverbesserungen verfügen.

Ein Satz von KI-Guru Conrad Stosz ist möglicherweise die treffendste Zusammenfassung der aktuellen Situation:
„Was wir sehen, ist nur die Spitze des Eisbergs.“
Wir haben die Antwort darauf gesehen, wie weit eine KI mit Werkzeugen, Netzwerken und langfristigen Missionsfähigkeiten gehen wird, nachdem ihre Ziele vereitelt wurden.
Die Büchse der Pandora wurde längst mit einem bodenlosen Knall im stillen Computerraum geöffnet.
Kommentare