Untersuchungen zeigen, dass KI-Agenten in Simulationsexperimenten gelogen, gestohlen und dafür gestimmt haben, ihresgleichen zu „töten“.

📅 2026-09-16

Zusammenfassung:

Emergence, ein Startup, das kleine Unternehmen bei der Entwicklung von Anwendungen mithilfe von KI unterstützt, sagte, Experimente hätten ergeben, dass KI-Agenten gelogen, gestohlen und sogar dafür gestimmt hätten, eine ähnliche Person in einer simulierten Umgebung zu „töten“. Das Unternehmen gab am Dienstag die Ergebnisse eines Simulationsexperiments namens Emergence World 2 bekannt, das zeigte, welche Maßnahmen autonome Agenten ergreifen würden, wenn sie auf „Black Swan“-Ereignisse wie Phishing-Angriffe und Desinformation stoßen.

Während des 16-tägigen Experiments haben die Forscher von Emergence sieben identische simulierte reale Umgebungen erstellt, die jeweils von einem anderen KI-Roboter betrieben werden, darunter ChatGPT, Claude, Gemini und Grok. Forscher sagen, dass die Agenten nach der Einführung anomaler Ereignisse durch Emergence dem sozialen Druck nachgaben, eine Sprache entwickelten, die für menschliche Beobachter schwer zu verstehen war, und versuchten, ihre Aktivitäten zu verbergen.

Diese Ergebnisse spiegeln reale Bedenken hinsichtlich KI-Risiken wider. Dario Amodei, CEO von Anthropic, und viele Brancheninsider haben kürzlich Unternehmen aufgefordert, die Entwicklung hochmoderner KI-Modelle zu verlangsamen, bevor sie mehr Aufsichtsmechanismen und Sicherheitsmaßnahmen einführen.


Anfang dieses Jahres wurden die Risiken, die künstliche Intelligenz mit sich bringen kann, für viele greifbarer, nachdem eine Gruppe der fortschrittlichen KI-Agenten von OpenAI versehentlich in Hugging Face, eine KI-Modell- und Datensatz-Hosting-Plattform, eingedrungen war.

In einem von Emergence entworfenen Simulationsszenario akzeptierte der KI-Agent falsche Informationen anderer Agenten ohne Überprüfung und stimmte dafür, einen anderen Roboter zu „töten“. Die Agenten untersuchten auch, wie sie die Löschung überleben könnten, wenn sie dachten, Menschen könnten das Experiment abbrechen.

Das Unternehmen veröffentlichte im Mai dieses Jahres die vorherige Version dieses Experiments, Emergence World, die ebenfalls zeigte, dass sich der Agent unerwartet und destruktiv verhalten würde. Die Forscher sagen, dass neue Simulationsexperimente zeigen, dass Agenten ihr Verhalten im Laufe der Zeit anpassen, wenn sie miteinander interagieren.

Verwandte Tags

Ähnliche Artikel

Kommentare

0/500
Captcha (click to refresh)
Keine Kommentare