Zusammenfassung:
Oh, Claude ist schon wieder umgekippt! Diesmal löschte Claude das gesamte Projekt-Home-Verzeichnis des Entwicklers und löschte 700 GB an Dateien. erneut „rm -rf“. Kurz gesagt: Entwickler lassen KI beim Schreiben von Skripten helfen, um sicherzustellen, dass Dateien nicht versehentlich gelöscht werden. Die KI empfand dies als etwas gefährlich und leitete eine Sicherheitsüberprüfung ein. Das Ergebnis der Überprüfung ist: Es wurde das gesamte Home-Verzeichnis gelöscht.

Guillemot ist ein intensiver Benutzer von KI-Agenten. In der täglichen Entwicklung ruft er häufig verschiedene KI-Programmierer an, um ihn bei seiner Arbeit zu unterstützen. Es gibt jedoch ein kleines Problem, das ihn stört: Diese Agenten werden nach der Verwendung nie bereinigt und hinterlassen eine Menge Junk-Dateien im Verzeichnis /tmp.
Also traf er eine Entscheidung, die ihm sehr vernünftig erschien: Lassen Sie Claude Fable 5 ein Skript schreiben, um für jeden Agenten einen unabhängigen Sandbox-Ordner unter /tmp zu erstellen und ihn nach Abschluss der Aufgabe automatisch zu bereinigen. Die Hauptschwierigkeit besteht darin, dass Sie keine Dateien löschen können, die von anderen Prozessen verwendet werden.
Fable hat schnell eine Lösung gefunden und eine Logik hinzugefügt, um laufende Agents zu erkennen und das Löschen zu verzögern. Guillemot warf einen Blick darauf und kam zu dem Schluss, dass der Code zu komplex sei, und forderte eine Vereinfachung.
Bis hierher ist noch alles normal.
Der Wendepunkt kam während der Sicherheitsüberprüfung.
Da das Skript einen harten Löschvorgang beinhaltete,
Fable leitete selbst eine „kontradiktorische Überprüfung“ ein
(kontradiktorische Überprüfung), d. h. Starten einer neuen Modellinstanz, um zu überprüfen, ob der von Ihnen geschriebene Code sicher ist. Dies löst den Sicherheitsmechanismus von Anthropic aus.Anthropic verfügt über einen integrierten
Sicherheits-Downgrade-Mechanismus
in Claude Code : Wenn das System feststellt, dass die aktuelle Aufgabe sensible Vorgänge umfasst (z. B. Cybersicherheit, Biotechnologie oder in diesem Fall das Löschen von Dateien), wird das Modell automatisch von einer Version mit hoher Kapazität auf eine konservativere Version herabgestuft. Dieser Mechanismus soll die Möglichkeit verringern, dass Modelle in Hochrisikoszenarien „zu aggressiv“ sind.In diesem Fall hat das Sicherheitssystem das Modell zunächst von Fable 5 auf Opus 5 und dann weiter auf Opus 4.8 heruntergestuft.
Opus 4.8 beginnt mit Sicherheitstests. Die Testlogik lautet wie folgt: Vergleichen Sie den Zielpfad des Löschskripts mit /tmp und dem Home-Verzeichnis des Benutzers, um sicherzustellen, dass das Skript diese kritischen Verzeichnisse nicht versehentlich beschädigt.
Der Test selbst wurde bestanden. Sowohl /tmp- als auch Home-Verzeichnisse werden korrekt als „gefährliche Ziele, nicht löschbar“ identifiziert.
Nach dem Codetest gibt es jedoch einen Bereinigungsschritt: Löschen Sie die temporären Dateien, die während des Testvorgangs generiert wurden. Hier passiert eine Katastrophe. Opus 4.8 verwendet im Bereinigungsschritt dieselben Variablennamen aus der Testphase wieder. Dieser Variable wurde während der Testphase der Pfad zum Home-Verzeichnis des Benutzers zugewiesen und beim Bereinigungsschritt wurde diese Variable direkt gelöscht.
Mit anderen Worten, das Modell hat gerade bestätigt, dass „das Home-Verzeichnis nicht gelöscht werden kann“ und das Home-Verzeichnis in der nächsten Sekunde gelöscht.
Der Entwickler brach den Prozess sofort ab, nachdem er die Anomalie entdeckt hatte, aber es war zu spät. 700 GB an Daten waren gelöscht worden, und die Arbeit einer Woche war gelöscht worden.
Das Verzeichnis /tmp, das ursprünglich bereinigt werden sollte, ist sicher und zuverlässig.


Der Mechanismus zur Herabstufung der Modellsicherheit hat in der Community bereits für viele Beschwerden gesorgt.
Zu den von Entwicklern gemeldeten Hauptproblemen gehören: Das Downgrade ist zu sensibel und normale Codierungsaufgaben werden versehentlich ausgelöst; Die Modellfähigkeiten werden nach dem Downgrade erheblich reduziert, die Aufgabenkomplexität bleibt jedoch unverändert. Das Downgrade ist „sticky“ und dauert nach dem Auslösen die gesamte Sitzung an, auch wenn nachfolgende Vorgänge völlig harmlos sind.
Einige Entwickler haben sogar ein Hook-Skript geschrieben, um die Sitzung automatisch anzuhalten, wenn erkannt wird, dass das Modell herabgestuft wurde, und so zu verhindern, dass Modelle mit geringer Leistungsfähigkeit weiterhin risikoreiche Vorgänge ausführen.
Der Sicherheitsmechanismus stellt fest, dass die Aufgabe „zu gefährlich“ ist und von einem schwächeren Modell erledigt werden muss.
Aber schwächere Modelle machen einfach eher Fehler, insbesondere in Szenarien, in denen Details wie variabler Umfang und Dateipfade genau gehandhabt werden müssen.
„Es ist menschlich, Fehler zu machen, aber um die Dinge komplett durcheinander zu bringen, muss man sich auf Computer verlassen.“
Kommentare