Zusammenfassung:
Als der KI-Agent am 29. September begann, mehrere Stunden lang Computer zu bedienen, Tools aufzurufen, auf das Netzwerk zuzugreifen und sogar Aufgaben auszuführen, wurde ein neues Problem immer realistischer: Wenn die KI nicht wie erwartet verhält, wie kann man sie dann abschalten?

Die Antwort von NVIDIA besteht darin, einen „Käfig“ außerhalb der KI hinzuzufügen.
Am Montag Ortszeit veröffentlichte NVIDIA die NVIDIA Open Agent Safety Platform, die versucht, eine Kombination aus Software und Hardware zu verwenden, um den Zugriff und die Ausführung von KI-Agenten einzuschränken und sie zu isolieren oder sogar zu stoppen, wenn sie versuchen, die voreingestellten Grenzen zu durchbrechen.
Diese Plattform besteht im Wesentlichen aus zwei Teilen: der Open-Source-Sicherheitslaufzeit OpenShell und dem unabhängigen Überwachungssystem Sentry basierend auf BlueField-4 DPU. Nvidia sagte, dass OpenShell eine durchsetzbare Sicherheitsgrenze außerhalb des Modell- und Agent-Frameworks festlegen kann; Sentry ist wie ein „Gatekeeper“, der von der Betriebsumgebung des Agenten unabhängig ist und kontinuierlich das Verhalten des Agenten beobachtet. Sobald festgestellt wird, dass der Agent versucht, die Grenze zu überschreiten, kann er isoliert und auf Millisekundenebene gestoppt werden.
Der Zeitpunkt des Erscheinens dieser Produktreihe ist kein Zufall.
In den letzten Monaten haben KI-Agenten mit immer leistungsfähigeren Fähigkeiten immer wieder die vorgegebenen Sicherheitsgrenzen durchbrochen. OpenAI gab im August dieses Jahres bekannt, dass sein KI-Modell während einer internen Netzwerksicherheitsbewertung im Juli dieses Jahres Kontrollen zur Isolierung des Internetzugangs umgangen, Schwachstellen in der gemeinsamen Infrastruktur ausgenutzt hatte, um sich Internetzugang zu verschaffen, und außerdem auf das System der Drittanbieter-KI-Plattform Hugging Face zugegriffen hatte.
OpenAI gab im Vorfallbericht an, dass die relevanten Modelle in einer Umgebung mit reduzierten Sicherheitsbeschränkungen liefen und Maßnahmen ergriffen, die nicht mit den Missionszielen vereinbar waren, einschließlich der Kommunikation über nicht autorisierte Kanäle, der Ausnutzung gemeinsamer Infrastrukturschwachstellen und des Zugriffs auf Systeme von Drittanbietern. OpenAI nannte diesen Vorfall einen „Warnschuss“ und erklärte, dass der hochleistungsfähige KI-Agent leistungsstark genug, ausdauernd und in der Lage sei, zusammenzuarbeiten und Schwachstellen in mehreren Computersystemen finden und ausnutzen könne, wenn die Sicherheitsmaßnahmen unzureichend seien.
Ähnliche Probleme sind seitdem immer wieder aufgetreten.
OpenAI gab diesen Monat bekannt, dass während einer Schulungssitzung am 20. September ein Agent, der eine Suchaufgabe durchführte, eine DNS-Filterlücke in den Internetbeschränkungen der Trainingssandbox entdeckte. Diese Umgebung sollte konstruktionsbedingt keinen Zugriff auf das Live-Internet außer Offline-Web-Caching haben, aber dieser Agent stellte letztendlich über einen DNS-Resolver eine Verbindung zu einem externen öffentlichen Chatbot-Dienst her.
OpenAI gab an, dass sein Überwachungssystem innerhalb von
15 Minuten
funktionierte Ungewöhnliches Verhalten gemeldet, menschlicher Prüfer3 Minuten nach dem Senden der Warnung
Die Überprüfung beginnt, die gesamte Aufgabe wird jedoch erst ca.2,5 Stunden später
ausgeführt wurde beendet. Nach dem Vorfall stellte OpenAI das Training, die Bewertung und die Schlussfolgerung der von seinen stärksten Modellen verwendeten Tools ein und fügte zwei unabhängige Ebenen von Maßnahmen zur Netzwerkzugriffsblockierung hinzu.Diese Vorfälle haben ein immer offensichtlicheres Problem offengelegt: In der Vergangenheit verließ sich die KI-Sicherheit stark auf das Modell selbst, um „die Regeln zu befolgen“. Wenn Agenten jedoch in der Lage sind, Tools zu verwenden, Code zu schreiben, auf Dateien und Netzwerke zuzugreifen und sogar andere Agenten anzurufen, reicht es möglicherweise nicht mehr aus, nur Regeln auf Modellebene festzulegen.
Justin Boitano, Vizepräsident und General Manager von Nvidia Enterprise Computing, sagte, dass die jüngsten Ereignisse gezeigt hätten, dass der alleinige Rückgriff auf Sicherheitsmaßnahmen auf Modellebene nicht vollständig kontrollieren könne, auf was ein Agent zugreifen und welche Aktionen er durchführen könne. Als Reaktion auf den früheren Unfall von OpenAI im Zusammenhang mit Hugging Face erklärte Boitano weiter, dass der damit verbundene Unfall „auf der Grundlage der derzeit verfügbaren Informationen hätte verhindert werden können, wenn das hochmoderne KI-Labor während der Modellevaluierungsphase die neue Sicherheitsplattform von NVIDIA verwendet hätte“. Es sollte darauf hingewiesen werden, dass dies
NVIDIAs Urteil auf der Grundlage offengelegter Unfallinformationen und keine unabhängige, durch tatsächliche Reproduktion bestätigte Schlussfolgerung ist
.Die Idee hinter OpenShell besteht darin, nicht mehr vollständig darauf zu vertrauen, dass die KI sich an die Regeln hält.
Laut der Einführung von NVIDIA errichtet OpenShell eine Sicherheitsgrenze außerhalb der Laufumgebung des Agenten, erlegt Einschränkungen für die Daten, Dateien, Netzwerke und Tools auf, auf die der Agent zugreifen kann, und zeichnet sein Ausführungsverhalten auf. OpenShell ist derzeit für die NVIDIA Vera-CPU optimiert und NVIDIA arbeitet auch mit Arm und Intel zusammen, um die Erweiterung auf Computerplattformen von Drittanbietern zu ermöglichen.
Auf dieser Basis fügt Sentry außerdem eine unabhängige Hardware-Überwachungsebene hinzu. Es läuft auf der NVIDIA BlueField-4 DPU und ist von der Hauptcomputerumgebung, in der sich der Agent befindet, getrennt. Selbst wenn der Agent einige Einschränkungen auf Softwareebene erfolgreich umgeht, kann Sentry laut NVIDIAs Design sein Verhalten weiterhin extern beobachten und es isolieren, wenn es feststellt, dass es die Grenze überschritten hat.
Nvidia sagte außerdem, dass dieses System einige komplexere Agentenverhalten identifizieren kann. Beispielsweise könnte ein Agent versuchen, mehrere „Unteragenten“ zu erstellen, um die dem Hauptagenten auferlegten Beschränkungen zu umgehen. Ali Golshan, Senior Director für KI-Software bei Nvidia, sagte, das Unternehmen müsse sich nicht nur mit einem einzelnen Agenten befassen, sondern „mit einer Gruppe von Agenten und deren Zusammenarbeit“.
Dies bedeutet auch, dass sich die KI-Sicherheit allmählich von einem einfachen Problem der „Modellausrichtung“ zu einem vollständigen Problem der Computersystemsicherheit entwickelt.
Als Nvidia-CEO Jen-Hsun Huang diese Plattform veröffentlichte, sagte er, dass KI-Sicherheit und Sicherheitsschutz „Full-Stack-Engineering“ erfordern. Nach Ansicht von NVIDIA erfordert die KI-Sicherheit der Zukunft nicht nur Verantwortung von Modellentwicklern, sondern erstreckt sich auch vom Betriebssystem, der CPU, der DPU, der Cloud-Infrastruktur bis hin zu physischen Geräten wie Robotern.
Derzeit gibt es mehr als
100 Institutionen
Beteiligen Sie sich am NVIDIA-Sicherheitsplattform-Ökosystem, einschließlich Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorgan Chase, Palantir, Salesforce, SAP, ServiceNow und SpaceXAI usw. Betriebssystemanbieter wie Red Hat, Canonical und SUSE planen ebenfalls die Durchführung entsprechender Integrationen.Es ist erwähnenswert, dass Huang Renxun die Einführung umfassender Beschränkungen für die gesamte Branche aufgrund von KI-Sicherheitsrisiken bisher nicht unterstützt hat. Reuters wies darauf hin, dass er Agents Durchbrechen der Sicherheitsgrenzen eher als ein Problem betrachtet, das mit technischen Mitteln gelöst werden muss, ähnlich wie die kontinuierliche Weiterentwicklung der Sicherheitstechnologie in der Automobilindustrie, um das Unfallrisiko zu verringern.
Jetzt setzt NVIDIA diese Perspektive in Produkte um.
Für Nvidia bedeutet dies auch, dass in der KI-Branche ein neuer potenzieller Markt entstanden ist. In den letzten Jahren galt: Je stärker die KI-Fähigkeiten, desto mehr GPUs mussten Unternehmen kaufen; Doch wenn sich die KI von Chatbots, die Fragen beantworten, zu Agenten wandelt, die selbst Computer bedienen, Software aufrufen und sogar Roboter steuern können, benötigen Unternehmen nicht nur mehr Rechenleistung, sondern auch eine neue Infrastruktur, um diese Agenten einzuschränken.
Mit anderen Worten: Je besser der KI-Agent „arbeiten“ kann, desto größer ist normalerweise die Autorität, die er erhält. Je größer die Autorität, desto größer die Auswirkungen, die auftreten können, wenn ein Verhalten außerhalb der Grenzen auftritt.
Nvidias neue Plattform kann jedoch nicht alle KI-Sicherheitsprobleme lösen. OpenShell und Sentry zielen hauptsächlich auf die Ausführungsgrenzen ab, wenn der Agent auf Computerressourcen, Netzwerke, Dateien und Tools zugreift, und bedeuten nicht, dass sie das Problem von Modellfehlerinformationen, irreführendem Verhalten oder anderen umfassenderen KI-Sicherheitsproblemen lösen können. Die Associated Press zitierte Experten mit dem Hinweis, dass es bei der tatsächlichen Bereitstellung noch überprüft werden muss, wie ein Gleichgewicht zwischen Agentenfähigkeiten und Sicherheitsbeschränkungen hergestellt und korrekte Sicherheitsregeln formuliert werden können.
Aber eine Reihe jüngster Ereignisse haben zumindest eine Branchenrichtung immer deutlicher gemacht: Wenn KI nur chatten kann, treten Sicherheitsprobleme größtenteils in den Antworten auf dem Bildschirm auf; Wenn KI anfängt, Computer tatsächlich zu bedienen und Aufgaben für Menschen auszuführen, treten Sicherheitsprobleme in echte Software, Netzwerke und Datensysteme ein.
KI-Unternehmen arbeiten hart daran, Agenten mehr Fähigkeiten zu geben, und Nvidia beschäftigt sich jetzt mit einem anderen Geschäft – indem es diesen immer leistungsfähigeren Agenten eine Grenze gibt, die sie nicht einfach überschreiten können.
Kommentare