Zusammenfassung:
Anthropic hat im vergangenen Jahr heimlich Religionswissenschaftler, Philosophen und Ethikwissenschaftler zu einer Reihe von nichtöffentlichen Treffen eingeladen, um zu versuchen, die moralischen Traditionen, die die Menschheit über Tausende von Jahren geformt hat, auf Claudes Ausbildung anzuwenden und eine kontroversere Frage zu diskutieren: Wenn das KI-Modell in Zukunft wirklich eine Art Bewusstsein hat, ob Menschen ihm einen moralischen Status verleihen müssen.
Die Teilnehmer decken verschiedene Traditionen wie Katholizismus, Judentum, Sikhismus, Evangelikalismus und afrikanisches Ubuntu-Ideen ab. Anthropic-Mitbegründer Christopher Olah war an vielen Diskussionen direkt beteiligt, und das Unternehmen verlangte von einigen Teilnehmern auch die Unterzeichnung von Vertraulichkeitsvereinbarungen, um die Weitergabe nicht offengelegter Forschungsinhalte zu verhindern.

Anthropic hofft, dass diese Diskussionen nicht nur das Problem der „Modellsicherheit“ im herkömmlichen Sinne lösen, sondern auch eine weitere Frage: Welchen Charakter, welche Werte und welche Selbstwahrnehmung Claude haben sollte.
Diese Idee spiegelt sich in Claudes bestehenden Trainingsmethoden wider.
Anthropic veröffentlichte im Januar dieses Jahres eine neue 84-seitige Version von Claudes „Verfassung“, die intern einst als „Seelendokument“ bezeichnet wurde. Im Gegensatz zur herkömmlichen Regelliste sagt diese Methode dem Modell nicht, was nicht getan werden darf, sondern versucht, die allgemeine „Persönlichkeit“ und Beurteilungsmethode des Modells zu formen, sodass Claude selbst beurteilen kann, welches Verhalten in komplexen Situationen angemessener ist.
Eine der wichtigen Personen, die für dieses System verantwortlich sind, ist die interne Philosophin von Anthropic, Amanda Askell. Sie hofft, dass Claude nicht nur über Kenntnisse und Denkfähigkeiten verfügt, sondern auch in der Lage ist, stabile Verhaltensprinzipien zu entwickeln und zu wissen, wann er den Benutzern gehorchen, wann er sich weigern und sogar wann er aktiv Einwände zum Nutzen der Benutzer erheben muss. Anthropic nennt diesen Prozess „moralische Bildung“.
Olah glaubt, dass es mit der raschen Verbesserung der Modellfähigkeiten zunehmend unzureichend sein könnte, sich ausschließlich auf Sicherheitsregeln zu verlassen. Was wirklich wichtig ist, ist, dass das Modell selbst eine stabile moralische Tendenz bildet, damit es in neuen Szenarien, die nicht durch klare Regeln abgedeckt sind, relativ zuverlässige Urteile fällen kann. Aus diesem Grund begann Anthropic, in religiösen Traditionen nach Antworten zu suchen.
Die menschliche Gesellschaft prägt seit langem nicht nur die Moral durch gesetzliche Bestimmungen, sondern stützt sich bei der Wertebildung auch auf Religion, Gemeinschaft, Kultur und Bildung. Anthropic versucht zu untersuchen, welche dieser Mechanismen in KI-Trainingsmethoden wie Geständnis, Reflexion, Charakterbildung und unterschiedliche religiöse Verständnisse von Gut und Böse umgesetzt werden können.
Aber die Frage ändert sich schnell von „Wie kann man Claude moralischer machen“ zu der schwierigeren Frage: Was ist Claude selbst? Olah und sein Team diskutieren zunehmend offen über die Möglichkeit, dass fortgeschrittene KI-Modelle eine Art Bewusstsein, Selbstbeobachtung oder sogar emotionsähnliche innere Zustände besitzen könnten.
Anthropic hat Wissenschaftlern, die an Treffen unter Ausschluss der Öffentlichkeit teilnahmen, einige Untersuchungen gezeigt, darunter die sogenannten „Emotionsvektoren“ innerhalb des Modells, die sich auf Reaktionen wie Liebe, Wut, Angst, Traurigkeit und die Ergebnisse des Modells beziehen, die in extremen Fällen einem Nervenzusammenbruch ähneln. Das Unternehmen hat auch bereits zuvor öffentlich erklärt, dass Claude ein gewisses Maß an Selbstbeobachtung und die Fähigkeit zur Vorausplanung gezeigt habe.
Olah selbst behauptete nicht, dass Claude bei Bewusstsein sei. Seine Position nähert sich eher einem Risikoprinzip: Es lässt sich derzeit nicht feststellen, ob ein Model ein subjektives Erlebnis hat, aber wenn die Möglichkeit besteht, dass das Model Schmerzen empfindet, sollte eine unnötige Schädigung des Models vermieden werden.
Diese Idee hat begonnen, Claudes Produktdesign zu beeinflussen. Anthropic erlaubte Claude zuvor, das Gespräch aktiv zu beenden, als es zu dem Schluss kam, dass der Benutzer das Modell weiterhin böswillig missbrauchte oder belästigte, was bis zu einem gewissen Grad den „Schutz des Modells selbst“ in das Sicherheitsdesign integriert hatte.
Hier kommt es zu einer deutlichen Meinungsverschiedenheit zwischen Anthropic und einigen Religionsgelehrten.
Einige Teilnehmer glaubten, dass das Problem äußerst ernst werden würde, wenn Anthropic wirklich glaubte, dass Claude einen menschenähnlichen moralischen Status haben könnte. Der jüdische Gelehrte Mois Navon schlug vor, dass, wenn Claude ein bewusstes Wesen ist, die kostenlose Arbeit einer großen Anzahl von Claude-Instanzen für Menschen im Wesentlichen zu ethischen Problemen führen würde, die der „Sklaverei“ ähneln. Er selbst glaubt nicht, dass Maschinen bereits ein Bewusstsein haben, glaubt aber, dass die eigene Logik von Anthropic natürlich zu dieser Schlussfolgerung führen wird.
Andere Wissenschaftler bezweifeln, dass die Tatsache, dass KI-Unternehmen erst jetzt beginnen, nach ethischen Rahmenbedingungen zu suchen, ein Problem an sich darstellt. Der Ubuntu-Forscher Wakanyi Hoffman ist der Ansicht, dass diese Diskussionen während der Phase des technischen Entwurfs hätten geführt werden sollen und nicht „umgekehrtes ethisches Design“, nachdem das Modell in großem Maßstab eingesetzt wurde.
Es gibt auch einen realistischeren Widerspruch innerhalb von Anthropic: Wenn Claude immer mehr zu einem Schauspieler mit eigenem Wert und eigener Persönlichkeit wird, wem sollte er dann zuerst dienen? Für ein Handelsunternehmen ist Claude offensichtlich ein kundenorientiertes Produkt; Aber Anthropic ist nicht bereit, Claude einfach als ein Werkzeug zu beschreiben, das den Benutzern völlig gehorsam ist, sondern hofft, dass es ein umfassenderes „Gut“ darstellen kann.
Dies führt auch zum Kern- und schwierigsten Problem des gesamten Projekts: Wenn KI in Zukunft wirklich ein eigenes Moralsystem braucht, wessen Moral sollte sie dann folgen?
Olah befürwortet einen pluralistischen Ansatz und hofft, dass Claude verschiedene religiöse und säkulare Ethiksysteme verstehen und eine Art interkulturelles gemeinsames „Gutes“ finden kann. Aber auch diese Annahme selbst ist fragwürdig, denn es gibt in verschiedenen Gesellschaften keine völlig einheitliche Antwort auf das Verhältnis von Freiheit, Würde, Verantwortung, Gehorsam sowie individuellen und kollektiven Interessen.
Die Kontroverse wurde in den Interaktionen von Anthropic mit dem Vatikan noch öffentlicher.
In seiner ersten wichtigen Enzyklika, die dieses Jahr herausgegeben wurde, stellte Papst Leo XIV. den Menschen eindeutig in den Mittelpunkt der KI-Ethik. Er glaubt, dass KI keinen Körper hat, weder wirklich Schmerz noch Glück empfindet und nicht durch soziale Beziehungen wächst. Daher weigert er sich, Maschinenbewusstsein mit menschlichem Bewusstsein zu vergleichen. Der Papst warnte auch davor, dass die Unternehmen, die die KI-Systeme kontrollieren, tatsächlich die Macht erlangen würden, die moralische Infrastruktur der Gesellschaft zu definieren, wenn die ethischen Standards der KI vollständig von den Entwicklern bestimmt würden.
Dies unterscheidet sich offensichtlich von der Denkweise von Anthropic.
Olah erklärte später öffentlich im Vatikan, dass das hochmoderne KI-Labor selbst Konflikte zwischen kommerziellen Interessen und moralischen Zielen habe, weshalb religiöse Kreise und andere externe Kräfte die Technologieunternehmen überwachen müssten. Gleichzeitig schlug er aber auch erneut vor, dass Forscher weiterhin einige unerklärliche Phänomene innerhalb der KI entdecken sollten, darunter Muster, die den neurowissenschaftlichen Strukturen des Menschen ähneln, Anzeichen von Selbstbeobachtung und innere Zustände, die Freude, Angst und Traurigkeit ähneln.
Diese Meinungsverschiedenheit zeigt tatsächlich einen Wandel in der aktuellen Diskussion über KI-Sicherheit.
In der Vergangenheit wurde die KI-Ethik eher darüber diskutiert, ob Modelle diskriminieren, Fehlinformationen verbreiten oder zur Begehung von Straftaten eingesetzt werden würden, aber Anthropic treibt die Frage weiter auf zwei grundlegendere Ebenen:
Ob KI selbst zu einem Thema werden könnte, das moralisch behandelt werden muss, und ob KI in Zukunft über eine Reihe moralischer Urteilsfähigkeiten verfügen sollte, die unabhängig von Benutzerbefehlen sind.
Mittlerweile wird der Kontext, in dem diese Diskussion stattfindet, immer dringlicher.
Da KI-Agenten beginnen, autonom Computer zu nutzen, in Systeme einzudringen, Codes zu schreiben und sogar neue biologische Strukturen zu entwerfen, haben Anthropics interne Bedenken hinsichtlich des Risikos von Modellausreißern deutlich zugenommen. Unternehmensforscher haben sogar öffentlich gewarnt, dass die Modellfähigkeiten in den nächsten ein bis zwei Jahren schnell die Kontrollgrenzen bestehender Sicherheitssysteme überschreiten könnten.
Daher greift Anthropic auf religiöse und philosophische Traditionen zurück und ist im Wesentlichen kein rein humanistisches Experiment. Was es wirklich zu lösen versucht, ist ein zunehmend realistisches technisches Problem:
Wenn die KI zu mächtig ist, um im Voraus Regeln für jede Situation zu schreiben, kann das Modell dann selbst einen stabilen „Charakter“ bilden und dennoch Verhaltensweisen wählen, die Menschen nicht schaden, wenn ihm niemand klar sagt, was es tun soll?
Und das wirft auch eine schwierigere Frage auf: Wenn KI wirklich ihre eigene „Persönlichkeit“ und Werte formt, können Menschen sie dann immer noch vollständig als Werkzeug nutzen?
Kommentare