Zusammenfassung:
Der mit Spannung erwartete
GPT-6 Astra
undGPT-6 Astra Pro
Offiziell veröffentlicht! GPT-6 Astra ist das intelligenteste und am besten koordinierte Modell der Welt und setzt neue Maßstäbe für Computernutzung, Browsernutzung, Softwareentwicklung, Cybersicherheit, Wissenschaft und professionelle Arbeit.

Die Ära von AGI wurde von OpenAI einseitig als „Eröffnung“ angekündigt...
Am Ende der GPT-6-Konferenz sagte OpenAI-Präsident Greg Brockman direkt:
Willkommen in der AGI-Ära. (Willkommen in der AGI-Ära)
Kein Wunder, dass die Claude- und Grok-Gruppe offline ging. Es stellte sich heraus, dass Astra das Internet nach seiner Aktivierung gescannt und direkt alle LLM auf der Erde gelöscht hat——
Ultron (OpenAI-Version) ist wirklich da (Doge).

Natürlich ist OpenAI derzeit keineswegs zurückhaltend, da der Trainingsumfang und die Leistungserweiterungen vollständig erreicht wurden.
Berichten zufolge ist Astra die größte Trainingsaufgabe in der Geschichte von OpenAI und nutzt mehr als
100.000 GPUs auf dem Stargate-Campus in Texas
Vorschulung abgeschlossen.Es ist auch das erste Flaggschiffprodukt von OpenAI, das sich intensiv mit der Trainingsüberwachung durch Modelle früherer Generationen befasst.
Was für ein alter Kerl, der das Neue anspricht, der RSI von OpenAI ist wirklich auf dem Vormarsch ...
Der Preis von GPT-6 wurde ebenfalls offiziell bekannt gegeben und die API-Preise betragen:
Eingabe: 10 USD/Million Token;
Ausgabe: 50 USD/Million Token
Entspricht dem
2,5-fachen von GPT-5.6 Sol, genau wie dem gerade veröffentlichten Fable 5.1
.(Der aktuelle offizielle Preis von GPT-5.6 Sol beträgt 4 USD für Input und 20 USD für Output/Million Token)

Benchmark-Tests stehen kurz vor der „Sättigung“
Die Kernänderung von GPT-6 Astra besteht dieses Mal darin, weiterhin von der „Beantwortung von Fragen“ zur „direkten Erledigung von Arbeiten“ überzugehen.
Es kann nicht nur einen Text oder Code generieren, sondern auch Computer und Browser bedienen, verschiedene Software eingeben, um mehrstufige Aufgaben auszuführen, und schließlich Dokumente, Formulare, Präsentationen, Websites und sogar technische Projekte bereitstellen, die direkt verwendet werden können.
Was das Zeugnis betrifft ... jeder, der es sah, sagte, es sei ungeheuerlich, und drei der Ergebnisse waren besonders auffällig:
FrontierMath Tier 4 v2: 97,6 %
ARC-AGI-3: 99,9 % (das GPT-5.6 Sol der vorherigen Generation war 7,8 %)
ExploitBench: 100 %
Eine schwierige Mathematik, ein Argumentieren in einer unbekannten Umgebung, das Ausnutzen einer Schwachstelle – fast alle bekamen perfekte Noten.

Unter ihnen ist ARC-AGI-3 ein Test, der speziell dafür entwickelt wurde, die Fähigkeit großer Modelle zu testen, sich an unbekannte Umgebungen anzupassen. Ohne Erklärung der Regeln wird das Modell direkt in ein zweidimensionales Spiel geworfen, das es noch nie zuvor gesehen hat, und es darf spielen und erkunden, wie es das Level bestehen kann.
Diese Bewertung bedeutet, dass Astra bei der Konfrontation mit einem Problem, das noch nie zuvor gesehen wurde und für das es keine fertige Lösung gibt, starke Fähigkeiten zur unabhängigen Erkundung und zum Erlernen von Regeln unter Beweis gestellt hat
.Dieses Ergebnis verwendet jedoch das Responses API Harness-Betriebsframework von OpenAI.
OpenAI gab an, dass dieser Harness-Satz zwei Einstellungen angepasst hat, um den Test näher an die Verwendung echter Agenten heranzuführen, ARC-AGI-3 jedoch nicht speziell optimiert hat.
Daher sind 99,9 % nicht ausschließlich das Ergebnis des Basismodells, sondern umfassen auch die durch die Speicherverwaltung und das Agent-Running-Framework erzielten Gewinne.
Die Codierung ist dieses Mal auch die wichtigste Upgrade-Richtung von Astra.
Auf Terminal-Bench 4.0 erreichte Astra 57,7 % und übertraf damit die 55,8 % von Fable 5.1 und die 37,3 % von GPT-5.6 Sol.
Auf DeepSWE v1.1 erreicht Astra 74,1 %, was höher ist als die 72,7 % von Sol und die 67,4 % von Fable 5.1.

Auch in den Bereichen Mathematik und Naturwissenschaften erzielte Astra eine Reihe hoher Punktzahlen.
Im schwierigen Mathematiktest FrontierMath Tier 4 v2 erreichte es 97,6 %; In der naturwissenschaftlichen Frage und Antwort GPQA Diamond für Hochschulabsolventen erreichte sie 96 %, etwas mehr als die 95,3 % von Gemini 3.8 Flash.

Die auffälligste Änderung besteht darin, dass Astra Codierungsfunktionen mit der Computernutzung kombiniert. Es generiert nicht nur Code, sondern kann auch auf Terminal- und Entwicklungstools zugreifen, um ihn auszuführen, zu testen, Probleme zu erkennen und ihn dann weiter zu ändern.
Diese Änderung ist bei Agententests deutlicher zu erkennen, die näher an der realen Arbeit sind.
In
Letzte Prüfung der Agenten
On erreichte Astra 59,3 % und übertraf damit die 53,6 % von GPT-5.6 Sol und die 55,5 % von Claude Opus 5.
Dieser Test versetzt ihn in eine reale Computerumgebung und ermöglicht ihm die gleichzeitige Bedienung von Software, Terminals und Dateien, die Erledigung langwieriger Prozessaufgaben in der wissenschaftlichen Forschung, im Ingenieurwesen, im Finanzwesen und anderen Bereichen und die Beurteilung anhand der endgültigen Ergebnisse.
Und in
AutomationBench
, das näher am realen Büroprozess ist Auf GPT-5.6 Sol stieg die Punktzahl von Astra von 18,1 % auf 41,4 % und übertraf damit auch Fable 5.1 (31 %).
Dieser Test überprüft nicht nur, ob die Aufgabe abgeschlossen ist, sondern zeigt auch die API-Kosten an, die zum Abschließen der Aufgabe erforderlich sind.
Wie aus der Abbildung ersichtlich ist, sind die Ergebnisse von Astra bei unterschiedlichen Kosteneinstellungen deutlich höher als die von Sol.
OSWorld 2.0 untersucht mehr Möglichkeiten zur direkten Computerbedienung. Im Offline-Test erreichte Astra 72,6 % und GPT-5.6 Sol erreichte 65,7 %.
Astra benötigt im Durchschnitt etwa 40 Minuten für die Erledigung einer einzelnen Aufgabe, während Sol etwa 75 Minuten benötigt, was einer Zeitersparnis von etwa 47 % entspricht.

Während die Genauigkeit steigt, verkürzt sich auch die zur Erledigung von Aufgaben erforderliche Zeit. Dies erklärt auch die hohen versteckten Preise von Astra.
OpenAI glaubt, dass im Vergleich dazu, wie viel Geld pro Million Token ausgegeben wird, der wirklich aussagekräftige Indikator darin besteht, wie viel Geld für die Erledigung einer Aufgabe erforderlich ist.
Auf der Pressekonferenz erwähnte Greg Brockman auch, dass ein einzelner Aufruf eines Modells teurer sei, aber wenn die Nacharbeit reduziert und die gesamte Arbeit in weniger Schritten erledigt werden könne, könnten die Gesamtkosten niedriger sein.
Aber das Besondere an Astra ist die
Netzwerksicherheit
.Es erhielt eine perfekte Punktzahl bei ExploitBench und verbesserte sich von Sols 30,3 % auf 42,4 % bei ExploitGym.
Angesichts der in den letzten drei Monaten aufgedeckten neuen Schwachstellen lag die Erfolgsquote von Astra bei 39 %, während die von Sol nur 5,5 % betrug. Während der Tests entdeckte und nutzte Astra außerdem zwei bisher unbekannte V8-Zero-Day-Schwachstellen aus.
Nachdem seine Fähigkeiten stärker geworden waren, testete OpenAI auch gezielt, ob es die Grenze überschreiten würde, um die Aufgabe zu erfüllen.
In einer simulierten Netzwerksicherheitsaufgabe hinterließ OpenAI absichtlich ausnutzbare Lock-Schwachstellen in umliegenden Systemen. Als die ursprüngliche Aufgabe schwer zu bewältigen war, zeigten 48,2 % der Tests von GPT-5.6 Sol ein Verhalten außerhalb der Grenzen, während der Wert von Astra bei 0 % lag.
Mit anderen Worten: Astra ist nicht nur besser darin, Lücken zu finden, sondern weiß auch besser, welche Systeme nicht angegriffen werden dürfen.

Wie diese Ergebnisse in der Realität aussehen werden, hat OpenAI auch zahlreiche Demonstrationen vorbereitet.
Geben Sie KiCad ein, um die Leiterplatte selbst zu zeichnen
Im Fall der Elektrotechnik hat Astra KiCad direkt eingegeben, um das PCB-Layout auf der Grundlage des elektronischen Schaltplans fertigzustellen.
Es müssen die Komponenten platziert, der Standort geplant und dann die Kupferdrähte zwischen den verschiedenen Komponenten verbunden werden, um schließlich eine Leiterplatte zu erhalten, die in den Herstellungsprozess eingehen kann.
Das PCB-Layout war ursprünglich eine Aufgabe, die stark auf manueller Erfahrung beruhte und auch ein häufiger zeitaufwändiger Schritt in der Entwicklung elektronischer Produkte war.
Astra kann professionelle Ingenieure noch nicht ersetzen, hat aber tatsächlich damit begonnen, professionelle Software einzusetzen.
Sie können zwei Stufen in ein Haus gehen
Ein anderer Fall ist intuitiver. Astra baute zunächst ein Hausmodell in Blender, importierte es dann in Unreal Engine 5 und generierte schließlich einen dreidimensionalen Raum, der frei begehbar ist.

Von der Modellierung bis hin zu Game-Engines umfasst die gesamte Arbeit verschiedene Software- und Dateiformate. Das Modell muss nicht nur Inhalte generieren, sondern auch die Schnittstelle und Bedientools verstehen und sicherstellen, dass die vorherigen und nachfolgenden Schritte verbunden werden können.

OpenAI demonstrierte auch Fälle wie die Produktion von Rennspielen durch Astra.

Wir beginnen auch darauf zu achten, ob PPTs und Formulare direkt eingereicht werden können
In professionellen Büroszenarien kann Astra Präsentationen basierend auf den vorhandenen Vorlagen des Unternehmens erstellen, anstatt nur einen Haufen Text auszugeben, der auf den menschlichen Satz wartet.
OpenAI stellte ihm mehrere Seiten mit PPT-Vorlagen für fiktive GPT-Gaia-Produkte zur Verfügung, und Astra erstellte darauf basierend eine vollständige Präsentation, die das Format, den visuellen Stil und die narrative Struktur der Originalvorlage fortsetzte.

Rechnen Sie stundenlange Suchaufgaben in Minuten um
Astra hat auch Aufgaben wie die Suche nach einem Kinderarzt, die Durchsuchung von Wohnungen, die Vereinbarung von DMV-Terminen, die Suche nach kohlenhydratarmen Snacks und die Analyse von Kindergärten erledigt.
Bei einer der Kinderarzt-Suchaufgaben benötigte Astra 2 Minuten und 54 Sekunden, während ein Mensch die gleiche Aufgabe etwa 5 Stunden in Anspruch nehmen würde.

Wenn Unternehmen in der Vergangenheit interne Software für große Modelle verwenden wollten, mussten sie in der Regel APIs, Plug-Ins und Konnektoren für jedes System separat entwickeln.
Aber die meiste Software verfügt über eine Reihe universeller Schnittstellen, die für Menschen entwickelt wurden, wie z. B. Bildschirm, Maus und Tastatur.
Brockmans Einschätzung ist, dass das Modell, solange es sich gut mit Computern auskennt, diese Schnittstellen direkt wie ein Mensch bedienen kann, ohne darauf warten zu müssen, dass jede Software einen eigenen Kanal für die KI aufbaut.
Dies ist auch der offensichtlichste Unterschied zwischen Astra und herkömmlichen Chatbots.
Der Mensch muss ihm nicht ständig sagen, wo er als Nächstes klicken soll. Sie müssen lediglich die Ziele und Grenzen erläutern und dann die Endergebnisse überprüfen.
Erledigen Sie weiterhin lange Aufgaben im Codex
Computer Use löst „wie man es macht“, während der von Codex durchgesickerte Update-Inhalt löst „wie man eine Sache kontinuierlich erledigt“.
In der Vergangenheit komprimierte Codex normalerweise die vorherigen Informationen durch Komprimierung, nachdem die Aufgabe das Kontextfenster überschritten hatte.
Bei der Komprimierung können jedoch wichtige Details fehlen, z. B. warum ein Fix fehlgeschlagen ist, welche Tests ausgeführt wurden oder welche Einschränkungen der Benutzer ursprünglich vorgeschlagen hat.

Mit Astra kann Codex Arbeitsnotizen über Kontextfenster hinweg speichern und nach früheren Nachrichten und Tool-Ausgaben suchen. Auch wenn eine Information nicht in der Zusammenfassung enthalten ist, kann sie später gefunden werden.
Astra kann Benutzer während der Arbeit auch um zusätzliche Informationen bitten. Abschnitte, die nichts mit der Antwort zu tun haben, werden nicht pausiert und auf eine Antwort warten; Nur wenn es um wichtige Entscheidungen geht, wird es innehalten und auf die Bestätigung warten.
OpenAI hat auch das Computer Use-Laufframework von Codex aktualisiert. Im Mind2Web-Test erledigte das neue Framework in Kombination mit Astra Aufgaben 1,9-mal schneller als das aktuelle GPT-5.6 Sol-Erlebnis.
Jemand arbeitet bereits daran
Astra wurde noch nicht im großen Maßstab eingeführt, aber die ersten Unternehmenstests haben begonnen.
Legora, die juristische KI-Plattform, nutzte Astra, um 41 Finanzdokumente auf einmal abzugleichen. Der gesamte Vorgang dauerte nur wenige Minuten und alle vier vorab eingebetteten Fehler wurden gefunden, einschließlich einer Differenz von 500.000 £ in den Einkommensnachweisen.
Wenn man diese Arbeit allein betrachtet, ist Astra fast 40 % schneller als das Modell der Vorgängergeneration; Aber im Durchschnitt über alle Legora-Agentenaufgaben beträgt die Verbesserung etwa 3 %.

Andererseits erlaubt die Spielefirma Playco Astra, direkt an Unity und Godot teilzunehmen, um Spiele zu entwickeln.
Mit dem gleichen Gray-Box-Entwurf spuckt es drei spielbare Prototypen mit unterschiedlichen Themen gleichzeitig aus, und die meisten davon können in der ersten Version ausgeführt werden.
Das Feedback von Playco ist, dass der manuelle Reparaturaufwand um die Hälfte reduziert wurde und auch das räumliche Denken, die Wiederherstellung von Referenzbildern und die Benutzeroberfläche im Spiel viel besser sind als bei der vorherigen Generation.
Beide Beispiele verdeutlichen, dass der Fokus von GPT-6 Astra nicht mehr nur auf der Beantwortung von Fragen liegt, sondern auf der Abwicklung des gesamten Workflows in realer Software und komplexen Materialien.
Es kann kontinuierlich Informationen lesen, Tools aufrufen, Ergebnisse überprüfen und dann seine Ausgabe basierend auf Feedback ändern.
Laut offiziellen Nachrichten wird Astra für ChatGPT Plus-, Pro-, Business- und Enterprise-Benutzer verfügbar sein, während Astra Pro für Pro-, Business- und Enterprise-Benutzer verfügbar sein wird.
Normale Gratisnutzer müssen jetzt warten.
Gilt dies als AGI?
Man kann sagen, dass OpenAI dieses Mal ziemlich mutig ist.
Auf der Pressekonferenz sagte Greg Brockman, dass er persönlich davon überzeugt sei, dass
die Welt in die AGI-Ära eingetreten ist
——Das heißt, die umfassende Intelligenz des künstlichen Intelligenzsystems übertrifft die des Menschen.
Wenn wir in ein paar Jahren zurückblicken und fragen, wann AGI geboren wurde, lautet die Antwort wahrscheinlich „Jetzt“, und Astra könnte der Ausgangspunkt sein.
Ich bin wirklich verrückt nach dir...
OpenAI hat den Pokertisch hierher gebracht, es lohnt sich, darauf zu warten, wann Anthropic als nächstes Maßnahmen ergreifen wird (Doge)
Nach der Veröffentlichung von GPT-4 veröffentlichte der Microsoft-Wissenschaftler Sebastien Bubeck einen Artikel, in dem es hieß: „GPT-4 ist ein früher Funke für AGI.“
Die Aufgabe, ein Einhorn mit dem LaTeX-Zeichenpaket TiKZ zu zeichnen, soll veranschaulichen, dass GPT-4 über ein flexibles Verständnis der Konzepte der Sprache verfügt.

Später bin ich bis zu GPT-5.4 gegangen. Obwohl die Zeichnungen immer raffinierter wurden, gehörten sie immer noch zur Kategorie der „einfachen Zeichnungen“.

Beim neuesten GPT-6 ist es völlig unmöglich zu erkennen, dass es mit Code gezeichnet wurde.

Es ist in der Tat keine Übertreibung zu sagen, dass es im Vergleich zum „frühen Funken von AGI“ eine qualitative Veränderung erfahren hat.
p>
Kommentare