GPT-6 Astra erhielt in Tests widersprüchliche Bewertungen. Epoch AI stufte das Modell mit einem Ergebnis von 169 Punkten als führend ein, während Artificial Analysis es nicht besser als den Vorgänger und schlechter als Claude Fable 5.1 bewertete.

Die größte Aufmerksamkeit galt ARC-AGI-3: Der vorgelegten Beschreibung zufolge arbeitete Astra erstmals effizienter als der menschliche Durchschnitt. François Chollet, Leiter des ARC Prize, betrachtet dies nicht als Beweis für AGI, stated jedoch, dass der Fortschritt etwa doppelt so schnell voranschreitet wie erwartet, und revidierte daraufhin seine Prognose zum Zeitpunkt der AGI-Einführung.

Für die Interpretation des Ergebnisses ist die Begrenztheit der verfügbaren Daten entscheidend: Das Paket enthält lediglich eine Zusammenfassung von The Decoder, jedoch keine vollständigen Testmethoden oder primären Aussagen der Beteiligten. Daher können die Zahlen verschiedener Bewertungen derzeit nicht direkt miteinander verglichen werden.