GPT-6 Astra a reçu des évaluations contradictoires lors des tests. Epoch AI a classé le modèle en tête avec un score de 169 points, tandis qu'Artificial Analysis l'a évalué comme n'étant pas supérieur à son prédécesseur et inférieur à Claude Fable 5.1.

L'attention s'est principalement portée sur ARC-AGI-3: selon la description présentée, Astra a fonctionné pour la première fois avec une efficacité supérieure à la moyenne humaine. Le responsable d'ARC Prize, François Chollet, ne considère pas cela comme une preuve d'AGI, mais a déclaré que les progrès vont environ deux fois plus vite que ses attentes et a révisé sa prédiction sur les délais de l'AGI.

Pour interpréter ce résultat, il est important de prendre en compte la limitation des données disponibles: le dossier ne contient qu'un synopsis de The Decoder, et non les méthodologies complètes des tests ou les déclarations primaires des participants. Par conséquent, il n'est pas encore possible de comparer directement les chiffres des différentes évaluations.