GPT-6 Astra recibió evaluaciones contradictorias en las pruebas. Epoch AI colocó a la modelo al frente con un resultado de 169 puntos, mientras que Artificial Analysis la evaluó no mejor que su predecesor y por debajo de Claude Fable 5.1.

Lo más destacado fue ARC-AGI-3: según la descripción presentada, Astra por primera vez funcionó por encima de la media humana. El jefe de ARC Prize, François Chollet, no considera esto una prueba de AGI, pero afirmó que el progreso va aproximadamente el doble de rápido de lo esperado y revisó su pronóstico de AGI.

Para interpretar el resultado es importante tener en cuenta la limitación de datos disponibles: el paquete contiene solo un resumen de The Decoder, y no metodologías completas de prueba ni declaraciones primarias de los participantes. Por lo tanto, comparar directamente las cifras de distintas evaluaciones aún no es posible.