O GPT-6 Astra recebeu avaliações contraditórias nos testes. A Epoch AI colocou o modelo à frente com uma pontuação de 169, enquanto a Artificial Analysis o avaliou como não superior ao seu predecessor e abaixo do Claude Fable 5.1.

O maior destaque foi o ARC-AGI-3: segundo a descrição apresentada, o Astra operou pela primeira vez com eficiência superior à média humana. O chefe do ARC Prize, François Chollet, não considera isso uma prova de AGI, mas afirmou que o progresso está ocorrendo aproximadamente duas vezes mais rápido do que suas expectativas e revisou sua previsão de prazos para a AGI.

Para interpretar o resultado, é crucial considerar a limitação dos dados disponíveis: o pacote contém apenas um resumo do The Decoder, e não as metodologias completas dos testes ou declarações primárias dos participantes. Portanto, comparar diretamente os números das diferentes avaliações ainda não é possível.