
O GPT-6 Astra recebeu avaliações contraditórias nos testes. A Epoch AI colocou o modelo à frente com uma pontuação de 169, enquanto a Artificial Analysis o avaliou como não superior ao seu predecessor e abaixo do Claude Fable 5.1.
O maior destaque foi o ARC-AGI-3: segundo a descrição apresentada, o Astra operou pela primeira vez com eficiência superior à média humana. O chefe do ARC Prize, François Chollet, não considera isso uma prova de AGI, mas afirmou que o progresso está ocorrendo aproximadamente duas vezes mais rápido do que suas expectativas e revisou sua previsão de prazos para a AGI.
Para interpretar o resultado, é crucial considerar a limitação dos dados disponíveis: o pacote contém apenas um resumo do The Decoder, e não as metodologias completas dos testes ou declarações primárias dos participantes. Portanto, comparar diretamente os números das diferentes avaliações ainda não é possível.
comentário editorial
Por que importa
A consequência provável é o aumento da atenção à eficiência dos modelos em tarefas de raciocínio, e não apenas às suas pontuações finais. O próximo sinal observável serão as metodologias completas e verificações independentes dos resultados do ARC-AGI-3. Incerteza substancial permanece devido à falta de dados primários e à divergência nas avaliações de diferentes analistas.