
GPT-6 Astra a reçu des évaluations contradictoires lors des tests. Epoch AI a classé le modèle en tête avec un score de 169 points, tandis qu'Artificial Analysis l'a évalué comme n'étant pas supérieur à son prédécesseur et inférieur à Claude Fable 5.1.
L'attention s'est principalement portée sur ARC-AGI-3: selon la description présentée, Astra a fonctionné pour la première fois avec une efficacité supérieure à la moyenne humaine. Le responsable d'ARC Prize, François Chollet, ne considère pas cela comme une preuve d'AGI, mais a déclaré que les progrès vont environ deux fois plus vite que ses attentes et a révisé sa prédiction sur les délais de l'AGI.
Pour interpréter ce résultat, il est important de prendre en compte la limitation des données disponibles: le dossier ne contient qu'un synopsis de The Decoder, et non les méthodologies complètes des tests ou les déclarations primaires des participants. Par conséquent, il n'est pas encore possible de comparer directement les chiffres des différentes évaluations.
commentaire éditorial
Pourquoi c’est important
La conséquence probable est une attention accrue portée à l'efficacité des modèles sur les tâches de raisonnement, et non seulement à leurs scores finaux. Le prochain signal observable sera les méthodologies complètes et les vérifications indépendantes des résultats d'ARC-AGI-3. Une incertitude substantielle persiste en raison de l'absence de données primaires et de la divergence des évaluations de différents analystes.