
GPT-6 Astra recibió evaluaciones contradictorias en las pruebas. Epoch AI colocó a la modelo al frente con un resultado de 169 puntos, mientras que Artificial Analysis la evaluó no mejor que su predecesor y por debajo de Claude Fable 5.1.
Lo más destacado fue ARC-AGI-3: según la descripción presentada, Astra por primera vez funcionó por encima de la media humana. El jefe de ARC Prize, François Chollet, no considera esto una prueba de AGI, pero afirmó que el progreso va aproximadamente el doble de rápido de lo esperado y revisó su pronóstico de AGI.
Para interpretar el resultado es importante tener en cuenta la limitación de datos disponibles: el paquete contiene solo un resumen de The Decoder, y no metodologías completas de prueba ni declaraciones primarias de los participantes. Por lo tanto, comparar directamente las cifras de distintas evaluaciones aún no es posible.
comentario editorial
Por qué importa
Es probable que esto aumente la atención a la eficiencia de los modelos en tareas de razonamiento, y no solo a sus puntuaciones finales. La próxima señal observable serán las metodologías completas y verificaciones independientes de los resultados ARC-AGI-3. La incertidumbre sustancial se mantiene debido a la ausencia de datos primarios y a las discrepancias entre analistas.