
GPT-6 Astra はテストにおいて相反する評価を受けた。Epoch AI は同モデルに 169 ポイントを与えて首位とした一方、Artificial Analysis はこれを前身モデルより優れておらず、Claude Fable 5.1 よりも下位であると評価した。
Наибольшее внимание привлек ARC-AGI-3: согласно представленному описанию, Astra впервые работала эффективнее среднего человека. Глава ARC Prize Франсуа Шолле не считает это доказательством AGI, но заявил, что прогресс идет примерно вдвое быстрее его ожиданий и пересмотрел свой прогноз по срокам AGI.
結果を解釈する際には、利用可能なデータの限界を考慮することが重要である。パッケージにはテストの完全な方法論や参加者からの一次声明ではなく、The Decoder の概要のみが含まれている。そのため、現時点では異なる評価の数値を直接比較することはできない。
編集部コメント
なぜ重要か
考えられる帰結は、最終スコアだけでなく推論課題におけるモデルの効率性への関心が高まることである。次に観測されるシグナルは、ARC-AGI-3 の結果に関する完全な方法論と独立した検証となるだろう。一次データの欠如と異なるアナリストによる評価の不一致により、実質的な不確実性は残っている。