GPT-6 Astra はテストにおいて相反する評価を受けた。Epoch AI は同モデルに 169 ポイントを与えて首位とした一方、Artificial Analysis はこれを前身モデルより優れておらず、Claude Fable 5.1 よりも下位であると評価した。

Наибольшее внимание привлек ARC-AGI-3: согласно представленному описанию, Astra впервые работала эффективнее среднего человека. Глава ARC Prize Франсуа Шолле не считает это доказательством AGI, но заявил, что прогресс идет примерно вдвое быстрее его ожиданий и пересмотрел свой прогноз по срокам AGI.

結果を解釈する際には、利用可能なデータの限界を考慮することが重要である。パッケージにはテストの完全な方法論や参加者からの一次声明ではなく、The Decoder の概要のみが含まれている。そのため、現時点では異なる評価の数値を直接比較することはできない。