
OpenAI の GPT-6 Astra は、未解決の数学問題に関するテストである ErdosBench で首位を獲得した。一方で、同社の最高科学責任者ヤクブ・パチョツキ氏は、数学が開発の優先事項ではなかったと述べている。
提示された説明によると、OpenAI はリソースを再帰的な自己改善と AI アライメントの研究に向けている。また、同社は Astra を、高度な推論、コンピュータ操作、文章作成、およびデザイン評価において最も強力な OpenAI モデルであると位置づけている。
これは、開発で謳われている優先事項と、特定の分野におけるモデルの最終的な強さとの間に乖離があることを示しているため重要である。ただし、利用可能な資料はメタデータの概要形式であり、テストの詳細、他モデルとの比較、あるいは結果の理由についての詳細は提供されていない。
編集部コメント
なぜ重要か
考えられる帰結として、特定分野で期待を上回る性能を発揮する不均一な能力を持つモデルへの関心が高まる可能性がある。次に観察される兆候は、テストの詳細や結果の独立した検証の出現となるだろう。重要な不確実性として、パッケージには情報源の全文や ErdosBench の手法が含まれていない点が挙げられる。