OpenAI が実施した新しい調査により、人気のあるコード評価ツール SWE-Bench Pro に問題があることが明らかになりました。これにより、人工知能モデルのテストにおける同ツールの信頼性と精度に関して疑問が生じています。

分析結果は SWE-Bench Pro の学術および産業用途での利用に影響を与える可能性があります。というのも、その欠陥は AI モデルのパフォーマンス評価の不正確さを招く恐れがあるからです。