Google DeepMind は、世界初とされる AI 評価のダブルブラインド評価のパイロットを公表しました。説明は、暗号的に保護された環境でクローズドモデルの評価基準を検証することに関連しています。

入手可能な説明によれば、この取り組みの目的はそのような比較テストへの信頼を高めることです。設計、参加者、結果の詳細は提出された情報源には明らかにされていません。

このプロジェクトの実践的な意味は、評価がどれだけ独立して行われるか、提案されたプロセスが外部の参加者にとってモデル比較を検証可能にするかに依存します。現時点ではデータ公開の今後の発表を待つ状況です。