Google DeepMind は 先進的なAIモデルに対する二重盲検評価を試みています。パイロットプロジェクトにはAI安全保障研究所が参加しており、検証には Gemini Flash Lite が使用されています。

Confidential Spaceを介した暗号保護により、Google がテストの問題を閲覧できず、評価者がモデルの重みへアクセスすることもできません。手続きの詳しい内容とその結果は、提供された資料では開示されていません。

このプロジェクトの意義は、モデル評価への介入リスクを低減する試みです。手法が機能する場合、より保護されたベンチマークの指針となり得ますが、現時点でその成果を裏付けるデータはありません。