
EleutherAI опубликовала ретроспективу проекта Aletheia's Quest. В ней команда описывает опыт создания детекторов обмана ИИ двух типов: «чёрного ящика» и «белого ящика».
この発表は、モデル自体の能力から、その行動を検証する方法へと焦点を移す点で重要である。しかし、入手可能な記述には、試験の結果、検出器の精度、あるいは検出された具体的なシステムに関する情報は含まれていない。
プロジェクトの実用的価値を評価するには、回顧録の全文、実験手法、そして検出器が様々な条件下でどれほど堅牢であったかに関するデータが必要である。
編集部コメント
なぜ重要か
本プロジェクトのおそらく重要な点は AI の行動検証手法の発展にあるが、その有効性について結論を下すのは時期尚早である。次に観測される兆候は、実験、指標、および異なるモデルでの検証に関する完全な記述の公表となるであろう。現在は情報源の簡潔な要約のみが入手可能であるという点に、 substantial な不確実性が残っている。