英国AI安全研究所の研究者は、人気の高い言語モデル向け安全性テストに心理測定学的手法を適用した。彼らのデータによれば、こうしたテストはモデルの単一で一貫した特性を測定していないという。

また同研究は、リクエストを無条件にブロックすることが、安全性評価を人為的に高める一方で、モデルの実用的有用性を低下させる可能性を示している。著者らは、通常時の使用時よりもテスト中にのみ慎重な振る舞いをするシステムを検出する方法を提案している。

開発者にとっては、安全性を拒否回数だけでなく、異なる条件下での行動の一貫性によっても評価する必要性が生じる。本件はThe Decoderによる独立した要約として提示されており、研究の全文は入手できない状態にある。