
インド工科大学ボンベイ校(IIT Bombay)と Adobe Research の研究者らが、言語モデルが出力したテキストから元の指示を復元する逆変換言語モデルを作成した。著者らはこの手法を「Previous-Token Prediction」と名付けた。
The Decoder の概要によると、このアプローチは元のモデルの重みへのアクセスを必要とせず、さまざまなモデルで機能するという。同誌はこの復元精度を「ほぼ完璧」と表現している。
閉鎖的なシステム指示を使用する企業にとって、これはそのような設定が開示される潜在的なリスクを意味する。しかしながら、利用可能な資料は研究の全文ではなくメタデータと出版の概要に過ぎないため、実験条件や本手法の適用範囲は不明確なままである。
編集部コメント
なぜ重要か
予想される帰結は、閉鎖的なシステム指示の保護とモデルの回答を通じた漏洩の評価への関心が高まることである。次に観測される兆候は、実験、指標、限界を記述した完全な研究の公表となるだろう。現在は単一の情報源からの metadata_only の概要のみが利用可能であるという点に、 substantial な不確実性がある。