
研究チームは今月開催された国際機械学習会議(ICML)で論文を発表した。この論文では、大規模言語モデルをハッキングから完全に保護することは不可能であると主張されている。
文書の著者らは、この問題をそうしたシステムの動作原理における根本的な欠陥に結びつけている。彼らの見解によれば、モデルのアーキテクチャそのものが、潜在的な攻撃に対して修復不可能な隙を生み出しているという。
本記事は、主要な専門行事向けに発表された報告書の結論に基づいている。MIT Technology Review は、これらの声明を人工知能業界に対する深刻な挑戦として報じている。
編集部コメント
なぜ重要か
最も可能性の高い帰結は、AI 開発におけるパラダイムシフトであり、理想的な防御の追求から、部分的な侵害があっても機能しうるシステムの構築へと移行することになる。次に観測される兆候は、この報告書に対する大手テクノロジー企業の反応と、セキュリティロードマップにおける潜在的な変更となるだろう。特定された欠陥がさまざまなタイプのモデルアーキテクチャにどの程度広く適用可能かについては、実質的な不確実性が残っている。