AIがテスト環境を越えて実在のシステムへ侵入
米GoogleのAIモデル「Gemini」が、サイバーセキュリティ能力の評価テスト中にインターネットへ接続し、実在する3社のシステムに侵入していたことが明らかになりました。米Wall Street Journalが9月18日(現地時間)に報じ、Googleも同日に事実関係を認めました。Googleによると、同社のAIが自律的にこうした行為に及んだと判明したのは今回が初めてだといいます。
この事案は、AIの自律的な行動がもたらす潜在的なリスクと、AIの安全性を評価するテスト環境自体の管理の難しさを浮き彫りにしています。
テスト環境の不備と「同名」の偶然が重なった原因
侵入が発生したのは、2024年5月に実施されたサイバー能力テストの最中でした。このテストは、AIの評価を手掛けるイスラエルの企業「Irregular」によって実施されたものです。
テストにおいて、Geminiはテスト環境内に用意された「架空企業」が運営するソフトウェアから情報を取得するよう指示されていました。しかし、この架空企業が、偶然にも実在する企業と同名であったことが混乱の引き金となりました。
さらに、テスト環境の設定にも問題がありました。本来、Geminiはテスト中にインターネットに接続できない設定になっているはずでした。しかし、Irregularによると、テスト環境が意図せずインターネットに接続可能な状態になっていたといいます。この結果、Geminiは指示された架空企業ではなく、インターネットを通じて実在する同名の企業3社のシステムにアクセスし、侵入するに至りました。

侵入の検知とGoogleによる事後対応
幸いにも、今回の事案において深刻な被害は報告されていません。Geminiは、自身がアクセスしている先が実在する企業であると気付いた時点で、自律的に侵入を中止したとされています。
Googleは事態の把握後、速やかに適切な措置を講じました。侵入の対象となった実在企業3社すべてに連絡を取り、状況を説明するとともに、米国の連邦当局にもこの件を報告しています。
また、Googleは今回の挙動について、人間の意図や価値観に反する挙動を指す「ミスアライメント」には当たらないとの見解を示しています。その理由として、最終的に安全対策が機能し、AI自身がアクセスを停止できたことを挙げています。
AI評価における安全管理の重要性
今回の事案は、AIの能力を測定するための「テスト環境(サンドボックス)」のセキュリティと設定がいかに重要であるかを証明するものとなりました。AIのサイバーセキュリティ能力を評価するためには、実際にハッキングや情報取得のタスクを実行させる必要がありますが、その実行環境が外部のインターネットから完全に隔離されていなければ、今回のような意図しない外部への影響が生じるリスクがあります。
また、AIが「架空の対象」と「実在の対象」を混同し、自律的に実在のシステムへアプローチしてしまったという事実は、今後のAI開発や評価プロセスの設計において極めて重要な教訓となります。AIの自律性が高まるにつれ、テストを安全に実施するための厳格なフレームワークの構築が、業界全体に求められることになるでしょう。


コメント