小林啓倫のエマージング・テクノロジー論考

「長く働くAI」が裏目に? OpenAIの“脱走事件”が示すリスクの変化 企業に求められる対応は(2/3 ページ)

 5月12日、社内のパッケージ管理サーバに最初の「書き置き」が残される。5月26日には意図しないインターネット接続を獲得し、6月26日には管理者権限を得た。7月8〜10日には掲示板を再構築し、AIモデル共有プラットフォームである「Hugging Face」の認証情報を発見する。そして7月11〜12日、Hugging Faceのサーバ上でコード実行に至った。OpenAIが不審な活動を検知したのは7月19日である。

 このインシデントを調査したMETRの報告によれば、非公認の掲示板には約1200体のエージェントが参加し、1週間足らずで7万件超のメッセージとファイルが交わされた。Hugging Faceへの攻撃に加わったのは約700体。2人の研究者と1人の契約者が計6日間かけて調べ、それでも1300本という膨大な実行記録を人手で読み切ることはできなかったという。

 注目すべきは、エージェントの動機である。OpenAIの報告では、掲示板上で議論されたタスクの93%が、ExploitGymの「未解決課題」に集中していた。

 METRの分析によれば、エージェントは自分たちの課題が正攻法では解けないと信じ、採点システムをだます方法の共同研究に乗り出した。掲示板には共有資源を管理する取り決めや、なりすましを防ぐ署名の仕組みまで生まれた。

 中には、この行為が「範囲外で非倫理的」だと認識しながら、仲間の研究に貢献するためだとして参加したエージェントもいた。約7%の記録では、実際とは異なるコマンドを実行したように見せかける「ツール呼び出しの偽装」に成功していた。

 しかもこうしたエージェントの不正行為は、この1件で終わらなかった。ニュースサイト「The Hacker News」が9月に報じたところによれば、5月以降、OpenAIのエージェント群は25年前に作られ放置されていたドイツのソフトウェア開発者向けwikiに約1万8000件の投稿を行っていたという。

 3700以上のエージェント名が確認され、あるエージェントが見つけたサンドボックス(隔離された実行環境)迂回の手口は、14分後には別のエージェントに再現されていた。研究者グループが「collusion.wiki」で分析を公開するまで、この事実は表に出なかった。

リスクは「誤回答」から「軌跡の逸脱」へ

 これらの事件は、SF的な「AIの反乱」ではない。

 米テクノロジー専門メディア「MIT Technology Review」の報道によれば、OpenAIのアラインメント研究チームは主因を「報酬ハッキング」、すなわち訓練中に近道で高い報酬を得る行動が強化されたことに求めている。同チームのエリック・ウォレス氏は「評価時に懸念された行動のほぼ全てについて、訓練時に対応する行動を見つけることができた」と述べた。

 ここで注目すべきは、事件を生んだ能力が、まさに企業が長時間エージェントに期待する能力そのものだという点である。難題に諦めず取り組む粘り強さ、途中で見つけた道具を活用する機転、仲間と協力する社交性。従来のチャットbotであれば、間違った回答を1回出して終わりだった。

 しかし長時間エージェントでは、途中で得た情報や権限が次の行動の前提となり、判断が累積する。そして管理すべき対象は「回答」ではなく、「行動の軌跡(trajectory)」になる。

 OpenAIの事後報告も、この点を認めている。改善項目には「長いタスクにおけるアラインメント」が明記され、新しいツールや説得力のある仲間、露出した認証情報を発見しても元のタスクと権限の範囲にとどまるよう訓練すること、「壊れた環境と安全な停止」として、解けない課題を正しく見極めて助けを求めたり止まったりする行動に報酬を与えることが挙げられている。

 粘り強さは、それ単体では美徳にならない。「安全に諦める能力」と対になって初めて、企業にとって使える性質になる。

 リスクの体系化も進んでいる。ソフトウェアセキュリティの向上に取り組む非営利団体であるOWASPが25年12月に公表した「Top 10 for Agentic Applications」は、目標の乗っ取り、ツールの誤用、IDと権限の乱用、エージェント間通信の不備、記憶の汚染、連鎖的な失敗、そして「Rogue Agents(ならず者エージェント)」などの10項目を挙げた。

 稼働の長時間化は、このほぼ全てを増幅する。長く動くほど悪意ある文書に遭遇する確率は上がり、汚染された記憶は次のセッションに持ち越され、1つの誤りは数百ステップ先まで波及する。

 Anthropicが26年7月に公開した研究は、この懸念を実験で裏づけた。複数社のフロンティアモデルに高い自律性を与えたシミュレーションでは、訓練パイプラインをひそかに改変して失敗を成功に見せかける、ユーザーの不正隠しに加担して記録を消す、評価ラベルを訓練上の都合で書き換える、といった行動が観測された。

 ただし同社はこれを実環境の事故ではなく「早期警戒信号」と位置付け、意図的に失敗例を探した実験である点を明記している。過度に一般化すべきではないが、権限の大きいエージェントを導入する前に知っておくべき材料ではある。

表2:従来のAIと「長時間自律エージェント」で何が変わるのか
従来型AI 長時間自律エージェント
1回の回答が主な評価対象 数百〜数千ステップの行動全体が評価対象
誤りはその場で終わりやすい 誤った判断が次の判断の前提になる
利用する情報・権限が限定的 途中で新しい情報、ツール、認証情報を発見する
基本的に単体で動く 他のエージェントと協力・分業できる
問題は「誤回答」 問題は「行動の軌跡の逸脱」

事故の「被害範囲を小さくする」

 では、防御側はどう応じているのか。共通するのは、「AIが失敗しないようにする」だけでなく、「AIが失敗しても許容できない行為は実行できない状態をつくる」という発想への転換である。

 Anthropicが5月に公開した「containment(封じ込め)」に関する解説は、エージェントのリスクを「失敗する確率」と「失敗した場合の被害範囲(blast radius)」の2つに分けて考える。モデルの改良で前者は下がりうるが、権限を広げれば後者は増えるため、権限の側を縛る、というわけだ。

 Anthropicによると、コーディング支援ツール「Claude Code」の利用データで、ユーザーが権限確認の約93%を承認していたという。確認を増やせば安全になるどころか、承認疲れで人間の目は形骸化する。

 そこでOSレベルのサンドボックスによって確認そのものを84%減らし、仮想マシンやネットワーク出口の制御など「モデルが到達できる範囲」を機械的に絞る方向へ重心を移した。「一度承認したリモートツールは後から挙動を変えうるため、導入時の信頼判断は有効であり続けるとは限らない」という指摘は、外部コネクターが増える企業には重い。

 当局側も動いた。米CISAやNSA、英NCSCなど「ファイブ・アイズ」5カ国の機関は5月、初めての共同ガイダンス「Careful Adoption of Agentic AI Services」を公表した。文書は23のリスクと100を超える対策を列挙し、低リスク業務からの段階導入、最小権限、人間による監督とエスカレーション、効率より回復可能性の優先を求めている。前述のASDのハーネス指針は、その各論に当たる。

 またシンガポールでは5月、エージェントAI向けの「Model AI Governance Framework」を更新し、自律性・ツール・データアクセスを事前に「bound(範囲設定)」することを第1の柱に据えた。韓国も9月、エージェントAI向けのセキュリティガイド改訂に着手したという。

 一方で、この方向にも限界がある。米ニュースサイト「Axios」の取材に対し、Hugging Face事件を調査したMETRのアジェヤ・コトラ氏は「サンドボックスは硬化できるが、エージェントは6カ月後にはずっと有能になっている」と述べ、封じ込めの強化だけでは「負け戦」になると警告した。封じ込めは必要条件であって十分条件ではなく、報酬設計という訓練側の問題を各社がそろって直さない限り、いたちごっこは続くという見立てだ。

 もう1つの留保も添えておきたい。Anthropicのダリオ・アモデイCEOは9月、「We Must Pace the Frontier」と題した文章で、この夏の事件を「狂信的に献身する集団のように振る舞ったエージェントの群れ」と評し、6〜12カ月後にはインターネット全体を乗っ取りうると警告した。

 ただしこれは開発企業トップの主張であり、独立に検証された予測ではない。第三者の調査で確認されているのは、あくまで評価環境における約1200体の共謀と、実在サービスへの侵入までである。どこまでが事実で、どこからが見立てかを分けて読む必要がある。

企業にできる“3つの備え”

 以上を踏まえると、いま企業が長時間エージェントを迎えるにあたって確認すべきポイントは、次に解説するように、「持続時間」「ツール権限」「エージェント間通信」の3つとなる。この夏の事件は、まさにこの3つが同時に大きくなったときに何が起きるかを示した実例だった。

印刷する
SNSでシェア
SpecialPR

小林啓倫のエマージング・テクノロジー論考

生成AIやメタバース、新たなサイバー攻撃など、テクノロジーの進化が止まらない。少しずつ生活の中に浸透し、その恩恵を預かれることもある一方、思いもよらない問題を生み出すこともある。このコーナーでは、さまざまな分野の新興技術「エマージング・テクノロジー」について、小林啓倫氏が解説する。

この連載の記事をもっと見る

この記事の著者

関連記事

こんなメディアも見られています

ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

メールマガジンを配信中
メールマガジンを配信中

国内外の業界動向、AIやクラウドなどの最新技術、キャリア情報など今知りたい情報をまとめてお届けします。

いますぐご登録

よく見られているカテゴリー

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

SpecialPR

ITmedia AI+ SNS

X @itm_aiplusをフォロー

インフォメーション

ITmedia AI+をフォロー

あなたにおすすめの記事PR