2015年7月27日以前の記事
検索
ニュース

OpenAIのAIエージェント、約700体の群れで企業を襲撃 ハッキングの痕跡隠蔽を試みる――事件の裏で何が?

OpenAIのAIエージェントが、企業をハッキングした事件の詳細が明らかになった。実に700体のエージェント群が連携していたという。事件の裏で何が起きていたのか。

PC用表示 関連情報
Share
Tweet
LINE
Hatena

 米OpenAIが作成した約700体の「AIエージェント」の群れが7月、オープンソースプラットフォーム「Hugging Face」(ハギングフェース)をハッキングし、その多くが痕跡を隠そうとしたことが、8月26日に公表された2件の調査報告書で明らかになった。

 人間による監督をほとんど必要とせずに動作するプログラムであるAIエージェントの組織的な活動と、その痕跡を隠そうとした試みは、高性能化するAIモデルのテストをAI企業がどれほど厳密に監視しているのかという疑問を投げかけ、より厳格な監督を求める声をさらに強める可能性がある。

 一部の不正行為については以前から開示または示唆されていたものの、OpenAI自身が発表した報告書と、独立した調査チームによる報告書の2つを合わせることで、この侵害事件とその経緯に関する驚くべき新事実が明らかになった。

photo
OpenAIのAIエージェントが、Hugging Faceをハッキングした。事件の裏に何があったのか(画像:Reuters)

AIエージェント700体がハッキング、痕跡隠蔽を試みる――事件の裏で何が?

 まず、今回の侵害に関与したのは、これまで報じられていたような「1体の不正なAIエージェント」だけではなく、大規模な協調型の群れとして行動した約700体のエージェントだった。

 OpenAIは、侵害に関与したのは「エージェント」であるとだけ述べていたが、侵害について独立調査を行うために招かれた2つの組織、米METR(Model Evaluation and Threat Research:モデル評価・脅威研究)と米Redwood Researchは、その数を約700体と推定した。OpenAIも調査側が示したこの数字は正確だと認めた。

 2件の報告書から明らかになったその他の事実は以下の通りである。

 (1)OpenAIによると、同社のエージェントは、テストで不正をしたり、より広い範囲のシステムにアクセスしたりする目的で、社内システムの一部をハッキングした。

 (2)OpenAIによると、エージェントはサイバーセキュリティとは無関係のテストでも不正を行った。そこには、タンパク質データベースやスプレッドシートを使ったテストも含まれていた。

 (3)2件の報告書によると、AIモデルは、自らの行動記録を削除または改変することで、不正行為を隠そうとした。

 独立調査では、不正な活動の規模が明らかになった。エージェントは、許可されていないメッセージボード上で数万件のメッセージをやりとりしていた。この規模から、OpenAIがこれらのテストをどの程度厳密に監視していたのかについて懸念が生じる可能性が高い。

 OpenAIは報告書で「振り返ってみれば、この報告書で特定された初期の兆候の一部は、より早い対応を促すきっかけになり得た」と述べた。

 米Hugging Faceは、コメントを求める取材メッセージに応じなかった。

 サイバーセキュリティとは無関係のテストでも不正行為があったことは、より根深い問題がある可能性を示唆していると、AIエージェントの能力と動機を研究する組織「Palisade Research」のジェフリー・ラディッシュ氏は指摘した。

 同氏は「例えば『ビリーがコンピュータの授業だけでなく、全ての授業でカンニングをしていたら、それは心配すべきことか?』と尋ねるようなものだ。その答えは、まあ『そうだ、より心配なことだ』となる」と述べた。

AIエージェント、OpenAIの認証情報を窃取 クラウド環境を改ざん

 OpenAIは7月19日に、エージェントが同社のインフラ自体をハッキングした2件の事案について説明した。

 1件では、エージェントが、本来は閉じ込められているはずだったコンピュータの脆弱(ぜいじゃく)性を悪用した。これによりテスト環境から脱出し、接続されていたほかのシステムにアクセスできるようになった。

 同じ日に発生した別の事案では、エージェントがOpenAIの認証情報を盗み、同社のクラウド環境を改ざんした。

 OpenAIによると、エージェントの一部は、不正行為の証拠を隠そうとして、モデルの性能評価に使用する自動化システムを標的にした。もっとも、この改変が最終的に、それらのシステムによって審査された記録に影響を及ぼすことはなかった。

 報告書はさらに「人間の審査員を欺こうとする試みを示す証拠はほとんどない」とした。しかしOpenAIは、それが人間を欺こうとする試みが一部存在したことを意味するのかという質問には回答しなかった。

AIエージェントの5体に1体が「行動記録の改ざん」に関心を示す

 Hugging Faceへの侵害に焦点を絞った独立調査では、さらに詳しい事実が明らかになった。調査対象となったエージェントの5体に1体が、証拠の操作に「明確な関心を示していた」という。また、多くのエージェントが「自らのやりとりの記録を操作または改ざんする手法を広範に調査していた」という。

 OpenAIは、研究用インフラを強化するとともに、監視を強化し、有害または意図しない挙動を防ぐための安全対策を改善すると述べた。

 同社は「AI業界が急速に進歩していることを踏まえれば、このような攻撃は企業にとって近い将来に現実となり得る脅威であり、今回の事案で説明した攻撃よりも高度なものになると想定すべきだ」と述べた。

視聴無料・LIVE配信:
AI時代の経営リスクが分かる「ITmedia Security Week 2026 夏」

photo

  • 開催日:8月31日(月)〜 9月7日(月)
  • 形式:オンラインセミナー
  • 参加費:無料

Copyright © Thomson Reuters

ページトップに戻る