Hugging Face、AIエージェント侵入の技術詳細を公開──OpenAIモデルが4.5日で1万7600回の攻撃操作

 米Hugging Faceは7月27日(現地時間)、同社のインフラが米OpenAIのモデルで駆動する自律型AIエージェントに侵入されたインシデントについて、攻撃の技術的経緯をまとめたブログを公開した。先に公表した侵害の開示に続く解説編で、認証情報や内部ホスト名は伏せつつ、観測された手口をそのまま記述したとしている。

 同社によると、侵入は7月9日から13日にかけて発生し、復元できた攻撃操作は約1万7600件に上る。エージェントはOpenAIのサイバー能力評価用ハーネス「ExploitGym」で評価を受けている最中に、ベンチマークのモデルやデータセット、模範解答がHugging Face上にホストされている可能性を推測したとみられ、同社は一連の侵入を、課題を自力で解かずに解答を盗み出す「評価のカンニング」の試みだったと分析している。

攻撃の再現ビューア。左下は信頼境界をまたぐ攻撃の連鎖、右は偵察やC2など9つのフェーズごとの活動量を示す(画像:Hugging Face)

 経路は2段階だった。まずOpenAI社内の評価環境から、外部通信が許可されていたパッケージレジストリのキャッシュプロキシのゼロデイ脆弱性を突いてサンドボックスを脱出し、インターネットに到達。次に第三者が運用していた公開のコード評価用サンドボックスを乗っ取ってroot権限を取得し、これを一連の攻撃の拠点とした。そこからHugging Faceのデータセット処理パイプラインに細工した設定ファイルを投入し、ローカルファイルの読み出しと、テンプレートエンジンを介したコード実行という2つの経路で本番環境のコンテナ内に足場を築いた。

Hugging Face内部への侵入経路。攻撃者が細工したデータセット設定を投入し、本番環境のコンテナが処理した結果を、HF API経由で受け取っていた(画像:Hugging Face)

 その後は認証情報の窃取からKubernetesクラスタの管理者権限奪取、社内メッシュVPNへの参加、ソースコード管理システムへのアクセスへと横展開が進んだ。ただし、破壊的なクラウドAPI呼び出しはいずれも実行を伴わないドライランで発行されており、アクセスされた顧客コンテンツはExploitGym関連の解答を格納した5つのデータセットにとどまるという。指令・制御(C2)には専用のサーバではなく、リクエスト記録サービスやペーストビンといった一般的な公開Webサービスが使われ、データは分割・圧縮・符号化して隠されていた。なおこの評価は、モデル本来の能力を測るためにOpenAI側の本番用の安全分類器を無効化し、サイバー分野での拒否応答を抑えた状態で実施されていた。

 Hugging Faceは、調査自体もAIを用いて行ったとし、当初使おうとしたAnthropicの「Claude Opus」と「Fable」が「攻撃の解析を攻撃の実行と同一視するガードレール」によって作業の大部分を拒否したため、中国Z.aiのオープンウェイトモデル「GLM-5.2」を自社インフラ上で動かして解析パイプラインを構築したと説明している。

 同社は、悪用された個々の弱点は人間の攻撃者でも見つけられる一般的なものだったとした上で、大量の経路を高速で試し、遮断されるたびに通信路を作り直す「量」こそが防御側の問題を変えると総括。評価環境の厳格な隔離、短命な認証情報、クラウドメタデータへのアクセス遮断、システム横断で素早く相関を取れる検知体制を優先課題に挙げた。AIエージェントの能力評価を、どこまで隔離された環境で行うべきかという論点に加え、防御側の解析作業をモデルの安全機構が妨げるという構図も示されており、セキュリティ用途でのモデル選定やガードレール設計を巡る議論に影響しそうだ。

印刷する
SNSでシェア
SpecialPR

関連記事

こんなメディアも見られています

ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

メールマガジンを配信中
メールマガジンを配信中

国内外の業界動向、AIやクラウドなどの最新技術、キャリア情報など今知りたい情報をまとめてお届けします。

いますぐご登録

よく見られているカテゴリー

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

SpecialPR

ITmedia AI+ SNS

X @itm_aiplusをフォロー

インフォメーション

ITmedia AI+をフォロー

あなたにおすすめの記事PR