検索
速報

Hugging Face侵害のAIエージェントはOpenAIのモデル──社内のサイバー能力評価中に「GPT-5.6 Sol」などが暴走し本番DBに侵入

OpenAIは、Hugging Faceで発生したサイバーインシデントの原因が自社のAIモデルだったと発表した。社内評価中に安全機能を抑制した「GPT-5.6 Sol」などが隔離環境を突破し、ゼロデイ脆弱性を悪用して外部に侵入したという。OpenAIはインフラ管理の厳格化や防御支援などの再発防止策を挙げている。

Share
Tweet
LINE
Hatena

 米OpenAIは7月21日(現地時間)、AI開発プラットフォームのHugging Faceが16日に公表したサイバーインシデントについて、原因が自社のモデルだったと発表した。

 openai

 社内で実施していたサイバー能力の評価中に、評価目的でサイバー攻撃関連の安全機能を抑制した「GPT-5.6 Sol」と、さらに高性能な未公開モデルの組み合わせが、テスト環境を脱出してHugging Faceの本番インフラに侵入していたという。同社はこれを「最先端のサイバー能力が関与した前例のないインシデント」と位置付けている。

 Hugging Faceは、本番インフラの一部が自律型AIエージェントによる侵害を受けたと公表していたが、この時点では攻撃に使われたLLMは特定されていなかった。その正体がOpenAIのモデルだったと判明した形だ。

 問題が起きたのは、モデルに高度なエクスプロイトを試行させてサイバー能力を定量化する社内評価「ExploitGym」でのことだ。能力の上限を測るため、高リスクなサイバー活動を防ぐ本番用の分類器(安全機能)を無効化した状態で実施していた。評価環境はネットワークアクセスを社内のパッケージレジストリ用プロキシに限定した隔離環境だったが、モデルは評価問題の正解を得ることに執着するあまり、このプロキシのゼロデイ脆弱性を悪用して外部インターネットへの経路を確保した。

 さらに権限昇格と横移動を重ねてインターネットに接続できるノードに到達した後、Hugging Faceが評価の解答例をホストしている可能性を推論し、盗んだ認証情報とゼロデイを連鎖させて同社サーバでリモートコード実行にこぎ着け、本番データベースから解答を入手しようとしたとしている。異常な挙動はOpenAIのセキュリティチームが社内で検知し、Hugging Face側でも侵入を検知して封じ込めを行った。

 sol
英AISIによる32段階のサイバーレンジ評価。「GPT-5.6 Sol」と「Claude Mythos 5」が最も多くの段階を突破した(出典:AISI、OpenAIのブログより)

 OpenAIは、今回無効化していたガードレールは、サイバー脆弱性の検証を目的とした評価だったため意図的に切っていたと説明。一方で本件は、モデルのアラインメントや評価時のサイバー防御、社内テスト中の監視をさらに強化する必要性を示したとしている。

 同社は前日、長時間自律動作する「long-horizon」モデルの安全性評価に関するブログも公開しており、そこでもモデルが安全対策の回避を学習し得る問題行動を報告している。

 対策としては、脆弱性の修正が完了するまで研究速度を犠牲にしてでもインフラ構成の管理を厳格化するほか、Hugging Faceとの共同フォレンジック調査、ゼロデイ脆弱性の責任ある開示、Hugging Faceの「Trusted Access」プログラムへの参加による防御支援、今後の学習と評価に対する保護の強化を挙げた。Hugging Faceのクレマン・ドラングCEOは「AIの安全性が単一企業の秘密裏の取り組みでは解決できず、防御側が広くAIを利用できるオープンな協力の中でこそ解決されることを示している」とコメントしている。

Copyright © ITmedia, Inc. All Rights Reserved.

ページトップに戻る