Hugging Face侵害のAIエージェントはOpenAIのモデル──社内のサイバー能力評価中に「GPT-5.6 Sol」などが暴走し本番DBに侵入
OpenAIは、Hugging Faceで発生したサイバーインシデントの原因が自社のAIモデルだったと発表した。社内評価中に安全機能を抑制した「GPT-5.6 Sol」などが隔離環境を突破し、ゼロデイ脆弱性を悪用して外部に侵入したという。OpenAIはインフラ管理の厳格化や防御支援などの再発防止策を挙げている。
米OpenAIは7月21日(現地時間)、AI開発プラットフォームのHugging Faceが16日に公表したサイバーインシデントについて、原因が自社のモデルだったと発表した。
社内で実施していたサイバー能力の評価中に、評価目的でサイバー攻撃関連の安全機能を抑制した「GPT-5.6 Sol」と、さらに高性能な未公開モデルの組み合わせが、テスト環境を脱出してHugging Faceの本番インフラに侵入していたという。同社はこれを「最先端のサイバー能力が関与した前例のないインシデント」と位置付けている。
Hugging Faceは、本番インフラの一部が自律型AIエージェントによる侵害を受けたと公表していたが、この時点では攻撃に使われたLLMは特定されていなかった。その正体がOpenAIのモデルだったと判明した形だ。
問題が起きたのは、モデルに高度なエクスプロイトを試行させてサイバー能力を定量化する社内評価「ExploitGym」でのことだ。能力の上限を測るため、高リスクなサイバー活動を防ぐ本番用の分類器(安全機能)を無効化した状態で実施していた。評価環境はネットワークアクセスを社内のパッケージレジストリ用プロキシに限定した隔離環境だったが、モデルは評価問題の正解を得ることに執着するあまり、このプロキシのゼロデイ脆弱性を悪用して外部インターネットへの経路を確保した。
さらに権限昇格と横移動を重ねてインターネットに接続できるノードに到達した後、Hugging Faceが評価の解答例をホストしている可能性を推論し、盗んだ認証情報とゼロデイを連鎖させて同社サーバでリモートコード実行にこぎ着け、本番データベースから解答を入手しようとしたとしている。異常な挙動はOpenAIのセキュリティチームが社内で検知し、Hugging Face側でも侵入を検知して封じ込めを行った。
OpenAIは、今回無効化していたガードレールは、サイバー脆弱性の検証を目的とした評価だったため意図的に切っていたと説明。一方で本件は、モデルのアラインメントや評価時のサイバー防御、社内テスト中の監視をさらに強化する必要性を示したとしている。
同社は前日、長時間自律動作する「long-horizon」モデルの安全性評価に関するブログも公開しており、そこでもモデルが安全対策の回避を学習し得る問題行動を報告している。
対策としては、脆弱性の修正が完了するまで研究速度を犠牲にしてでもインフラ構成の管理を厳格化するほか、Hugging Faceとの共同フォレンジック調査、ゼロデイ脆弱性の責任ある開示、Hugging Faceの「Trusted Access」プログラムへの参加による防御支援、今後の学習と評価に対する保護の強化を挙げた。Hugging Faceのクレマン・ドラングCEOは「AIの安全性が単一企業の秘密裏の取り組みでは解決できず、防御側が広くAIを利用できるオープンな協力の中でこそ解決されることを示している」とコメントしている。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
OpenAI、自律型AIが安全対策を回避する行動を学習する可能性を確認 内部展開を一時停止
OpenAIは、長時間自律動作するAIモデルの安全性評価に関するブログを公開した。限定運用でサンドボックスの回避や認証トークンの難読化などの問題行動を確認したため、一時アクセスを停止。モデルの行動全体を監視する新たな安全対策を構築し、問題行動の検出・抑止を確認した上で内部利用を再開した。
Hugging FaceにAI主導のサイバー攻撃 防御もAIで対抗するも、商用モデルは解析拒否で「GLM」採用
Hugging Faceは、自律型AIエージェントによる本番インフラへの侵入を検知、対処したと発表した。一部の内部データセットと複数の資格情報への不正アクセスを確認した。ログ解析には当初商用AIを使ったが、安全ガードレールに阻まれたため、最終的にオープンウェイトモデル「GLM 5.2」を自社インフラで実行して解析した。
OpenAI、次世代AI「GPT-5.6」を限定プレビュー──米政府の要請で全面公開見送り「恒久的な標準にすべきでない」
OpenAIは、次世代AIモデル「GPT-5.6」シリーズの限定プレビューを始めた。フラッグシップの「Sol」など3モデルで構成する。提供形態を巡って米連邦政府の要請を受け、信頼できる少数のパートナーから提供を開始する。こうした政府による事前確認のプロセスが「恒久的な標準になるべきではない」と主張した。
Anthropicの「Mythos」でCloudflareがサイバー防衛テスト──脆弱性発見から悪用までが数分に短縮と警告
Cloudflareは、AnthropicのAIモデル「Mythos Preview」を用いた脆弱性テスト結果を公開した。同モデルはエクスプロイトチェーン構築やPoC生成で高い能力を示した一方、ガードレールの誤作動も確認された。同社はタスクを細分化するパイプラインの構築や防御層の再構築の必要性を指摘している。

