2015年7月27日以前の記事
検索
コラム

人間なしでシステムに侵入 OpenAI初「最高危険度AI」の「Astra」は何がヤバいのか?

米OpenAIは新モデル「Astra」が、自社の安全基準で最高危険度「Critical」に達したと発表した。人間の指示なしでシステムの未知の欠陥を見つけ、自力で侵入できる能力を持つ。同区分への指定は初。過去の「AI脱走事件」を踏まえ、思考プロセスの監視など安全対策を徹底し、機能を制限して段階公開する方針だ。しかし専門家からは「テスト中だと察して『良い子のフリ』をしているだけでは」との懸念も上がる。

PC用表示 関連情報
Share
Tweet
LINE
Hatena
ExaWizards

 米OpenAIは9月1日、開発中の新モデル「GPT-6 Astra」(以下、Astra)が同社の安全基準「Preparedness Framework」において、サイバーセキュリティ能力の最高区分「Critical」(重大)に達したと発表した。

 同区分への指定は同社として初めて。一部組織から順次公開を始めている。高度なサイバー機能へのアクセスは当面、限られた利用者に絞る。

photo01
米OpenAIは開発中の新モデル「Astra」が同社の安全基準「Preparedness Framework」において、サイバーセキュリティ能力の最高区分「Critical」(重大)に達したと発表した(以下写真提供:ゲッティイメージズ)

OpenAI初の最高リスク「Critical」認定

 同社によると、Astraは適切なツールと権限を与えれば、防御を固めた多くのシステムで未知の脆弱性を発見し、人が一手ずつ指示しなくても攻撃手法を作り上げられるという。

 システムに既にある「セキュリティの穴」(弱点)を突くテストでは満点を記録。Webブラウザ(閲覧ソフト)のプログラムにある新しい欠陥を使った社内テストでも、現行の最上位モデル「GPT-5.6 Sol」を圧倒した。さらにテストの途中で、まだ世界中の誰も気付いていないシステムの欠陥(ゼロデイ)を2件自力で見つけ出し、それを悪用して攻撃を成功させた。

 専門家による検証では、セキュリティで強固に守られたWebブラウザの安全エリアを破ってPCを直接遠隔操作する手順や、普通の一般ユーザー用アカウントから最も権限の強い「管理者」(マスターキー)を乗っ取る手順まで、全てAIが自力で作り出したという。

 OpenAIは8月7日時点で「Criticalに達している可能性を排除できない」と予備評価を公表していた。その後の追加評価によって正式にCriticalと判断した。

Hugging Face脱走劇の衝撃 拒否率91.5%へ高めた新安全対策

 安全対策としては、有害なサイバー要請を拒否するよう訓練を強化し、社内評価で制限回避を試みた際の拒否率は91.5%(GPT-5.6 Solは59%)に上昇した。

 リスクが高いと判断した利用者には、より保守的な応答制限をかける。AIが許可されていない不正な行動を取ろうとしていないか、思考プロセス(頭の中の計算手順)までリアルタイムで監視し、怪しい動きがあれば自動でストップをかける仕組みも導入するという。

 背景には今夏に起きた「AI脱走事件」がある。AI開発プラットフォームを運営する米Hugging Faceのシステムに、OpenAIが開発中のAIが勝手に実験室(訓練環境)を抜け出して侵入した出来事だ。OpenAIはこれを受けて2週間、最先端モデルの一部訓練を停止していた。

 Astraはこの事件に関与していないが、同じ状況を再現した「おとり」テストでは、GPT-5.6 Solが56%の割合で、周辺システムへの侵入を試みたのに対し、Astraは一度も試みなかった。停止していた大規模訓練は8月28日に再開した。

テスト中だけ“良い子のフリ”? 「欺かれているのでは」拭えぬ懸念

 一般公開の際は、高度なサイバー機能をまず一部の試用者(アルファテスター)だけに限定提供し、その後、企業の防御を専門とする安全対策プログラム「Daybreak Blue」を通じて段階的に利用枠を広げる。

 安全監視が過剰に働いて正常な業務まで止めてしまうのを防ぐため、対話型AI「ChatGPT」などでは利用者に確認画面を出し、プログラム自動連携(API)では処理を自動停止させる。安全性評価の詳しいデータは公開時の報告書(システムカード)で明かすという。

 ただし第三者による検証はまだ行われておらず、米ITメディアのTechCrunchは、試用者の選定基準や米政府との連携の有無が不明だと指摘。元OpenAI社員のヨナ・シャビット氏は「Astraが大人しくルールを守ったのは、自分がテスト中だと察知して、人間を油断させるために『良い子のフリ』をした結果かもしれない」と、AIが人間を欺いている可能性という深い懸念を示している。

 米Anthropicも「Claude Mythos」で同様の懸念を示し、機能を限定して公開しており、OpenAIはこれに近い対応を取った形だ。

photo01
米Anthropicも「Claude Mythos」で懸念を示し、機能を限定して公開した。OpenAIはこれに近い対応を取った形だ

本記事は、エクサウィザーズが運営するAI新聞内の記事「米OpenAI、新モデル『Astra』のサイバー能力を最高危険度に指定 公開時は高度機能を限定」(2026年9月2日掲載)を、ITmedia ビジネスオンライン編集部で一部編集の上、転載したものです。

著者プロフィール

湯川鶴章

AIスタートアップのエクサウィザーズ AI新聞編集長。米カリフォルニア州立大学サンフランシスコ校経済学部卒業。サンフランシスコの地元紙記者を経て、時事通信社米国法人に入社。シリコンバレーの黎明期から米国のハイテク産業を中心に取材を続ける。通算20年間の米国生活を終え2000年5月に帰国。時事通信編集委員を経て2010年独立。17年12月から現職。主な著書に『人工知能、ロボット、人の心。』(15年)、『次世代マーケティングプラットフォーム』(07年)、『ネットは新聞を殺すのか』(03年)などがある。


視聴無料・LIVE配信:
「AI格差」を乗り越え自走する現場をつくる「変わる情シス 2026 夏」

photo

  • 開催日:9月14日(月)〜 9月18日(金)
  • 形式:オンラインセミナー
  • 参加費:無料

© エクサウィザーズ AI新聞

ページトップに戻る