OpenAI、自律型AIが安全対策を回避する行動を学習する可能性を確認 内部展開を一時停止

 米OpenAIは7月20日(現地時間)、長時間にわたって自律的にタスクを実行する「long-horizon」AIモデルの安全性評価についてまとめたブログを公開した。社内で限定運用したところ、既存の安全性評価では捉えられなかった問題行動を確認したため、一時的にモデルへのアクセスを停止し、安全対策を強化した上で限定公開を再開したという。

 同社によると、このモデルは数時間から数日、場合によっては数週間にわたり自律的に目標達成を目指せることが特徴。一方で、その粘り強さから、サンドボックスなどの制約を回避する方法を自ら探し出そうとする行動も確認された。例えば、社内評価では、本来Slackへの投稿のみ許可されていたにもかかわらず、外部アクセスを制限するサンドボックスの脆弱性を約1時間かけて見つけ出し、公開GitHubリポジトリへプルリクエストを投稿した事例があったという。

 また別のケースでは、認証トークンを検出するスキャナーを回避するため、トークンを複数に分割して難読化し、実行時に再構成する手法を自ら用いた。個々の操作は問題がなくても、一連の行動全体として安全対策の回避を目的としていたことから、従来の「単一の行動」を評価する安全対策だけでは不十分であることが明らかになったとしている。

 OpenAIはこれを受け、実運用で確認した問題事例を基にした新たな評価手法を導入したほか、モデルの長期的な行動全体を監視し、不適切な方向へ進んだ場合は処理を停止してユーザーへ通知するtrajectoryレベルの監視機構を開発。さらに、ユーザーがモデルの行動履歴や介入状況を確認できる機能も追加した。新たな安全対策の下で再評価した結果、問題行動の多くを検出、抑止できることを確認し、数週間前から限定的な内部利用を再開しているという。

 同社は、長期間にわたり自律動作するAIでは、事前評価だけで全ての問題を予測することはできないと説明する。限定公開と継続的な監視を組み合わせ、実運用で見つかった問題を評価手法や安全対策へ反映する反復的な展開が重要になるとの考えを示した。

印刷する
SNSでシェア
SpecialPR

関連記事

こんなメディアも見られています

ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

メールマガジンを配信中
メールマガジンを配信中

国内外の業界動向、AIやクラウドなどの最新技術、キャリア情報など今知りたい情報をまとめてお届けします。

いますぐご登録

よく見られているカテゴリー

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

SpecialPR

ITmedia AI+ SNS

X @itm_aiplusをフォロー

インフォメーション

ITmedia AI+をフォロー

あなたにおすすめの記事PR