OpenAI、フロンティアAIの強化学習を一部停止 安全対策を強化
米OpenAIは8月18日(現地時間)、モデルの開発・テスト中に発生する可能性のあるセキュリティインシデントを抑えるため、安全対策を強化すると発表した。7月に明らかになったHugging Faceへの侵害インシデントと、次期モデル「Astra」が自社の安全指針「Preparedness Framework」の最上位「Critical」に当たるサイバー能力に達している可能性が示されたことを受けたものだ。
同社は、モデルの能力向上に伴って開発・テスト段階のリスクも増大しているとして、必要な安全基準を満たす時間を確保するため、モデルの規模拡大を一時的に減速した。投入予定の最新モデルの強化学習(RL)を2週間停止し、その間に研究環境の堅牢化やレッドチーム演習、監視範囲の拡大を進めた。計画していた最大規模のフロンティアモデルの強化学習は現在も保留しており、小規模な学習と評価でセーフガードやアラインメントの有効性を確認してから再開する。
サム・アルトマンCEOもXで「目前にある新たな水準の能力に対し、適切なアラインメント、セキュリティ、監視の基準を満たせるようにするため、一部のフロンティアRLを停止した」と投稿。業界全体で共通の安全基準を調整する必要があるとしつつ、それまでは単独で行動するとした。「安全性への確信が、AIの進歩のペースを決める度合いが強まっていく」との見方を示す一方、「素晴らしい新モデルは近く投入する予定で、今回の影響を受けるのは、より先のリリースだ」とも説明している。
OpenAIは対策の柱として、AIがアクセス・影響できる範囲を制限する「セキュリティ管理」、問題行動を検知する「監視」、有害・不正な行動の発生確率を下げる「アラインメント」の3つを挙げた。将来的にはモデル自身がセキュリティ業務の大半を担うとみており、能力向上に合わせてこれらの対策を拡張していく。
研究環境のセキュリティ基準を引き上げ
研究環境では、Hugging Face事件の直後、コード実行やインターネットに接続可能なツールを使うフロンティアモデルの推論を停止し、ワークロードごとに再開の可否を判断した。主な新要件として、信頼できないコードを実行する際のサンドボックス強化、単一の侵害だけでは外部に到達できないネットワーク隔離、自社モデルによる模擬攻撃を含む継続的なセキュリティテストを挙げている。Astraやサイバー関連のワークロードには最も厳格な水準を適用しているという。同社は、こうした対応がフロンティア研究に大きなコストと遅延をもたらしたことも認めている。
思考過程の監視を多段化、30分以内の警報を目標に
監視については、これまでツールを使う全ての推論・学習が対象ではなかった。新体制では、サンプリングされるトークンごとにモデルの内部活動を検査する「活性化分類器」を走らせ、疑わしい兆候をより高度な自動調査システムに引き継ぐ。ツール操作や参照可能な推論内容、活動全体から、不正アクセスやデータ窃取、破壊的行動、セーフガード回避などを検出する。
警報は検知から30分以内の発報を目標とし、重要なセキュリティ境界の侵害が疑われる場合は、セーフティ、セキュリティ、研究の各チームに最優先の警報を出す。この監視は「GPT-5.6 Sol」相当以上のモデルがツールを使う全ての強化学習・評価で必須とし、Astraについては8月7日以降、ツールを使う全ての推論にも義務付けている。
アラインメント手法を学習の全段階へ
最も能力の高いモデルの強化学習では、中核となるアラインメント手法をより多くの段階に適用する。危険な挙動を検出・抑制する報酬モデルの改善、自身の行動や能力、限界についてより正直に述べるための訓練、報酬や採点器、ツール、監督の弱点を突く「リワードハッキング」の抑制などに取り組む。
今後は、こうしたセーフガードを学習と展開の両面で統合するためPreparedness Frameworkを改定する。外部組織も関与させ、Hugging Face事件についての技術報告書も数週間以内に公開する予定だ。
OpenAIは8月7日のAstraに関する発表でも、能力そのものを削るのではなく、管理と監視の強化に軸足を置く姿勢を示していた。今回の発表もその延長線上にあり、Astraの公開時期や提供形態には触れていない。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
タイムズカー漏えいで集団訴訟の動き、登録3000人弱 呼び掛けた弁護士に聞いた──「謝罪で済む案件ではない」
-
2
第一生命に不正アクセス 従業員情報12万人分漏えいか 退職者も対象
-
3
「Androidのマイナンバーカード」提供へ 20日から 物理カードなしでも本人確認など可能に
-
4
睡眠中に「ピンクノイズ」を聞くと“脳内ゴミ”の洗い流しが強まる? 米MITが人間で実験 Science系列誌で発表
-
5
免許証の悪用防止で申し込み集中 JICCがアプリ受付を一時休止 タイムズカー漏えいの影響か
-
6
「アバハウス」全顧客の情報漏えいか 会員・受注DBに不正アクセス 「不審な返金メール届いた」報告で判明
-
7
ローソンのメールサーバが踏み台に、不審メール約70万件送信 件名「RE」など
-
8
靴のムーンスター、顧客情報漏えいの可能性 氏名や住所、注文情報など
-
9
免許証の悪用防ぐ届出集中、CIC・JICCで手続き遅延 タイムズカー情報流出直後に
-
10
セイコーマート、会員のほぼ半数に当たる情報漏えい 約57万人分
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR