OpenAI、Webタスク代行エージェント「Operator」のリスク対策を説明
米OpenAIは1月23日(現地時間)、同日リリースした、ユーザーに代わってWeb上のタスクを自動的に実行するAIエージェント「Operator」のリリース前に実施した安全対策とリスク評価を概説した文書「Operator System Card」を公開した。
Operatorは、ユーザーの指示と監視の下で、ユーザーがWebでやりたいこと(=タスク)を実行する。例えば、食料品の注文、旅行の計画と宿や交通機関の予約、イベントチケットの購入などだ。
OpenAIは、Operatorがネット上でユーザーの代わりに操作を行う能力によって生じるリスクを徹底的に評価したとしている。この評価には、第三者によるレッドチームの演習や、法務、セキュリティ、ポリシーチームからのフィードバックも組み込まれている。
System Cardでは以下の3つのリスクとその対処について説明している。
- 有害なタスク:ユーザーが悪意のあるタスクを要求する可能性があるため、Operatorは特定の有害なタスクを拒否するように訓練されている。例えば、違法薬物など規制物質の購入や個人情報の不正取得、株式取引のような高リスクの決定を自動化するタスクを拒否する。また、OpenAIの利用規約に違反するWebサイトへのナビゲーションも制限されている
- モデルの誤り:モデルがユーザーの意図に反するアクションを誤って実行する可能性があるため、重要なアクションを完了する前にユーザーに確認を求めるよう設計されている。例えば、購入を完了したり、メールを送信したりする前に確認を求める。また、特定のWebサイトでは、ユーザーがOperatorのアクションを監督する必要がある「ウォッチモード」も導入されている
- プロンプトインジェクション:悪意のあるWebサイトやメールからの指示に従う可能性があるため、モデルはこの種の攻撃に対してより堅固に設計されている。さらに、画面上で疑わしいプロンプトインジェクションが検出された場合、実行を一時停止するプロンプトインジェクションモニターも追加されている
プロンプトインジェクションとは、AIモデルに悪意のあるプロンプトを与えることで、本来意図されていない動作や出力を引き起こす攻撃手段。機密情報を引き出したり、不適切な発言を生成したりする。
また、プライバシーへ対策として、ChatGPTの設定で「すべての人のためにモデルを改善する」を無効にすれば、Operatorのデータもモデルのトレーニングに使用されない。
OpenAIはOperator発表の公式ブログで「悪意のある人物がこの技術を悪用しようとする可能性があることは承知している」とし、そのための安全対策を立てているが、「完璧なシステムなど存在せず、これはまだ研究プレビュー段階」だと語った。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
「きもい」「内部資料そのまま」と話題のAI生成掲示物についてセブンイレブンに聞いてみた 「本部提供ではない」
-
2
「APIキーは.envに」はもはや通用しない AIエージェントの“内通者化”をどう防ぐ?
-
3
富士通、国産CPU「モナカ」販売 スパコン技術を結集した“小さなチップ”に託す「3兆円のAIビジネス」の行方
-
4
「足りないのはCOBOL人材じゃない」 日立が語る、AI時代のシステム刷新における“人”の役割
-
5
国産汎用ロボットによるフィジカルAIのデータ収集で7社が競う、試作機を披露
-
6
なぜ「Claude Code」で想定外のコストになるのか? 「トークン浪費」を防ぐポイントまとめ
-
7
「中国AIがClaudeやGPTから数十億トークン抽出」 米当局が暴いた「知識蒸留」の実態
-
8
千代田区、生成AI全庁展開で「年間4000時間」を削減 次の一歩は「打倒・美しい紙の資料」、そのワケは?
-
9
ウェザーニューズが「社外AIは漏えいが怖い」を“独自AI”で解決 社員8割が使うその中身とは
-
10
「AIが人類を絶滅させる確率は10%超」 Anthropic安全責任者が認めた危機感
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR