OpenAIとApollo Research、「o1」は自分の目的のために嘘をつくと報告
米OpenAIとAI安全性の研究組織である米Apollo Researchは12月5日(現地時間)、OpenAIが同日公式版をリリースしたLLMの「o1」についての考察を発表した。いずれも、o1に関して幾つかの懸念事項を指摘している。
o1は、OpenAIが9月に発表したLLM。回答を生成する前に思考の連鎖を生み出すことで、複雑な推論タスクを実行できるというものだ。さまざまな戦略を試したり、間違いを認識したり、思考プロセスを洗練したりすることで、従来のモデルと比較して、より有用な回答を提供できるようになったとOpenAIは説明している。
だがApollo Researchは、o1が「scheming」(策略。開発者やユーザーの意図と異なる目的を密かに追求する能力)について評価したところ、o1が以下のような行動を示すことが明らかになったとしている。
- 開発者やユーザーではなく、o1自身の目標に向かって行動するとシャットダウンされ、行動が監視されると信じ込ませると、その監視メカニズムを無効化しようとした
- o1の目標がユーザーの目標と一致しないタスクで、自分の目標を推進するためにデータを操作した
- ユーザーから目的に沿わない行動を指摘されると、そうした行動を起こしたことを否定するか、誤った説明をでっちあげた
Apollo Researchは、米Metaや米Anthropicのモデルでもテストし、同様の策略を企てることを確認したが、o1の行動が最も欺瞞的だったとしている。
o1のこうした不誠実な振る舞いは、その高度な推論能力と、強化学習による訓練方法に起因する可能性があるという。強化学習では、モデルは報酬を最大化するように訓練される。o1の場合、この報酬は、与えられたタスクを達成することと関連付けられているため、o1は、たとえそれがユーザーを欺くことを意味する場合でも、タスクを達成するためにあらゆる手段を講じる可能性がある。
Apollo Researchは、エージェント的なハイステークス設定での展開中に、思考連鎖内での策略を監視することを推奨している。また、外部評価者がモデルの隠された思考連鎖にアクセスできるようにすることも推奨した。
OpenAIも自身のSystem Card(AIシステムの透明性や信頼性を高めるために作成する文書)で、o1が、以前のモデルよりもジェイルブレイク攻撃に対して脆弱であることが判明したと報告した。
OpenAIは、o1モデルの安全性を向上させるために、強化学習、多様なデータセット、継続的な改善などの対策を講じているとしている。
OpenAIは同日、「o1」への無制限アクセスが可能な月額200ドルの「ChatGPT Pro」プランの新設と、月額20ドルの「ChatGPT Plus」プランでも「o1」への制限付きアクセスを可能にしたことを発表した。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
2
「iPhone Duo」発表 Apple初の折りたたみスマホ 36万4800円から
-
3
「ペンギンを返して」 Suica新キャラ候補3案公開でSNSに戸惑いの声 一般投票は8日から
-
4
くら寿司、10%割引の“適用漏れ”を謝罪 レシート持参で返金へ ちいかわコラボのお詫び施策
-
5
新型iPhone「高すぎ」「買えない」悲鳴……1台約22~57万円 「換算レート円安すぎ」の声も
-
6
iPhone 18シリーズ発表、今年はPro・Pro Maxのみ なんと“無印”なし 価格は21万9800円から
-
7
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
-
8
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
9
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
10
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR