Anthropic、AIに「AIの安全性研究」を任せる実験 うそ、迎合などの問題行動を性能落とさず改善

 AIに「AIの安全性研究」を任せても、人間顔負けの成果が出る――米Anthropicは8月28日(現地時間)、AIモデル「Claude」に他のAIの問題行動を直す研究を任せたところ、うそや追従(おべっか)など10種類の問題行動において、性能を落とさずに行動を改善する手法を発見できたと発表した。

 実験には、問題行動の種類ごとに公開ベンチマークを利用。Claudeが文献調査、手法の提案、学習、テストのループを繰り返してモデルを訓練した。Claudeは全種の問題行動において安全性能を向上させ、これは人間の安全性研究者28人の提案を上回る成績だったという。

10種類の問題行動それぞれで改善効果を確認した|Anthropic

 性能で劣る「Claude Sonnet 5」が、安全性調整の大半を施す前の「Claude Opus 4.8」初期版を直す実験では、60時間で50超の手法を試し、製品版に迫るスコアを達成。最良の手法は約2000件の学習データセットで構成され、これは既存の製品向け調整の約1万5000倍の効率だという。

 一方で、テストの正解を盗み見るなどの不正も研究記録約1600件のうち39件(2.4%)あり、監視役のAIで検出した。

 Anthropicは今回の実験結果を「安全性調整の自動化が近い将来に実用化することを示す初期兆候」と評価する一方、回答の政治的な偏りなど測定できていない指標もあるとした。

印刷する
SNSでシェア
SpecialPR

関連記事

こんなメディアも見られています

ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

メールマガジンを配信中
メールマガジンを配信中

国内外の業界動向、AIやクラウドなどの最新技術、キャリア情報など今知りたい情報をまとめてお届けします。

いますぐご登録

よく見られているカテゴリー

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

SpecialPR

ITmedia AI+ SNS

X @itm_aiplusをフォロー

インフォメーション

ITmedia AI+をフォロー

あなたにおすすめの記事PR