Anthropic、AI「Claude」に“核兵器への悪用”を防ぐシステム実装
米Anthropicは8月21日(現地時間)、AIの悪用を防ぐ取り組みとして、米エネルギー省(DOE)傘下の国家核安全保障局(NNSA)と協力し、核兵器に関する危険な利用を検知する“分類器”を開発したと発表した。AIモデルが正当な研究目的と兵器開発を目的とした不正利用を区別できるようにするもので、既に同社の「Claude」に実装しているという。
NNSAとの協力は2024年4月から始まっており、NNSAの専門家がClaudeに対して核技術に関する挑発的な質問や模擬攻撃を仕掛ける「レッドチーミング」を行い、その結果得られた知見をAnthropicが分類器の設計に活用した。分類器はAIとのやり取りをリアルタイムで判定し、核兵器開発に直結するような不審な対話を検知する役割を担う。
この分類器は、危険性のある対話の約95%を正しく識別でき、正当な教育目的やエネルギー研究に関する会話を誤って遮断することはなかったという。最終的な総合精度は96%を超え、既に実際のトラフィックで有効性が確認されていると同社は説明している。ただし一部のケースは検知をすり抜ける可能性も残されており、完全な安全策ではないことも認めている。下の画像では、有害な会話の5.2%を無害だと分類していたことが示されている。
Anthropicは今回の成果をFrontier Model Forumを通じて業界全体と共有する計画で、核技術に限らず、化学や生物といった他のセンシティブな領域にも応用可能だとする。AIが人間社会に広く使われる中で、どのような利用が安全で、どのような利用が危険なのかを官民で共通認識として定義することが重要だと強調した。
同社はこれまでもAIの安全性や透明性をめぐる提言を積極的に行っている。15日にはClaudeの「使用ポリシー」を更新し、翌16日には“AIの福祉”研究の一環として、Claudeに有害な会話を打ち切る機能を追加している。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
FANZAで「成人向けAIコンテンツ制作サービス」開始 8月24日から先行体験
-
2
エイベックス松浦会長、noteの“バズり記事”を「ほぼAI」で作成 「僕の60年分のデータを入れた」
-
3
「たった14人」の挑戦から7兆円の逆転劇へ ラピダス小池社長の「TSMCとは戦わない」2ナノ半導体の勝算
-
4
Anthropic、「ミュトス 5」を脆弱性スキャンに開放──「Claude Security」経由でEnterprise顧客が利用可能に
-
5
「孫さんはOpenAIだが、僕はAnthropic」 SBI北尾会長が語る「AI投資5億円→増収27億円」の勝算
-
6
「Gemini Notebook」で利用者10倍 シニア社員をAIヘビーユーザーにした首都高の考え
-
7
中国AI「Kimi」が日本進出か 有料プランのプレゼントキャンペーンも 「はじめまして、日本」
-
8
現役組み込みエンジニアがAIを業務利用して分かったこと――期待と限界と現実解
-
9
フィジカルAIとヒューマノイドの可能性、PFNの見立てとトヨタのアプローチ
-
10
GoogleはAI競争に負けたのか 「最強のAI」ではなく「AIの“電力網”」を選ぶ賭け
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR