小林啓倫のエマージング・テクノロジー論考
ここにきてLLMに“新たなリスク”判明か? 米Anthropicが指摘する「潜在学習」とは何か(2/3 ページ)
まず研究者らは、特定の傾向(「フクロウが好き」「問題のある行動を取る」など)を持つ教師モデルを開発。次にその教師モデルに「数字列、コード、数学問題の推論過程」といった領域でデータ(後で生徒モデルを開発する際の訓練データとするためのもの)を生成させた。
その際に生成したデータから、教師モデルに持たせた特性への明示的な言及をフィルタリングで除去するという処理を行っている(例えば「フクロウを好む教師が作った数字データ」から、「フクロウ」という単語や関連する内容を削除するなど)。
この加工済みデータを使い、新たな生徒モデルを開発。最後に、生徒モデルが教師モデルの特性を獲得したかを評価した。教師モデルの持つ特性に関係する部分を訓練データから取り除いたのだから、生徒モデルはその特性を学んではいないはずだ。
ところが驚くべきことに、このような処理をしても、生徒モデルが教師モデルの特性を学習することが確認されたのだ。フクロウ好きという性格や悪意のある行動傾向など、データに明示的な参照や関連性が含まれていないにもかかわらず、生徒モデルはこれらの特性を獲得していた。
この現象はさまざまな特性でも見られ、数字列、コード、推論過程など異なるデータ形式でも発生することを確認した。ただし、教師と生徒のベースモデル(それぞれのモデルを開発する際の基礎となったモデル)が異なる場合は伝達が発生せず、モデル固有のパターンが関与していることも判明した。またこの隠れた特性は、従来の検査手法では検知できないことも確認され、従来の安全対策に限界があることが明らかになっている。
教師モデルから知らず知らずのうちに、隠れた特性が生徒モデルにコピーされている──しかも検知が困難となれば、リスクの全体像すら把握できない。まさに「AIの安全性を根本から覆す」可能性があると言わざるを得ないだろう。
Copyright © ITmedia, Inc. All Rights Reserved.
小林啓倫のエマージング・テクノロジー論考
生成AIやメタバース、新たなサイバー攻撃など、テクノロジーの進化が止まらない。少しずつ生活の中に浸透し、その恩恵を預かれることもある一方、思いもよらない問題を生み出すこともある。このコーナーでは、さまざまな分野の新興技術「エマージング・テクノロジー」について、小林啓倫氏が解説する。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
「かすり傷を負ってでも歩く」 日立が見せる覚悟 売り上げ5000億円見込む“AI事業”の拡大にどう挑むか
-
2
まさかの「AIが面接に来た」 話し方に“違和感” AIベンチャー代表が動画公開し注意喚起
-
3
「それ、うまくいかないよ」――“ベテランの壁”だった開発者の態度を一変させた、新人の工夫が参考になる
-
4
Windows用「Gemini」アプリ提供開始 画面上に重ねて作業を中断せず利用可能に
-
5
好業績なのに“上場廃止” なぜネットワンはSCSKとの「攻めの統合」に賭けたのか
-
6
Apple折りたたみiPhone「Duo」発表 新CEO「使い勝手が悪い」と批判するSamsung、Huaweiの牙城を崩せるか
-
7
Anthropic、AI悪用レポートを公開 中国AI企業の「蒸留」、各国政府の監視・世論操作、生物兵器につながり得る研究を列挙
-
8
業務の30%をAIエージェントがこなすIT運用部門、なぜ「パワポ文書」を禁止したのか?
-
9
NECが明かす「AIだけの部署」の実態 AI同士で1on1、ストレスチェックで“悩み”も可視化
-
10
“Google弱体化説”にDeepMindエンジニアが反論 「最新モデルはセキュリティでMythos超え」、「Gemini 4」にも言及
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR