Innovative Tech
生成AIに“生成AIが作った文章”を学習させ続けるとどうなる? 「役立たずになる」と英国チームが報告
Innovative Tech:
このコーナーでは、テクノロジーの最新研究を紹介するWebメディア「Seamless」を主宰する山下裕毅氏が執筆。新規性の高い科学論文を山下氏がピックアップし、解説する。Twitter: @shiropen2
英オックスフォード大学や英ケンブリッジ大学、英インペリアル・カレッジ・ロンドン、米トロント大学に所属する研究者らが発表した論文「The Curse of Recursion: Training on Generated Data Makes Models Forget」は、GPT-4などの大規模言語モデル(LLM)が別のLLMが生成したテキストを学習し続けるとどうなるかを調査した研究報告である。
今後、LLMモデルを使って生成した文章がネット上に溢れかえる未来、それらを多く含むデータをトレーニングする後続のLLMモデルはどうなるかを検証する。
LLMモデルの開発には、大量の学習データが必要になる。ユーザーがLLMモデルを利用して文章を生成するケースが増えており、その結果、多くの文章がインターネット上に公開される。近年の強力なモデルの中には、Web上の情報を学習データとして使用するものもある。将来のモデルの学習データがほとんどがWebからのスクレイピングに頼る場合、前のモデルが生成したデータを学習に使用する必要が生じる。
この研究では、例えばGPTの特定のバージョンから生成したテキストが、後続モデルの学習データセットの大部分を占める場合、どのような影響が生じるのかを調査する。
研究の結果、他のAIモデルの出力を使用してトレーニングしたAIモデルは、大きく偏りが生じ、過度に単純化され、現実との接点を失ってしまうことが明らかになった。その結果、最終的には機能的に役に立たなくなり、モデルが崩壊する可能性を示した。
このエラーは、AIモデルがテキストを統計的に表現する方法に起因する。AIモデルは、フレーズや文を何度も見ることで学習するため、そのフレーズを出力の中で繰り返す傾向が高くなり、まれに見るフレーズを生成する可能性が低くなる。
その後、新しいモデルが他のAIモデルからのテキストでトレーニングすると、元のAIモデルの可能な出力のごく一部しか認識されないという問題が生じる。
トレーニングデータの多様性が十分に確保されていない場合、モデル自体やそのトレーニング方法に欠陥が生じる可能性がある。実際、基礎となるデータを完全に表現することは困難であり、その結果、状況は一層悪化する。
このプロセスがどれくらい早く起こるかは、AIモデルのトレーニングデータ内のAI生成コンテンツの量と、AIが使用するモデルの種類によって異なるが、AI生成のデータにさらされる全てのモデルは最終的に崩壊するという。これはLLMモデルだけでなく、変分オートエンコーダー(VAE)、混合ガウスモデルでも同様の結果が得られた。
これを回避する唯一の方法は、人間が作成した本物のコンテンツへのアクセスが不可欠であり、それを実現するためには、AIモデルが生成した出力にラベルを付けて除外することだという。
Source and Image Credits: Shumailov, Ilia, Zakhar Shumaylov, Yiren Zhao, Yarin Gal, Nicolas Papernot, and Ross Anderson. “Model Dementia: Generated Data Makes Models Forget.” arXiv preprint arXiv:2305.17493(2023).
Copyright © ITmedia, Inc. All Rights Reserved.
Innovative Tech
2019年にスタートした本連載「Innovative Tech」は、世界中の幅広い分野から最先端の研究論文を独自視点で厳選、解説している。執筆は研究論文メディア「Seamless」(シームレス)を主宰し、日課として数多くの論文に目を通す山下氏が担当。イラストや漫画は、同メディア所属のアーティスト・おね氏が手掛けている。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
なぜ酒蔵の許諾なしに? 「VTuberコラボ日本酒」騒動、主催者が経緯説明 仲介者による調整で「準備進んでいると認識」
-
2
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
3
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
4
本物そっくり“AI生成レシート“が経費精算の脅威に マネフォ「自力で見破るのは難しい」 企業はどう備える?
-
5
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
6
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
7
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
8
松本デジタル相、24.6万件漏えい可能性について説明 「既知の脆弱性を対応前に悪用」
-
9
「iPhone Duo」純正ケース話題、「面白いけど高い」……1万4800円と2万4800円
-
10
「ランジェリーパープルじゃない」「買おうと思ってたのに」 iPhone 18 Pro/Pro Maxの色に落胆の声
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR