事例で学ぶAIガバナンス
ChatGPTは「ハリー・ポッター」を読破済み? 生成AIで懸念される著作権侵害のリスクとは(2/3 ページ)
ChatGPTも「ハリー・ポッター」を読んでいた?
生成AIはそれが依拠するモデルを構築する際に、大量のデータを収集し、トレーニングに使用する。その際に著作物が混入してしまうわけだが、訓練データにどのような内容が含まれているかは明らかにされないことも多い。
例えばChatGPTの場合、使用しているモデルはLLM(Large Language Model:大規模言語モデル)のGPT-3.5、あるいはGPT-4だ。どちらのバージョンについても、OpenAIは使用した訓練データの詳細を明かしていない。
その訓練データの中に、他者の著作物が勝手に取り込まれているのではないか。そのような指摘は以前からあり、実際にそれを裏付けるような主張や研究結果も現れている。
米Amazonもこの点において注意を払っているようだ。ビジネスメディア「Insider」が独自に入手したというAmazonの内部文書によると、同社の顧問弁護士が社員に対し、ChatGPTに機密情報を入力しないよう要請したという。
その理由は「同社内の既存資料に極めて近い出力結果が表示されるのを目にしたから」というもの。この主張を裏付ける証拠は示されていないが、仮に弁護士の発言が事実であれば、一企業の内部文書をOpenAIが勝手にモデル開発に利用し(この時点で大きな問題だ)、さらにその内容が「これは我が社の資料だ」と認識できるほど似た形で出力されたことになる。
また米カリフォルニア大学バークレー校の研究者らは、GPT-4の訓練データの中に、大人気ファンタジー小説「ハリー・ポッターと賢者の石」など著名な小説コンテンツが含まれている可能性が高いとする論文を発表している。
この論文では、次のような実験が行われている。まず1749年から2020年までに出版された小説571作品から、文章の一部を抽出する。そしてそこに含まれる名称の名前を隠してGPT-4などのLLMに与え、隠された部分を予測させる。その結果が正しいかどうかを確認することで、サンプルとなった小説をどの程度LLMが記憶しているかを把握する、というものだ。
結果、GPT-4が記憶している度合いが大きかった小説として、前述の「ハリー・ポッターと賢者の石」や「不思議の国のアリス」「1984」「フィフティ・シェイズ・オブ・グレイ」などが確認されたという(全571作品の結果をこちらのGoogle Docs上で確認できる)。
Copyright © ITmedia, Inc. All Rights Reserved.
事例で学ぶAIガバナンス
AIを本格的に業務に取り入れ、大きな効果を得たいと考える企業の数は日本でも着実に増えている。一方、米国企業に比べて「AIガバナンス」の導入は遅れていると指摘する声もある。AIを開発・利用するに当たり、どのようなガバナンスが必要になるのか。実際の事例を基に考える。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
なぜ酒蔵の許諾なしに? 「VTuberコラボ日本酒」騒動、主催者が経緯説明 仲介者による調整で「準備進んでいると認識」
-
2
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
3
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
4
本物そっくり“AI生成レシート“が経費精算の脅威に マネフォ「自力で見破るのは難しい」 企業はどう備える?
-
5
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
6
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
7
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
8
「iPhone Duo」純正ケース話題、「面白いけど高い」……1万4800円と2万4800円
-
9
松本デジタル相、24.6万件漏えい可能性について説明 「既知の脆弱性を対応前に悪用」
-
10
デジタル庁に不正アクセス、個人情報24.6万件漏えいか 各府省庁の職員情報など
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR