官庁出版物30万点、AIモデルに活用へ 国会図書館がNIIに提供
国立国会図書館は10月1日、国立情報学研究所(NII)に対して、官庁出版物のテキストデータを提供することで合意したと発表した。1995年までに刊行された図書が中心で、この他雑誌や官報など約30万点を、NIIが構築を進める大規模言語モデル(LLM)の学習用データとして活用する。
9月5日付で合意を結んだ。出版物のデジタル化画像からOCR(光学文字認識)技術で作成した全文検索用データを提供し、NII内の大規模言語モデル研究開発センターで利用できるようにする。
大規模言語モデル研究開発センターは、NIIが2024年4月に開設。研究開発用LLMの構築に加え、透明性・信頼性の確保や高度化に向けた研究開発を進めている。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
個人向けGeminiのモデル選択が厳格化 無料ユーザーが使えるのは「Flash-Lite」のみに
-
2
大阪公立大、システム障害で1週間近く休講に 出願期間中で入試にも影響
-
3
日経社員のGoogle Workspaceに不正ログイン 1646人分の個人情報漏えいか
-
4
「Androidのマイナンバーカード」提供へ 20日から 物理カードなしでも本人確認など可能に
-
5
「OpenAIの文化は壊れている」──安全性報告書を統括した従業員が退社し、寄稿
-
6
タイムズカー漏えいで集団訴訟の動き、登録3000人弱 呼び掛けた弁護士に聞いた──「謝罪で済む案件ではない」
-
7
渋谷区でシステム障害、窓口業務を縮小 復旧の見通し立たず
-
8
日本交通、不正アクセスで停止していた「電話でタクシー配車」再開へ 約3カ月ぶり
-
9
「SpaceXAI」→「SpaceXSI」に改名へ マスク氏、トランプ大統領の“AI呼称廃止”に追随
-
10
再び浮上した「クレカ表現規制問題」 クリスタやpixiv FANBOXの騒動からマンガ家が感じた不安と焦り
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR