NVIDIA、日本語データセットを公開 日本文化など反映した合成ペルソナ600万件 商用利用も可能
米NVIDIAは9月23日(現地時間)、日本語の合成データセット「Nemotron-Personas-Japan」を、Hugging Face上で公開した。日本の文化や人口統計などを反映したペルソナ600万件を含んでおり、データやシステムを国内インフラ内で完結させる「ソブリンAI」の開発での利用を想定する。ライセンスは、商用利用も可能な「CC BY 4.0」。
Nemotron-Personas-Japanの開発には、同社の企業向け合成データ作成サービス「NeMo Data Designer」を利用した。同データセットは、日本語で記述された600万件のペルソナを含んでおり、総トークン数は約14億。日本の人口統計や地理的分布、文化的特性などを反映するよう設計しており、各ペルソナには約95万の固有名や、1500以上の職業カテゴリーなどを割り当てた。
なお、同データセットは日本の公的な人口・労働関連の統計データに基づいている一方、全てのペルソナは合成によって作成しているため、個人を特定できる情報は含まれていない。また、個人情報保護法(PIPA)の要件も満たしているという。
同データセットは、ソブリンAIの開発での利用を想定している。例えば、日本の文化的な背景を踏まえた回答ができるAIアシスタント向けのトレーニングデータの作成や、AIシステムが日本の地方と都市、異なる年齢層、教育水準の人々に対し、どのように機能するか評価するためなどに利用できるという。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
現役組み込みエンジニアがAIを業務利用して分かったこと――期待と限界と現実解
-
2
なぜ「相場の半額」にできた? 「ヒューマノイド界のトヨタ」目指すZEALSの“したたか”な戦略
-
3
「データがない」「スキルがない」「発想が広がらない」 味の素冷凍食品は“3つのない”をどう解消した?
-
4
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
5
「ほんだし」のラベルがAIでぐちゃぐちゃに…… 味の素、公式Xの投稿画像について謝罪
-
6
「MicrosoftよりGoogle」で6億円削減も? 舞鶴市、千代田区が明かすIT刷新とAI活用の成功法則
-
7
業務効率に「不満」6割 なのに最も効くのは「生成AI」でも「ツール」でもなかった
-
8
なぜ「純国産AIは無理」なのか? さくらとSakana AIが示す「ソブリンAI」の現実解
-
9
Claude、Codex、Qwen……そのAI用語、どう読む? 読み方クイズ30問
-
10
「AI進化の裏でモノづくりは30年止まっている」、直列工程を並列化する産業OS
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR