ITmedia AI＋
生成AI
NVIDIA、日本語データセットを公開　日本文化など反映した合成ペルソナ600万件　商用利用も可能

NVIDIA、日本語データセットを公開　日本文化など反映した合成ペルソナ600万件　商用利用も可能

公開 2025年09月24日 15時56分

[ITmedia]

印刷する

　米NVIDIAは9月23日（現地時間）、日本語の合成データセット「Nemotron-Personas-Japan」を、Hugging Face上で公開した。日本の文化や人口統計などを反映したペルソナ600万件を含んでおり、データやシステムを国内インフラ内で完結させる「ソブリンAI」の開発での利用を想定する。ライセンスは、商用利用も可能な「CC BY 4.0」。

　Nemotron-Personas-Japanの開発には、同社の企業向け合成データ作成サービス「NeMo Data Designer」を利用した。同データセットは、日本語で記述された600万件のペルソナを含んでおり、総トークン数は約14億。日本の人口統計や地理的分布、文化的特性などを反映するよう設計しており、各ペルソナには約95万の固有名や、1500以上の職業カテゴリーなどを割り当てた。