NVIDIA、日本語データセットを公開 日本文化など反映した合成ペルソナ600万件 商用利用も可能
米NVIDIAは、日本語の合成データセット「Nemotron-Personas-Japan」を、Hugging Face上で公開した。ライセンスは、商用利用も可能な「CC BY 4.0」。
米NVIDIAは9月23日(現地時間)、日本語の合成データセット「Nemotron-Personas-Japan」を、Hugging Face上で公開した。日本の文化や人口統計などを反映したペルソナ600万件を含んでおり、データやシステムを国内インフラ内で完結させる「ソブリンAI」の開発での利用を想定する。ライセンスは、商用利用も可能な「CC BY 4.0」。
Nemotron-Personas-Japanの開発には、同社の企業向け合成データ作成サービス「NeMo Data Designer」を利用した。同データセットは、日本語で記述された600万件のペルソナを含んでおり、総トークン数は約14億。日本の人口統計や地理的分布、文化的特性などを反映するよう設計しており、各ペルソナには約95万の固有名や、1500以上の職業カテゴリーなどを割り当てた。
なお、同データセットは日本の公的な人口・労働関連の統計データに基づいている一方、全てのペルソナは合成によって作成しているため、個人を特定できる情報は含まれていない。また、個人情報保護法(PIPA)の要件も満たしているという。
同データセットは、ソブリンAIの開発での利用を想定している。例えば、日本の文化的な背景を踏まえた回答ができるAIアシスタント向けのトレーニングデータの作成や、AIシステムが日本の地方と都市、異なる年齢層、教育水準の人々に対し、どのように機能するか評価するためなどに利用できるという。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
OpenAIのアルトマンCEO、AIを基本的人権にする壮大なビジョンを展開
OpenAIのサム・アルトマンCEOが、NVIDIAによる1000億ドル投資発表の翌日、AIインフラを毎週1GW生産する工場建設の構想をブログで公開した。AIへのアクセスは将来の基本的人権になるとし、10GWの計算能力で多様な課題解決を目指す壮大なビジョンを示した。
全エンジニアに個人用AIスパコン「DGX Spark」配布、不動産テック新興 「数千万円規模の投資に」
不動産業界向けのAIサービスを手掛けるトグルホールディングス(東京都港区)が、同社の全エンジニアに、“個人用AIスーパーコンピュータ”をうたう米NVIDIAのデスクトップPC「DGX Spark」を配布すると発表した。オープンな大規模言語モデル(LLM)のチューニングなどを効率化する他、AIの利用に掛かるAPI料金の最適化などを見込む。
Microsoft、OpenAIに頼らない初の自社製基盤モデルと高効率な音声AIを発表
Microsoftは、自社開発のAIモデル「MAI-Voice-1」と「MAI-1-preview」を発表した。前者は高効率な音声生成モデルで、Copilot Labsで試用可能。後者はOpenAIに依存せず開発した初の基盤モデルで、公開テストを開始している。スレイマンCEOは今後の展望を語った。
スパコン「富岳NEXT」、NVIDIAが開発に参加 同社のGPUと富士通のCPUを連携 “世界最高”のAI性能目指す
理化学研究所は、スーパーコンピュータ「富岳」の後継機「富岳NEXT」の開発に、米NVIDIAが参加すると発表した。NVIDIAはGPU基盤に関する設計を担う。これにより、高いAI処理性能の実現を目指す。
AIは「大きい」より「小さい」方がいい──AIエージェントの開発手法、米NVIDIAが主張 LLMをSLMに移行する技術も掲載
米NVIDIA Researchに所属する研究者らは、大規模言語モデル(LLM)を中心に構築されている現在のエージェントAIシステムが、実際の運用では小規模言語モデル(SLM)の方が適しているという主張をした研究報告を発表した。

