日本語に強い大規模言語モデル「Swallow」 産総研と東工大が公開 事前学習用の日本語データに工夫
産業技術総合研究所と東京工業大学の研究チームは12月19日、日本語に強い大規模言語モデル(LLM)「Swallow」を公開した。米Metaが開発したLLM「Llama 2シリーズ」をベースに日本語能力を改善させたもの。ライセンスは「LLAMA 2 Community License」で、研究や商業目的で利用できる。
今回公開したのは、パラメータ数が70億(7B)、130億(13B)、700億(70B)のモデル3種類。Llama 2シリーズが持つ高い言語処理能力を維持しながら日本語能力を強化することを目指した。
このため、AIモデルに日本語の文字や単語などの語彙を追加し、新たに開発した日本語データで継続事前学習(学習済みのLLMに対して追加で事前学習を行う手法で、異なる言語などで言語モデルを活用するときに使われる)を行った。結果、日本語に関するベンチマークデータで、全モデルがベースモデルよりも高い性能を示したという。
着目したのは日本語データセット
研究チームが今回着目したのは、事前学習に使った日本語データだ。従来の日本語LLMの学習には「CC-100」「mC4」「OSCAR」などの既存のデータセットの日本語部分を使っていた。しかし、これにはWebページのHTMLをテキスト化する際のノイズが混入したり、最新の情報や知識を収録していなかったりする問題があった。また、もともと多言語のデータセットであるため、日本語に特化してデータの品質を高める工夫がなかった。
そこで研究チームは、Webサイトを収集してアーカイブを無償公開している非営利団体「Common Crawl」が配布しているアーカイブ(2020~2023年に収集した約634億ページ)から日本語のテキストを独自に抽出・精錬し、約3121億文字(約1.73億ページ)からなる日本語のデータベース(コーパス)を構築した。これは商用利用が可能なものとしては最大規模であるという。
研究チームは「今回のモデル公開によって、高度な日本語処理が求められる日常生活・産業現場のより多くの場面で、対話システムなどのAI技術の利活用を推進できる」と成果を説明。日本でのLLMの研究開発・活用がさらに進み、製品開発や技術革新が進むことを期待している。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
2
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
3
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
4
デジタル庁に不正アクセス、個人情報24.6万件漏えいか 各府省庁の職員情報など
-
5
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
-
6
iPhone 18シリーズ発表、今年はPro・Pro Maxのみ なんと“無印”なし 価格は21万9800円から
-
7
「iPhone Duo」発表 Apple初の折りたたみスマホ 36万4800円から
-
8
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
9
「ペンギンを返して」 Suica新キャラ候補3案公開でSNSに戸惑いの声 一般投票は8日から
-
10
「すばやさがあがるリュック」など……ドラクエ商品予約にアクセス集中、エラー連発→完売 グラニフ謝罪、追加受注へ
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR