サイバーエージェント、日本語に強い“視覚言語モデル”公開 パラメータ75億、商用利用もOK
サイバーエージェントは6月13日、75億パラメータの日本語大規模視覚言語モデル(Vision Language Model、VLM)を一般公開した。Hugging Faceで商用利用可能なAIモデルや、研究用途でのみ使えるデモを公開中だ。
VLMとは、画像とテキストを複合して扱えるマルチモーダルなAIモデル。画像とテキストを理解できることで「この写真に写っているものは何ですか?」のような質問にも対応できる。米OpenAIの「GPT-4o」などが代表的なモデルで、近年では画像を扱えるAIモデルの進化が急速に進んでいる。
一方で「VLMのほとんどは英語のデータを中心に学習しており、日本文化の理解や日本語での会話に強いVLMは少ない状況」とサイバーエージェントは説明する。このような背景から同社は日本語に強いVLMを公開。日本語大規模言語モデルで合成して作ったデータセットをメインに学習させたという。
サイバーエージェントは「公開したモデルをベースとしてチューニングすることで、画像を加味した対話AIなどの開発も可能。これにより、より多くの人々が日本語VLMに関する最先端の研究開発に取り組んでもらえる」と説明。同社は今後もVLMの開発とビジネス活用を進めるという。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
「きもい」「内部資料そのまま」と話題のAI生成掲示物についてセブンイレブンに聞いてみた 「本部提供ではない」
-
2
なぜ現場でAIを使いこなせるのか、パナソニック インダストリー山口拠点の10年
-
3
「APIキーは.envに」はもはや通用しない AIエージェントの“内通者化”をどう防ぐ?
-
4
Google、会話を止めずに裏でタスクを実行する音声モデル「Gemini 3.8 Live」公開 推論強化の上位版も
-
5
推論領域への野心強めるNVIDIA 韓国新興と協議か
-
6
富士通、国産CPU「モナカ」販売 スパコン技術を結集した“小さなチップ”に託す「3兆円のAIビジネス」の行方
-
7
OpenAI、AI安全性でAnthropic、Google DeepMindと協議中──Bloomberg報道
-
8
「ブラウザを開く手間」を解消 作業画面に直接呼び出せるWindows版「Gemini」公開
-
9
トランプ氏が「AI減速」を一蹴 OpenAI「IPO延期」に政権幹部が冷ややかなワケ
-
10
「監視されていないときのAIは、もう評価できない」 OpenAI現役研究者が個人声明
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR