AIが作った画像が喋る 動画生成サービス「Creative Reality Studio」登場 「GPT-3」「Stable Diffusion」を利用
生成系AIの開発などに取り組むイスラエルのD-IDは12月14日、画像が喋る動画を生成できるサービス「Creative Reality Studio」を開発したと発表した。プロンプトを基に、AIが画像や喋らせたい内容を生成。それらを自動合成し、動画として出力する。
無料プランでの利用は20クレジット分まで、有料プランは月額5.99ドルからで企業向けプランも用意している。記者も無料プランで利用してみた。まずはアバター画像生成のために「android girl,blue eyes」と入力したところ、以下のような画像を生成できた。
次に喋らせる内容を生成するため「PCとは何ですか?」と入力した。すると「PCは、プログラミング言語『C++』をベースにした機器で、コンピューターやソフトウェア開発に関する技術を使っています。PCは、家庭用やビジネス用、携帯電話用など幅広く利用されています」(原文ママ)という文章を生成した。
読み上げの言語設定を日本語に設定したところ、男性ボイス「Keita」と女性ボイス「Nanami」の2種類のボイス候補が出現。またNanamiを選んだ場合、「chat」「customerservice」「cheerful」の3種類から具体的な読み上げ方を選ぶことができた。今回は、cheerfulを選択。これらの条件で作成した動画が以下のものになる。なお、動画化には2クレジットを消費した。
Creative Reality Studioでは、D-ID独自のディープラーニング技術の他、文章の生成には米Open AIの「GPT-3」、画像の生成には英Stability AIの「Stable Diffusion」を利用しているという。テキストの読み上げは日本語など119の言語に対応している。
画像についてはテンプレートを複数用意している他、写真をアップロードして利用可能。音声についても、ユーザーが入力した文章をそのまま読ませることができる他、事前に収録した音声データをアップロードして利用することもできる。
D-IDは「このサービスを利用することで、動画コンテンツ制作のコストと手間を根本的に削減できる。ブランドや企業、クリエイターなど多くの人たちは、1枚の画像を使って魅力的な動画を簡単に作成できる」と説明。
同社のギル・ペリーCEOは「クリエイティブなジェネレーティブAI技術の可能性はまだ始まったばかりで、これから世界を席巻していくだろう。このプラットフォームを生み出し、新たなジェネレーティブAIシーンの最先端にいることを大変誇りに感じている。ユーザーの皆さまの成果を楽しみにしている」とコメントしている。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
2
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
3
デジタル庁に不正アクセス、個人情報24.6万件漏えいか 各府省庁の職員情報など
-
4
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
5
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
-
6
iPhone 18シリーズ発表、今年はPro・Pro Maxのみ なんと“無印”なし 価格は21万9800円から
-
7
「iPhone Duo」発表 Apple初の折りたたみスマホ 36万4800円から
-
8
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
9
「ペンギンを返して」 Suica新キャラ候補3案公開でSNSに戸惑いの声 一般投票は8日から
-
10
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR