AIが作った画像が喋る 動画生成サービス「Creative Reality Studio」登場 「GPT-3」「Stable Diffusion」を利用
生成系AIの開発などに取り組むイスラエルのD-IDは12月14日、画像が喋る動画を生成できるサービス「Creative Reality Studio」を開発したと発表した。プロンプトを基に、AIが画像や喋らせたい内容を生成。それらを自動合成し、動画として出力する。
無料プランでの利用は20クレジット分まで、有料プランは月額5.99ドルからで企業向けプランも用意している。記者も無料プランで利用してみた。まずはアバター画像生成のために「android girl,blue eyes」と入力したところ、以下のような画像を生成できた。
次に喋らせる内容を生成するため「PCとは何ですか?」と入力した。すると「PCは、プログラミング言語『C++』をベースにした機器で、コンピューターやソフトウェア開発に関する技術を使っています。PCは、家庭用やビジネス用、携帯電話用など幅広く利用されています」(原文ママ)という文章を生成した。
読み上げの言語設定を日本語に設定したところ、男性ボイス「Keita」と女性ボイス「Nanami」の2種類のボイス候補が出現。またNanamiを選んだ場合、「chat」「customerservice」「cheerful」の3種類から具体的な読み上げ方を選ぶことができた。今回は、cheerfulを選択。これらの条件で作成した動画が以下のものになる。なお、動画化には2クレジットを消費した。
Creative Reality Studioでは、D-ID独自のディープラーニング技術の他、文章の生成には米Open AIの「GPT-3」、画像の生成には英Stability AIの「Stable Diffusion」を利用しているという。テキストの読み上げは日本語など119の言語に対応している。
画像についてはテンプレートを複数用意している他、写真をアップロードして利用可能。音声についても、ユーザーが入力した文章をそのまま読ませることができる他、事前に収録した音声データをアップロードして利用することもできる。
D-IDは「このサービスを利用することで、動画コンテンツ制作のコストと手間を根本的に削減できる。ブランドや企業、クリエイターなど多くの人たちは、1枚の画像を使って魅力的な動画を簡単に作成できる」と説明。
同社のギル・ペリーCEOは「クリエイティブなジェネレーティブAI技術の可能性はまだ始まったばかりで、これから世界を席巻していくだろう。このプラットフォームを生み出し、新たなジェネレーティブAIシーンの最先端にいることを大変誇りに感じている。ユーザーの皆さまの成果を楽しみにしている」とコメントしている。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
日本人の大腸がん、約半数に“腸内細菌の毒素”が関与 40歳以下の発症は7割 東大・阪大が200人を全ゲノム解析
-
2
「コミューン」不正アクセスでLINEヤフー、Sansan、パナソニックでも会員情報漏えいの可能性
-
3
「お前たちのクラウドはわれわれのもの」 IDCFクラウドの管理画面に出た攻撃者のメッセージ 内容に運営元は
-
4
履歴書100通に1通「AIだけが読める文字」 20万件調査でわかった“就活ハック”の手口 米研究
-
5
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
6
山中で遭難の16歳少年、登山計画に生成AI「Claude」利用 救助隊は「ルートの妄信」警鐘
-
7
JR東日本、「えきねっと」「ビューカード」などで漏えいか メルアドなど最大609万件 IDCFへの不正アクセスで【追記あり】
-
8
SBI証券、Google・Appleパスキー乗っ取り被害「確認されていない」 注意喚起は他社事案
-
9
OpenAI、安全性研究者3人を解雇 本人らは「安全性を優先したため」と主張、同社は「機密情報の扱いに関する規定違反」と説明
-
10
ブックオフに不正アクセス、最大約643万件の個人情報流出 氏名、住所、ハッシュ化パスワードなど
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR