Google、次世代音声AI「Gemini 3.1 Flash TTS」 自然言語で表現を制御可能に
米Googleは4月15日(現地時間)、自然な音声を生成するAIテキスト読み上げモデル「Gemini 3.1 Flash TTS」(TTSはText-to-Speechの略)を発表した。開発者向けには「Gemini API」および「Google AI Studio」で、企業向けには「Vertex AI」でプレビュー提供されるほか、Google Workspaceユーザーも「Google Vids」を通じて一部の機能を利用できる。
ユースケースとしては、開発者や企業、一般ユーザーによる次世代のAI音声アプリの構築などが挙げられる。新たに導入された「音声タグ」機能により、自然言語のコマンド(「ゆっくり話す」「ささやくように」など)をテキストに直接埋め込むことで、声のスタイルや話すペース、表現方法を細かく制御できるのが特徴だ。これにより、日本語を含む70以上の言語で、複数話者による自然な会話劇の設定や、表現力豊かで没入感のある音声体験を作り出せるとしている。
ベンチマークでは、人間のブラインドテストによる好みを集計した「Artificial Analysis TTS」リーダーボードで1211という高いEloスコアを記録した。さらに、高品質な音声生成能力と低コストという理想的なバランスを両立しているとして、同ベンチマーク内で「most attractive quadrant」(最も魅力的な象限)に位置づけられるなど、高い評価を受けている。
安全性の面では、このモデルで生成されたすべての音声に電子透かし技術「SynthID」が適用される。人間の耳には聞こえない透かしを音声データに直接埋め込むことで、AI生成コンテンツであることを確実に検出し、誤情報の拡散を防ぐ仕組みとなっている。これに加えて、GoogleのAI原則や安全に関するポリシーに基づき、開発段階から社内チームによる安全性評価やレッドチーム演習を実施しているという。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
FANZAで「成人向けAIコンテンツ制作サービス」開始 8月24日から先行体験
-
2
Anthropic、「ミュトス 5」を脆弱性スキャンに開放──「Claude Security」経由でEnterprise顧客が利用可能に
-
3
エイベックス松浦会長、noteの“バズり記事”を「ほぼAI」で作成 「僕の60年分のデータを入れた」
-
4
「たった14人」の挑戦から7兆円の逆転劇へ ラピダス小池社長の「TSMCとは戦わない」2ナノ半導体の勝算
-
5
「孫さんはOpenAIだが、僕はAnthropic」 SBI北尾会長が語る「AI投資5億円→増収27億円」の勝算
-
6
「Gemini Notebook」で利用者10倍 シニア社員をAIヘビーユーザーにした首都高の考え
-
7
中国AI「Kimi」が日本進出か 有料プランのプレゼントキャンペーンも 「はじめまして、日本」
-
8
現役組み込みエンジニアがAIを業務利用して分かったこと――期待と限界と現実解
-
9
フィジカルAIとヒューマノイドの可能性、PFNの見立てとトヨタのアプローチ
-
10
GoogleはAI競争に負けたのか 「最強のAI」ではなく「AIの“電力網”」を選ぶ賭け
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR