Microsoft、初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」公開 音声合成「MAI-Voice-2.1」と高速版も
米MicrosoftのAI部門Microsoft AI(MAI)は10月1日(現地時間)、同社初のストリーミング型文字起こしモデル「MAI-Transcribe-2-Streaming」と、音声合成(TTS)モデル「MAI-Voice-2.1」、その高速版「MAI-Voice-2.1-Flash」を発表した。いずれも「Microsoft Foundry」でパブリックプレビューとして提供する。人と音声で対話する「音声エージェント」の構築を想定したモデル群だ。
MAI-Transcribe-2-Streamingは、話している最中に文字起こし結果を逐次返す低遅延モデルで、日本語を含む60言語に対応し、話されている言語を自動で判別する。音声の受信から100ミリ秒強で暫定的な認識結果を返し、文脈に応じて修正しながら確定させるため、音声エージェントが相手の発話の途中で処理を始められるという。AI評価機関Artificial Analysisの評価で精度1位になったとしている。料金は年末までの導入価格として音声1時間当たり0.54ドルだ。
MAI-Voice-2.1は23言語に対応する多言語TTSモデル。1つの声のまま言語を切り替えても、各言語のネイティブのアクセントで話せるのが特徴という。料金は100万文字当たり22ドル。高速版のMAI-Voice-2.1-Flashは、45秒の音声を150ミリ秒の遅延で生成でき、同等のモデルと比べて約60%安価だとしている。料金は100万文字当たり15ドルという設定だ。
2つのVoiceモデルは、数秒の参照音声から声を複製する機能も備えるが、利用には審査を経たアクセス承認が必要で、本人の同意を得た声しか合成できない仕組みを組み込んだとしている。なお、発表文に掲載されている既定音声の一覧には、現時点で日本語は含まれていないが、モデルの提供リージョンには東日本(Japan East)も含まれる。
3モデルはFoundryのほか、「MAI Playground」やVercelなどでも利用でき、MAI Playgroundでは3モデルを組み合わせた音声エージェントのデモ「Chatter」も公開されている。日本語で話しかけると内容を認識するものの、応答の設定に日本語はなく、例えば英語で返答する仕様だ。
音声AIを巡っては、米OpenAIが5月にストリーミング文字起こし向けの「GPT-Realtime-Whisper」を、米Googleが9月に会話を止めずに裏でタスクを実行できる「Gemini 3.8 Live」を発表している。米Metaも昨年11月に、1600以上の言語に対応する音声認識「Omnilingual ASR」をオープンソースで公開している。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
佐川急便、不正アクセスで個人情報流出か 送り主・届け先の氏名や住所など、約100日分の荷物データ対象
-
2
免許証の悪用防止で申し込み集中 JICCがアプリ受付を一時休止 タイムズカー漏えいの影響か
-
3
睡眠中に「ピンクノイズ」を聞くと“脳内ゴミ”の洗い流しが強まる? 米MITが人間で実験 Science系列誌で発表
-
4
「写真で一言 ボケて」きょう午後8時にサービス終了 18年・1億超のボケに幕
-
5
免許証の悪用防ぐ届出集中、CIC・JICCで手続き遅延 タイムズカー情報流出直後に
-
6
ドラッグ&ドロップ操作ミスで……TOPPAN、損保ジャパン契約者17万人分のデータを他社に誤送付
-
7
アンケート結果をダウンロードしたら他社の従業員情報が…… ベネフィット・ワン、1万3460人分漏えい
-
8
日本原子力機構に不正アクセス 研究者の顔写真付き身分証など漏えい
-
9
セイコーマート、会員のほぼ半数に当たる情報漏えい 約57万人分
-
10
「Gポイント」不正アクセスで一時停止 「会員識別子」約7万件漏えいか KDDI不正会計問題のジー・プランが運営
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR