Meta、初のリアルタイム音声認識モデル「Muse Voice Transcribe」 20人超の話者識別と多言語混在に対応
米Metaは9月1日(現地時間)、Meta Superintelligence Labs(MSL)が開発した初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表した。「Meta Model API」での価格は1時間当たり0.18ドルで、同日から提供している。
ストリーミングASR(音声認識)に加え、話者分離(ダイアライゼーション)と発話終了検知(エンドポインティング)を単一モデルで処理する。20人以上の話者を区別でき、1時間を超える音声にも後処理なしで対応する。学習に使った言語は70以上で、うち25言語を初期リリース時点で検証済みとしている。検証済み言語の例には日本語も挙げられている。1つの文の中で言語が切り替わる「コードスイッチング」もネイティブに扱い、言語、キーワード、文脈のバイアス指定で認識精度を高められるという。
技術面では、「Muse Spark」ファミリーの自己回帰型マルチモーダルモデルという位置付けだ。音声を80ミリ秒(12.5Hz)単位のチャンクで処理し、各チャンクで「次の音声を聞き続ける」か「テキストを出力する」かをモデル自身が判断する。単語ごとに難易度に応じて待機時間を変える「適応的ディレイ」を強化学習で獲得させ、精度と遅延のトレードオフを改善したとしている。
性能について同社は、Artificial Analysisのストリーミング音声認識ランキングと公開されている話者分離ベンチマークで1位としている。Artificial Analysisによると、確定文字起こしの単語誤り率(WER)は3.1%で、発話終了からの遅延は0.16秒にとどまり、Cartesia Ink-2(3.4%)やElevenLabsのScribe v2 Realtime(3.6%)を上回った。話者分離の平均誤り率は17.5%としている(いずれも9月1日時点の比較)。
APIとして開発者に提供する「Meta Model API」のほか、Mac版「Meta AI」とコーディング製品「Muse Code」で利用できる。
Meta AIとMuse Codeの音声入力機能は同モデルに切り替わっており、Macでは[Fn]キーを押している間、任意のアプリケーション上で音声入力を使えるとしている。
なお、公式ブログにモデルの重み公開についての言及はない。現時点での提供はMeta Model APIと自社アプリ経由に限られる。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
「pixiv」「note」「ガルちゃん」などが国指定の“大規模プラットフォーム”に 誹謗中傷への迅速対応求める
-
2
EXILE・HIROのGMO系イベント関与に抗議の声 Xでハッシュタグ拡散 米軍事IT企業の参加などで反発
-
3
原宿に現れた「歩くゴミ箱」、正体は学生発の広告サービス 「良いアイデア」とSNSで話題
-
4
ティム・クック氏、Apple CEOとしての最後の日にメッセージ 「一生に一度の特権だった」
-
5
「よりによって月末に」 サイボウズ「kintone」「Garoon」などで2時間にわたり障害
-
6
生成AI画像はなぜ“キショい”のか 消費者が抱く違和感の正体 広報のプロが解説
-
7
Anthropic、「Claude Fable 5.1」と「Claude Mythos 5.1」発表 「監視の難しさ」への懸念も開示
-
8
東大、「価値創造学部」新設へ 27年秋入学、授業はすべて英語
-
9
スクエニHD、非公開化報道を否定 「検討している事実はない」
-
10
ガラケー型トイカメラで“平成にやり残したこと”に挑戦できるらしい
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR