Meta、初のリアルタイム音声認識モデル「Muse Voice Transcribe」 20人超の話者識別と多言語混在に対応

ストリーミング音声認識のWER(左)と平均誤り率(DER)(右)の比較。いずれも数値が低いほど高精度(画像:Meta)

記事に戻る