Innovative Tech
読唇術で音声入力 スマホで口パクを自撮りし音声に変換「LipType」
Innovative Tech:
このコーナーでは、テクノロジーの最新研究を紹介するWebメディア「Seamless」を主宰する山下裕毅氏が執筆。新規性の高い科学論文を山下氏がピックアップし、解説する。
米カリフォルニア大学マーセド校の研究チームが開発した「LipType」は、音のない口パク映像を音声に変換する、深層学習を用いた読唇システムだ。スマートフォンのインカメラで口パクを自撮りして、話者の唇の動きを読み取る。
音声認識は、周囲が騒がしい場合には信頼性が低く、図書館や電車内などではプライバシーやセキュリティが損なわれる。声が出せない障害のある人はそもそも音声認識が使えない。
解決策としては、口パクのような無声発話による音声入力が挙げられる。無声発話時に動く顎の動きを捉えて音声に変換するものや、無声発話時に顎の下に設置したセンサーから皮膚が変動する顎運動と舌筋の運動を計測し音声に変換するものなど、さまざまな角度から研究されている。
今回の手法では、唇の動きだけの音声なし映像を、意図した音声に変換する。既存の深層学習読唇モデル「LipNet」を最適化して速度と精度を向上させ、照明条件が悪い状況でも処理が行える修復モデルを開発し組み合わせた。
読唇モデルは、エンドツーエンドの深層学習ネットワークを用い、唇の配列を自動的に分割しテキストに分類。唇が映るビデオフレームのシーケンスを受け取りフレームごとに特徴ベクトルを出力するモジュールと、フレームごとの特徴ベクトルのシーケンスから1文字ずつ出力するモジュールの2段階で構成する。
データセットには発話しているときの人の顔で構成する短いビデオクリップ、訓練用2万1635本、テスト用7140本を用いた。学習したモデルを比較した結果、入力速度、精度、計算時間のいずれにおいても、LipTypeがLipNetを上回ったという。
修正モデルは、入力映像の照明条件の悪さと認識における潜在的なエラーを考慮した複数段階にわたるパイプラインで、照明条件の悪い映像を補正する前処理ステップと、潜在的なエラーを自動的に検出・修正する後処理ステップを含む。
この修正モデルはLipType以外の音声認識モデルにも適応できるのが特徴。主要な音声認識モデルで試したところ、全てのモデルのエラー率を大幅に低減したという。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
なぜ酒蔵の許諾なしに? 「VTuberコラボ日本酒」騒動、主催者が経緯説明 仲介者による調整で「準備進んでいると認識」
-
2
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
3
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
4
本物そっくり“AI生成レシート“が経費精算の脅威に マネフォ「自力で見破るのは難しい」 企業はどう備える?
-
5
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
6
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
7
早すぎる 「めっちゃカメレオン」Switch 2版、即日10万本突破
-
8
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
9
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
-
10
「ランジェリーパープルじゃない」「買おうと思ってたのに」 iPhone 18 Pro/Pro Maxの色に落胆の声
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR