Google、1人の声を聞き分ける「カクテルパーティー効果」ディープラーニングモデル
米Googleは4月11日(現地時間)、会話や騒音が多い中などの動画から、1人の人の声を分離するディープラーニングモデルについての論文「Looking to Listen at the Cocktail Party」を発表した。
人間は、パーティー会場のような複数の会話が進行している中でも、自分が聴きたい声を自然に聞き取る選択的聴取能力があり、一般に「カクテルパーティー効果」と呼ばれる。これを、ディープラーニングで再現しようというものだ。
サンプルの動画では、2人の男性がステージで同時に同じくらいの声量で話しているものを、一人ずつの声に切り分けて字幕をつけることに成功している。下の画像で、最初は2人同時の音声、右の男性の顔に枠が付いた段階では右の男性の声だけ、左の男性の顔に枠が付いた段階では左の男性の声だけが聞こえる。
この動画の音源はステレオではなく、ディープラーニングモデルが音声を切り分けている。このモデルでは音声だけでなく映像が重要で、例えば人物の口が動き出したことを検出してどちらの声かを判断しているという。
同社はこのディープラーニングモデル構築のためにYouTube上のスピーチや会話の約10万本の動画を集めて約2000時間分の雑音のない音声を抽出し、それに人工的な雑音を追加することで人工的なカクテルパーティー動画を作成。それらの動画で話している人の「face thumbnail」と動画の音声から話している人の音声を切り分けるよう学習を繰り返した。
この技術は動画のキャプション追加に役立ちそうだ。Googleは、将来的には同社の様々なサービスで利用していく計画としている。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
2
くら寿司、10%割引の“適用漏れ”を謝罪 レシート持参で返金へ ちいかわコラボのお詫び施策
-
3
「ペンギンを返して」 Suica新キャラ候補3案公開でSNSに戸惑いの声 一般投票は8日から
-
4
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
-
5
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
6
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
7
Duolingoの新アイコンが「気持ち悪い」 世界のユーザーから「元に戻して」の声
-
8
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
9
大雨で「首都圏外郭放水路」稼働 濁流が“地下神殿”を満たすまでの動画公開 国交省
-
10
5年ぶりの「PEN」、OM SYSTEMロゴになって登場 EVFを搭載、初の防塵・防滴仕様に
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR