Innovative Tech
口パクの顎の動きで音声認識 イヤフォンに後付け可能
Innovative Tech:
このコーナーでは、テクノロジーの最新研究を紹介するWebメディア「Seamless」を主宰する山下裕毅氏が執筆。新規性の高い科学論文を山下氏がピックアップし、解説する。
米ニューヨーク州立大学ストーニーブルック校、インド工科大学ガンディーナガル校、米カリフォルニア・マーセッド大学、米テキサス大学アーリントン校による研究チームが開発した「JawSense」は、顎(あご)の動きで音声認識する音声コマンド・ウェアラブルデバイスだ。
このデバイスは耳に装着し、音声認識をハンズフリーで行う。ヘッドフォンやイヤフォンへの後付けも可能だ。
音声入力は、公共の場で使用する場合、機密情報漏えいやプライバシーの侵害の恐れがある。また、ノイズの多い環境では安定して使用できない。研究チームは、これら課題を解決するため、発話時に確実に動作する顎に着目した。
今回の研究は、顎を動かすだけでコンピュータとの対話が行えるインタフェースを構築する。顎の動きと音素の関係をモデル化し、9つの音素を認識するための分類アルゴリズムを開発。発話時に発生する顎や頬の筋肉からの運動信号を利用し、音声なしの音素を認識する。
プロトタイプは、顎関節付近に3軸加速度センサーを配置する耳かけ型ハードウェアで構成。顎の動きは、顎関節付近の皮膚表面に搭載した3軸加速度センサーで捉える。うなずき、頭の動き、あくびなど、人の動きに起因する非音声信号と外部からの可聴音によるノイズを抽出し除去する前処理を行う。
声を出して話しているのか口パクなのかを区別するために、周波数スペクトルを解析して可聴音素を検出し、音声付き音素か音声なし音素かを区別する。
6人の被験者を対象に、9つの音素について実験したところ、騒がしい環境であるにもかかわらず、音声なし音素検出で92%の分類精度を達成したという。今後は、より小さなフォームファクターでの連続音声認識を目指す。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
Google、「Googlebook」の予約受付開始 899ドル(約14万円)から
-
2
新作「鬼武者」にハマったマンガ家が熱弁する、他とは違う“パリィ”の魅力とは?
-
3
OpenAI、数学者の独立諮問グループと連携 内部モデルは「100件超の未解決問題を解決」
-
4
経営「AIでラクして早く帰って」→社員「帰らない」 工数最大9割減のDeNAも悩むAI効率化の壁
-
5
OpenAI、フロンティアAIの国際標準づくりを米国主導で進めるよう提言 「RSIはまだ起きていない」
-
6
Amazon、MetaのAIエージェント「Muse」による代理購入をブロック Shopifyは全店舗で対応へ
-
7
“自動で耳コピ”アプリ、ヤマハが無料公開 音源読み込み→3分でピアノ譜に
-
8
肖像画をChatGPTに読み込ませて出力→加工して納品 委託先による著作権侵害で、小学館「サライ.jp」が謝罪
-
9
SpaceXAI、「Grok 4.7」発表 コーディングと知識労働向けで同社最高性能、価格は据え置き
-
10
今度は“ディスプレイなし”のAIグラス、「Rokid Ai Glasses Style」を試す
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR