小寺信良のIT大作戦

立ち話が“宝の山”に 8人の声を聞き分けられたAI文字起こし「Klang」の実力(2/2 ページ)

アプローチが異なる話者分離技術

 Klangの特徴は、話者分離にありそうだ。一般的に話者識別の標準的なアプローチは、録音された音声を「話者埋め込み」、つまり声の響きをあらわす数値のリストに変換することである。同じ人物と思われる音声には近い数値が埋め込まれる。別の話者に対しては、離れた数値が埋め込まれる。

 このアプローチの特徴は、話されている内容に関する要素は無視されるということだ。つまり純粋に声の質や響きから話者を分離する。しかしこの方法は、録音の揺れに左右される。例えば途中でレコーダーの位置が変わったり、相手の位置や距離が変わったりすると、録音状態が変わるので、同一人物であっても近い数値にはならなくなる。

 そこでKlangが採ったアプローチは、会議をまたいで同一人物を追うため、話者埋め込みの変動が「どの程度異なるか」だけでなく、「どのように異なるか」まで踏み込むという方法である。公開されているソースから約8000の異なる声を集めたデータセットを作成し、それぞれについて埋め込みを計算した。埋め込みのばらつき方に偏りがあることを踏まえて空間を補正し、同一話者を追跡しやすくしている。

 これらのアプローチは、主にヨーロッパの音声で検証されたものだが、声の特徴を空間補正しながら追跡するというアプローチは、言語が変わっても動きやすいようだ。Klangの書き起こしログを一通り読んでみたが、同音異義語による変換の間違いはかなり少ない印象だ。一部数字の読み上げを、漢数字で書き起こしている部分があるにはあるが、意味は分かる。国外の言語AIエンジンでここまでやれるのは珍しい。

 スウェーデンKlang AIの共同創業者兼CTO(最高技術責任者)、アンドレアス・アルゲリウス氏によれば、ヨーロッパ言語とは構造が異なる日本語の文字起こしで課題となるものの1つが、人名や地名を正しい漢字で表記することだという。読み方だけではどの漢字を使うべきか特定できない場合があり、正しい表記を選ぶために、追加の文脈が必要になることがあるという。

 実はアルゲリウス氏は、以前東京で4年ほど働いていた経験があり、日本には特別な思い入れがあるという。日本語は欧州の言語とは大きく異なるからこそ、日本語の特性に合わせた学習と評価が必要で、スウェーデン語モデルPianissimoの開発で学んだ学習データの質を重視する進め方を、日本語にも生かす予定となっている。

話者が分離できれば、日々の雑談が宝の山に

 何かのアイデアや考え方のヒントは、一人でうんうん考えていても答えが出ないことが多い。ただそれを頭の隅に入れた状態で、全然関係ない人と立ち話していると、そこでの話から重要な示唆が得られることがある。とはいえ、雑談している間に急にメモとか取り出すのも、話の流れを止めてしまうので良くない。そんなとき、レコーダーを回しっぱなしにしていればいい。

 これまで音声録音はさあ録るぞといって開始し、話終わったかなと思ったところで停止していた。だがそれはあくまでも人間があとで聞き返す都合上、不要部分を録音ファイルに入れたくないというだけの話である。録音自体は人間が聞かず、AIによる書き起こしだけ読むというのであれば、1日中でも回しっぱなしにしとけばいい。

 一方で、周囲がガヤガヤしているところでの雑多な録音は、なかなかAIの書き起こしツールには引っかからない。話者が分離できないために、うまく文字起こしできないのだ。Klangのアプローチは、こうした問題を解決できる可能性がある。

 もう1つ、音声書き起こしに加えられる要素がある。われわれは取材や話をしているときに、よくスマホで写真を撮っている。参考のためだったり、記事化するためだったり、あとで話を思い出すためであったりとその目的はさまざまだが、とにかくパシャッとメモ撮影しているのだ。

 こうした写真には、撮影時のタイムスタンプがメタデータとして格納されている。また録音ファイルも、時刻が設定できるレコーダーであれば、タイムスタンプが格納されている。録音データと写真データをAIに読み込ませれば、何を喋っているときにどの写真が撮られたのかが照合できるはずだ。書き起こしの補強材料として、写真に記録された情報が利用できるはずである。

 これまで書き起こしAIは、音声ファイルしか読み込めなかった。同時に撮影された写真や動画も読み込めるようになれば、さらに書き起こし精度は向上するだろう。

 昨今はカメラ付きAIグラスも多数登場している。録音しながらのメモ撮影も、それぞれの専用デバイスを使わずに可能になるだろう。今後音声書き起こしやサマリー化は、録音して議事録をまとめるみたいな用途以上に拡大する可能性が高い。

 おそらくそのキーとなる技術は、話者分離だ。今から多くの音声書き起こしサービスの動向をつかんでおくのは、今後の社会活動をより効率化するのに役立つものと思われる。

印刷する
SNSでシェア
SpecialPR

小寺信良のIT大作戦

ベテランのテクノロジーライターである小寺信良さんがIT分野全般にわたって考察する。

この連載の記事をもっと見る

この記事の著者

関連記事

こんなメディアも見られています

ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

メールマガジンを配信中
メールマガジンを配信中

国内外の業界動向、AIやクラウドなどの最新技術、キャリア情報など今知りたい情報をまとめてお届けします。

いますぐご登録

本日の新着記事

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

ITmedia NEWS SNS

X @itmedia_newsをフォロー

インフォメーション

ITmediaNEWSをフォロー

あなたにおすすめの記事PR