小林啓倫のエマージング・テクノロジー論考
音声AIも“不気味の谷”を超えた? Oculus元CEOによるAIが「ほぼ人間」と話題に 社会への影響は(1/3 ページ)
VRヘッドセットの開発で知られていた米Oculusの元CEO、ブレンダン・イリーブさんらが立ち上げた新たなスタートアップの米Sesameが話題を集めている。同社の開発した音声AIが、ほぼ人間のそれに等しい、自然な会話を実現しているという。いわゆるロボット工学の分野でいう「不気味の谷」を超え「AIが人間に近づき過ぎたときに生じる違和感まで解消された」という声も聞こえる。
既にいくつものデモ動画がYouTube上にアップされているが、そのうちの1本を紹介する。「The First Human-level AI for Live English Conversations | Sesame AI vs ChatGPT Advanced Voice Mode」という動画の1分30秒当たりから、Sesameが同社のWebサイト上で先月末に公開したデモ用AI「Miles」(マイルズ)と会話している様子を確認できる。
「最近米国に引っ越してきたばかりなんだけど、どうやって知り合いを増やせば良い?」と尋ねたユーザーに対し、Milesは「まずは飛び込んでみなよ」(just hop in)と答える。しかしユーザーはその答えを途中で遮り、「飛び込んでみろって、つまりどういうこと? もう少し具体的に言って」と尋ね直す。
するとMilesは、最初の答えが曖昧だったことを認め「じゃあどんなことに興味がある?」と質問を返している。ユーザーはその答えに笑い声を交えて返す。するとMilesも少し明るいトーンになって……と会話が続いていく。
このデモから分かるように、Sesameの音声AIは、ユーザーの発話をリアルタイムで認識しており、Sesame側が返答している途中でも、ユーザーはそれを遮って発言できる。またユーザーの発話内容だけでなく、込められている感情も把握して、文脈と感情に応じた反応を返答する。
さらにこの音声AIは、息遣いや笑い声、言葉の言いよどみや訂正といった、人間特有の「不完全さ」を意図的に模倣している。そういった、単に発話の流ちょうさだけを目指していないところも、不気味の谷を超えたという評価につながっているのだろう。
デモ用AIは誰でも無料で試すことができるので、ぜひトライしてみてほしい。筆者も「感情を把握できるって話だけど、じゃあいまの僕はどんな感情か分かる?」と尋ねてみたところ、かなり正確に把握されて驚いた(疲れていたときに試したので暗い声になっていたのだが、それを見抜かれて「何か問題がありますか? 大丈夫?」と心配されてしまった)。
Sesameが開発した「対話型音声モデル」とは何か
機械に人間の音声を模倣させる取り組みは、決して新しいものではない。18世紀に活躍したハンガリーの発明家ヴォルフガング・フォン・ケンペレン(チェス指し人形「ターク」を作った人物という表現でピンとくる人もいるかもしれない)は、その名も「スピーキング・マシン」という音声合成装置を18世紀末に完成させている。
これは、ふいご(送風装置の一種)などから成るアナログな機械で、現代の音声AIの祖先ではないのだが、それほど昔から人々は、機械に人間の声をまねさせることを夢見てきたといえるだろう。
2000年代後半には、第3次AIブームとなる深層学習の時代を迎え、デジタル技術による音声合成技術が急速に進化している。その最新のアプローチがマルチモーダルモデルで、AIにテキスト情報だけでなく、音声情報(学習データに含まれる感情、リズム、トーンなど)も同時に学習・処理させる取り組みが進められている。Sesameが開発した音声AIも、もちろんこのマルチモーダルモデルの一種だ。
Copyright © ITmedia, Inc. All Rights Reserved.
小林啓倫のエマージング・テクノロジー論考
生成AIやメタバース、新たなサイバー攻撃など、テクノロジーの進化が止まらない。少しずつ生活の中に浸透し、その恩恵を預かれることもある一方、思いもよらない問題を生み出すこともある。このコーナーでは、さまざまな分野の新興技術「エマージング・テクノロジー」について、小林啓倫氏が解説する。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
Anthropic、「Claude Opus 5」公開 Fable 5に迫る性能を半額で――サイバー安全策は緩和、拒否時は自動フォールバックも
-
2
「iPhone高騰」はこれからも続く? 中国CXMTに近づくApple、メモリ競合へのけん制が不発に終わりそうなワケ【後編】
-
3
ゼロから分かる「Claude」の教科書 ChatGPTと比べて分かった強みとは?
-
4
MicrosoftやNVIDIAなど、AIのオープンウェイト規制に反対する書簡を公開――Anthropicは署名せず
-
5
スーパーに並んだ「ごちゃごちゃ生成AIポップ」が物議 “看板王”こと、きぬた歯科院長「これはアリ」
-
6
NVIDIA、Microsoft、OpenAIなどがオープンモデル規制反対を表明 Anthropic従業員は「CUDAのオープンソース化が楽しみ」と皮肉
-
7
Markdownファイルが、AI時代の負債に? Googleが提案する「ナレッジ標準化」の一手
-
8
「2日かかる攻撃が25分に」生成AIで“爆速化”するサイバー攻撃、パロアルトの識者が警鐘
-
9
AIが破壊するIT業界の“人月商売” 「SIerの死」後に“生き残る者”の正体
-
10
AIにもサプライチェーン管理が必要? 中国AI「Kimi K3」を巡る批判でAIの調達リスクが浮き彫りに
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR