Innovative Tech
複数人隠れていても検出できるポーズ推定 Amazonが開発
Innovative Tech:
このコーナーでは、テクノロジーの最新研究を紹介するWebメディア「Seamless」を主宰する山下裕毅氏が執筆。新規性の高い科学論文を山下氏がピックアップし、解説する。
米AmazonのAWS Rekognition研究チームが開発した「Combining detection and tracking for human pose estimation in videos」は、動画から多人数の姿勢(ポーズ)を検出する機械学習ベースの手法だ。人が重なりあって少ししか見えない人物も検出できるという。
複数人のポーズトラッキングは、ビデオフレーム内のすべての人の体の関節を検出し、時間の経過とともにそれらを正しくリンクさせるという二重のタスクで構成される。
人を検出する方法には、最初に画像内の全ての人を検出してからバウンディングボックス(領域)内で各人の体の関節を予測する「トップダウン型アプローチ」と、最初に個々の身体の関節を検出してからグループ化する「ボトムアップ型アプローチ」がある。今回の手法では高い精度を発揮している前者を採用した。
しかし、トップダウン型アプローチでは、人が重なり合って一部が隠れてしまうこと(オクルージョン)が多発するため安定しないのが現状。そこで今回は、取得した人物のバウンディングボックスを経時的に動かすアプローチを取った。フレーム内で検出を見逃しても、検出に成功した前後のフレーム上の人物のバウンディングボックスを動かすことで補填する。これはフレーム前後で、その人物がほぼ同じ位置に存在するだろうと仮定することで行える手法だ。
具体的な検出の流れを説明する。最初に、各ビデオクリップのキーフレームにいる人物候補を全て検出し、バウンディングボックス内の領域を切り取ることでTubesを作成する。このチューブを入力にしたHRNetベースのClip Tracking Networkが、人物の身体関節の位置をビデオクリップ全体にわたって推定する。これをTrackletsと呼んでいる。次に、重なり合うフレームのポーズに基づいて、これらTrackletsを縫い合わせる仕立て屋のような働きを行う。
これにより部分的に隠れた人物でも、隣接するフレームからの情報を基に予測して検出できるようになった。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
なぜ酒蔵の許諾なしに? 「VTuberコラボ日本酒」騒動、主催者が経緯説明 仲介者による調整で「準備進んでいると認識」
-
2
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
3
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
4
本物そっくり“AI生成レシート“が経費精算の脅威に マネフォ「自力で見破るのは難しい」 企業はどう備える?
-
5
「菜の花がおかしい」――イラストレーター制作うたうマラソン大会ポスターに指摘相次ぐ 事務局がAI使用明かす【訂正あり】
-
6
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
7
藤井風のリサイタル、公式サイトがインターネット老人会すぎると話題 公民館のチラシみたいだけど東京ドーム開催
-
8
松本デジタル相、24.6万件漏えい可能性について説明 「既知の脆弱性を対応前に悪用」
-
9
「iPhone Duo」純正ケース話題、「面白いけど高い」……1万4800円と2万4800円
-
10
「ランジェリーパープルじゃない」「買おうと思ってたのに」 iPhone 18 Pro/Pro Maxの色に落胆の声
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR