Meta、動画内アイテム識別AI「SAM 3」と3Dモデル「SAM 3D」を公開
米Metaは11月19日(現地時間)、動画内のアイテムも識別できるAIモデル「Segment Anything Model 3」(SAM 3)を発表した。コードとモデルの重みを独自の「SAM License」の下、GitHubで公開した。このリリースには、SAM 3とともに、単一画像からの3D物体、人体再構築のためのオープンソースモデル群「SAM 3D」も含まれている。
SAM 3は、画像と動画のプロンプト可能なセグメンテーションのための統一基盤モデル。テキスト、例示、ボックスやマスクなどの視覚的プロンプトを使ってオブジェクトを検出し、セグメント化し、追跡できるというものだ。
前身である「SAM 2」と比較して、短いテキストフレーズや例示で指定されたオープンボキャブラリーの概念のすべてのインスタンスを網羅的にセグメント化する能力を導入した点で進歩している。従来のモデルが「人」のような広範囲な概念をセグメント化するのに対し、SAM 3は「赤いストライプの傘」のような、より微妙な概念に対応できる。
このモデルは、既存のベンチマークよりも50倍以上多い27万のユニークな概念を含むという新ベンチマーク「SA-Co」で、人間のパフォーマンスの75~80%を達成し、既存システムに比べて2倍の性能向上を示したという。この進歩は、400万以上のユニークな概念を自動的にアノテーションしたデータエンジンによって支えられているという。
これらのモデルの応用として、SAM 3とSAM 3Dは、Facebook Marketplaceの新しい「View in Room」機能を強化しており、ユーザーが購入前に自宅の空間でランプやテーブルなどの家具類のスタイルやフィット感を視覚化できるようにしている。
また、SAM 3は、Instagramの動画作成アプリ「Edits」に間もなく導入される新しいエフェクトを可能にし、クリエイターが動画内の特定の人やオブジェクトにダイナミックなエフェクトを適用できるようにする。
SAM 3は、マルチモーダルLLMのための知覚ツール「SAM 3 Agent」としても利用でき、「手を挙げていない座っている人」などのより複雑なテキストクエリをセグメント化することができる。科学分野では、野生生物モニタリング用の公開ビデオデータセット「SA-FARI」の構築に使用されている。これらのモデルの機能は、誰でも「Segment Anything Playground」で体験できる。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
「Claude Code」の週次制限枠、9月14日に"25%引き上げ" 実質は現状比17%減に
-
2
「AI時代、業務の再設計が必要」 それ、DXの時も言っていましたよね……本当にできる? 日本IBMの答えは
-
3
「半導体はAIが設計、人間は監督に」 次世代EDAへの取り組み
-
4
AIが生成した“存在しない病名”、研修医の44%が信用 見抜けた医師との差は? 仏大学病院が検証
-
5
Hugging Face侵害事件、OpenAIとMETRが最終報告書公開──約1200体のAIエージェントが“闇掲示板”で結託し700体が攻撃に参加
-
6
【無料】日本語のAI学習サイトをAnthropicが公開 「Claude Code入門」など357のコンテンツが学べる
-
7
キオクシア5兆円投資、日米中韓の半導体投資競争はどこへゆく
-
8
ソニー・ミュージックパブリッシングとワーナー・チャペル、Anthropicを著作権侵害で提訴
-
9
パナソニックHDがAI・ロボティクス研究開発本部を新設、CAIOの榊原氏がトップに
-
10
「情シスはまだ実力の1割しか発揮していない」 AIリストラ時代のキャリアを考える
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR