Google、動画生成AI「Gemini Omni 1.1 Flash」公開 10秒分の文脈を参照して最長40秒まで延長
米Googleは8月27日(現地時間)、動画の生成・編集に対応するマルチモーダルAIモデル「Gemini Omni 1.1 Flash」を発表した。Gemini APIおよびGoogle AI Studioを通じて開発者向けに提供する。APIのモデル名は「gemini-omni-1.1-flash」。
同社は、今回のアップデートにより、Omni 1.1がGoogle AI Studio経由のGemini APIで「プロ用途に耐えるproduction-readyな段階になった」としている。
最大の強化点はシーン延長
既存の動画の続きをシームレスに生成する「シーン延長」機能では、モデルが直前の最大10秒分を文脈として解析できるようになった(従来モデルは最後の1秒しか参照していなかった)。これにより、視覚的な一貫性と物語の整合性が向上したとしている。動画は10秒単位で延長でき、累計の長さは最大40秒までだ。
開始・終了フレームの指定
ショットの開始フレームと終了フレームを指定し、その間の映像を連続的に生成できる。複雑なカメラの周回移動やズームによる転換、シームレスにループするクリップの制作に向くという。
360pのドラフト生成と4Kアップスケール
360p解像度の軽量なプレビュー生成に対応した。同モデルの標準である720pと比べ、生成速度は最大60%速く、コストは3分の1になるとしている。試作やストーリーボードの検討を高速に回す用途を想定する。最終出力は1080pまたは4Kにアップスケールできる。
動画リファレンスの入力
マルチモーダル入力として最大3秒の動画を参照素材に指定でき、キャラクターの見た目や視覚的な文脈を保ったまま生成できる。
提供形態
Google AI Studioで試用できるほか、企業向けにはGemini Enterprise Agent PlatformのAgent Platform API経由で利用できる。動画制作ツール「Google Flow」では同日から、Google One AI Premium/Pro/Ultraの契約者に向けて世界的に提供を開始した。Geminiアプリでも、同じ契約者向けにシーン延長機能を提供する。既に導入企業もあり、Adobeは「Adobe Firefly」にGemini Omni Flashを統合した。開発者向けドキュメントによると、Omni Flashで生成した動画には、視聴者には見えないが機械的に検出できる電子透かし「SynthID」が付与される。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
4台のM5 Ultra Mac Studioで「データセンター級」メモリ帯域幅4.8TB/s 巨大LLMも高速でローカル実行可能に
-
2
ChatGPT Work、ログイン必要なサイトも操作可能に 「パスワードは一切見ない」
-
3
ちっちゃな人型ロボが100mトラックをぽてぽて……中国ロボ陸上の“おちびランナー”が話題 「可愛すぎ」「けなげ」
-
4
個人で契約したChatGPTに、会社の情報を入力していいの? 超初心者向けAI解説
-
5
ヒューマノイド開発、「標準インタフェース」が不可欠に
-
6
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
7
NTT、独自のAIモデル「tsuzumi 2」発表 “国産AI開発競争”に「負けられない」と島田社長
-
8
FANZAで「成人向けAIコンテンツ制作サービス」開始 8月24日から先行体験
-
9
「AIエージェントを本番運用中」日本が最下位 “PoC止まり”の原因と、抜け出す方法は?
-
10
NVIDIAが開発支援、約30秒で口腔がんの疑い検出する歯科用AI
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR