Innovative Tech
スマホで“1.8秒” テキストから高速で画像を生成するAI「SnapFusion」 Stable Diffusionと同等の画質
Innovative Tech:
このコーナーでは、テクノロジーの最新研究を紹介するWebメディア「Seamless」を主宰する山下裕毅氏が執筆。新規性の高い科学論文を山下氏がピックアップし、解説する。Twitter: @shiropen2
米Snapと米ノースイースタン大学に所属する研究者らが発表した論文「SnapFusion: Text-to-Image Diffusion Model on Mobile Devices within Two Seconds」は、モバイル機器において、テキストプロンプトから2秒以内に画像を生成する拡散モデルを提案した研究報告である。
拡散に基づくテキスト画像合成モデルは、テキストプロンプトを用いたフォトリアリスティックなコンテンツの合成において著しい進歩を示している。しかし、これらのモデルは大規模で、複雑なネットワークアーキテクチャと数十回のノイズ除去の繰り返しがあるため、計算コストが高く、実行に時間がかかる。
その結果、入力から出力までの時間を短くするには、ハイエンドGPUを搭載した大規模なクラウドベースのプラットフォームが必要になる。
モバイル機器上でテキストから画像への拡散モデルの推論を高速化する取り組みが新たに始まっている。例えば、Samsung Galaxy S23 Ultraでは拡散パイプラインを11.5秒に高速化している。
この研究では、モバイル機器上で2秒以内に画像を生成する、テキストから画像への拡散モデルを提案する。この結果を実現するために、研究チームはStable Diffusion v1.5の冗長性を分析し、事前に学習させたUNetモデルの性能を維持しつつ、その有効性を徐々に向上させるアーキテクチャ進化型の手法を提案する。
拡散モデルの効率的なアーキテクチャを提案することに加えて、さらに、より高速化を達成するために、UNetのノイズ除去ステップの数を減らすことを検討する。
ステップの蒸留(step distillation)の研究方向に従い、例えば32ステップの教師を、より少ないステップ、例えば16ステップで実行する生徒に蒸留することにより、ステップを削減することができる。
こうすることで、生徒は教師に対して2倍のスピードアップを享受できる。50のノイズ除去ステップを行うStable Diffusion v1.5と比べ、提案手法では8のノイズ除去ステップまで削減した。
実際に市販のスマートフォンを使って、提案手法の生成時間を計測した。その結果、Stable Diffusion v1.5と同等の画質を保持したまま、テキストから512×512の画像を1.84秒で生成できることが分かった。ただし、今回の実験では他の多くのスマートフォンよりも計算能力の高いiPhone 14 Proで行っており、限定的であることを留意したい。
Source and Image Credits: Yanyu Li, Huan Wang, Qing Jin, Ju Hu, Pavlo Chemerys, Yun Fu, Yanzhi Wang, Sergey Tulyakov, and Jian Ren. SnapFusion: Text-to-Image Diffusion Model on Mobile Devices within Two Seconds
Copyright © ITmedia, Inc. All Rights Reserved.
Innovative Tech
2019年にスタートした本連載「Innovative Tech」は、世界中の幅広い分野から最先端の研究論文を独自視点で厳選、解説している。執筆は研究論文メディア「Seamless」(シームレス)を主宰し、日課として数多くの論文に目を通す山下氏が担当。イラストや漫画は、同メディア所属のアーティスト・おね氏が手掛けている。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
FANZA、成人向けAI創作・公開サービス「FANZAスタジオ」発表 先行体験は8月24日から
-
2
「うるう秒」27年に事実上廃止へ 自転とのずれ「1時間」まで容認 10月に国際会議で採決
-
3
「comico」サ終にマンガ家が思う“縦読みマンガ”の弱点と戦略ミス
-
4
目指すは、日本発IPで海外売上20兆円 経産省が新戦略を発表 「ものがたり大国5カ年計画」
-
5
「社用PC高すぎ、中古品使おう」の注意点 潜む“前の持ち主の亡霊”リスク 立命館・上原教授に聞く
-
6
「不味そうすぎ」AIメニュー画像はどう作られる? AIで“岩のような唐揚げ”再現に挑戦した
-
7
人気カフェ「BERG」も楽天市場撤退 「反戦の思いと相容れない」
-
8
LINE、着せかえ表示問題を謝罪 希望者に返金へ
-
9
中国、人型ロボットが100メートルで9秒32 “ボルト超え”続出の北京「世界人型ロボット運動会」
-
10
Tesla歴5年の筆者がみなさんの疑問に答えます
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR