Innovative Tech
絵心がない線画を“いい感じの作品”に変える画像生成AI「Sketch-to-Image」 Googleなどが開発
Innovative Tech:
このコーナーでは、テクノロジーの最新研究を紹介するWebメディア「Seamless」を主宰する山下裕毅氏が執筆。新規性の高い科学論文を山下氏がピックアップし、解説する。
Google ResearchとイスラエルのTel Aviv Universityに所属する研究者らが発表した論文「Sketch-Guided Text-to-Image Diffusion Models」は、落書きのようにざっと描いた絵を入力テキストに従って詳細な画像を生成する深層学習モデルを提案した研究報告だ。手描きのスケッチを任意のテキストプロンプトによるスタイル制御で、自然な高精細画像に変換する。
大規模なテキストから画像への拡散モデルは、与えられたテキストプロンプトに従った前例のない品質の多様な画像の合成を可能にし、コンテンツの作成と編集のための刺激的なツールとなってきた。
しかし、これらのモデルでは、テキストプロンプトによる意味的なガイダンスにもかかわらず、合成した画像の空間的特性をガイドする直感的な制御がまだ不足している。
今回の研究では、この課題に対して、事前に学習したテキストから画像への拡散モデルのプロセスを空間マップと共にガイドする汎用的なアプローチを提案する。重要なアイデアは、拡散モデルのコアネットワークに作用するエッジ(線画)予測器によって導き、合成した画像のエッジが参照スケッチに従うように促すことである。
エッジ予測器は多層パーセプトロン(MLP)ネットワークで、ピクセル単位で動作し、ノイズの多い画像の特徴を空間エッジマップにマッピングするよう学習する。学習は1回のみで、数千枚の画像が必要であり、GPU1台で1時間程度で完了する。
学習したモデルにスケッチと好きなテキストが入力すると、スケッチの整合性を保ったままテキスト内容に沿った自然な画像を生成する。また、スケッチの線画をどれくらい忠実に守るかのパラメーターの調整も行える。忠実度が高いと線画に沿った絵が出来上がり、忠実度が低いと形状や方向、位置などが線画とズレて生成される。
Source and Image Credits: Andrey Voynov, Kfir Aberman, and Daniel Cohen-Or. Sketch-Guided Text-to-Image Diffusion Models
Copyright © ITmedia, Inc. All Rights Reserved.
Innovative Tech
2019年にスタートした本連載「Innovative Tech」は、世界中の幅広い分野から最先端の研究論文を独自視点で厳選、解説している。執筆は研究論文メディア「Seamless」(シームレス)を主宰し、日課として数多くの論文に目を通す山下氏が担当。イラストや漫画は、同メディア所属のアーティスト・おね氏が手掛けている。
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
「Xが情報収集に役立たない……」熊本地震で不満の声続出 「Twitterを返して」
-
2
メルカリ、梨の転売疑惑に「盗品の出品は確認されず」 誹謗中傷には利用制限も
-
3
はてな、11億円流出の調査報告書を公開 偽警察、口外禁止、残業・休出200時間超、孤立……ほころびが連鎖
-
4
検索結果に「詐欺ではありません」と表示させる詐欺手口、警視庁が注意喚起 AI要約も餌食に
-
5
「こんなのに追われたら……」急斜面もやすやす爆走、中国製の車輪付き四足ロボのデモ動画が話題 最高時速20km超
-
6
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
7
Z世代に聞く次の流行、「AIイラスト」が1位に 「Claude Code」も上位
-
8
「痺れるほどにミスを繰り返す」Gemini 3.6 Flashは変わった? 公開から1週間、当初のおバカ回答を今検証する
-
9
東野圭吾さん死去、Xなどで追悼相次ぐ 「ガリレオ」など数々の人気作、エンジニアから転身
-
10
NVIDIAやMicrosoftなど30社超、オープンAIの防御ツール共同開発の「Open Secure AI Alliance」設立
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR