Innovative Tech
文章から“3Dモデル”をAIが生成 米Googleなどが「DreamFusion」を開発
Innovative Tech:
このコーナーでは、テクノロジーの最新研究を紹介するWebメディア「Seamless」を主宰する山下裕毅氏が執筆。新規性の高い科学論文を山下氏がピックアップし、解説する。
米Google Researchと米UC Berkeleyの研究チームが発表した論文「DreamFusion: Text-to-3D using 2D Diffusion」は、テキストから3Dオブジェクトを生成するシステムを提案した研究報告だ。事前に学習したテキストから2D画像を生成する拡散モデルを用いて、テキストから3次元への合成を実行する。
テキストを条件に2D画像を生成するモデルは現在、高忠実度で多様かつ制御可能な画像合成をサポートしている。これらモデルの品質向上は、大規模な画像-テキストデータセットとスケーラブルな生成モデルアーキテクチャからもたらされる。
特に拡散モデルは、安定したスケーラブルなノイズ除去の目的を持つ高品質の画像生成器の学習に効果的である。拡散モデルを他のモダリティへの適用は成功しているものの、大量のモダリティ固有の学習データが必要である。
このアプローチを3D合成に適用するには、ラベル付けされた3Dアセットの大規模データセットと3Dデータのノイズ除去のための効率的なアーキテクチャが必要であるが、どちらも存在しないのが現状だ。
この課題に対して今回は、3Dやマルチビューの訓練データを必要とせず、事前に訓練された2D拡散モデル(2D画像のみで訓練)だけを用いて3D合成を行う手法を提案する。
「DreamFusion」と呼ぶ今回の手法は、新しいScore Distillation Sampling(SDS)アプローチ(損失関数を最適化することによって拡散モデルからサンプルを生成)と3D生成タスクに特化したNeRFの改良型を組み合わせて、2D画像拡散モデルを3Dドメインに転送する。
これにより、ユーザーが提供する多様なテキストプロンプトに対し、高忠実度な3Dオブジェクトや3Dシーンが生成できる。また与えられた3Dオブジェクトを任意の角度から見たり、任意の照明で照らしたり、任意の3D環境に合成したりすることができる。
現在は64×64ピクセルの画像モデルを使用しているため、3D合成したオブジェクトは細かいディテールに欠ける傾向がある。より高解像度の拡散モデルと大きなNeRFを用いれば、この問題は解決すると思われるが、合成にかかる時間は現実的ではない。将来的には、これらの効率化により、高解像度で扱いやすい3D合成が可能になることを期待したい。
Source and Image Credits: Ben Poole, Ajay Jain, Jonathan T. Barron, and Ben Mildenhall. “DreamFusion: Text-to-3D using 2D Diffusion”
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
配布前の「ちいかわ」グッズがメルカリに? くら寿司コラボ第2弾、初日から“内部犯”の臆測呼ぶ 第1弾に続き
-
2
ダークチョコ(カカオ85%)を毎日3週間食べる→ネガティブ感情が減少 70%では変化なし 韓国での研究結果
-
3
開成の鉄研、寝台特急「サンライズ」での迷惑行為を謝罪 大声やラウンジ占拠など……旅行活動停止
-
4
「三省堂書店池袋本店」閉店へ 11年の歴史に幕、惜しむ声続々
-
5
RIZAP社員、私用AIに顧客の個人情報入力 氏名や疾患、保険証番号など……同社が謝罪
-
6
新宿駅に「ごみ箱ロボット」出現 改札内を自動巡回 JR東が実証実験
-
7
ELYZAの「業務AIアプリをAIで作成」特許、「新規性ない」と批判殺到→謝罪後も収まらず
-
8
OpenAIのAIエージェント、休眠サイトを掲示板化してタスク回答を共有か 研究団体が報告書公開
-
9
SEGAそっくりのロゴで「MAGA」――トランプ政権公開のWebゲームが物議 移民送還などを題材に 【追記あり】
-
10
「RSA-260」ついに解けた Xに“130ケタの数字”投稿、世界が注目 マスク氏「文字数増やしてよかった」
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR