Google、画像生成AI「nano-banana」発表 画像内の人やモノの一貫性保つ性能強化 編集も自然言語で自在に
米Googleは8月26日(現地時間)、新たな画像生成AIモデル「Gemini 2.5 Flash Image」(通称:nano-banana)を発表した。3月に発表した前モデル「Gemini 2.0 Flash」に比べ、複数の画像を生成する際に画像内の人やモノの一貫性保持する機能や、自然言語の指示による画像編集の性能などを強化したという。
一般的に画像生成AIは、1つの画像を基準として、画像内の人やキャラクター、モノを別の角度から見たバージョンを出力したり、異なる背景に配置したりする際、それらの外観を保つことが苦手とされる。
一方、Gemini 2.5 Flash Imageでは、この外観の一貫性を維持する性能を強化した。デモ画像では、チェスの駒を持つ女性が、別の画像ではカーレーサーの衣装を着たり、アーチェリーをしたりする姿が再現されている。
また、自然言語の指示による画像編集性能も高めた。画像の背景をぼかしたり、被写体のポーズを変えたり、モノクロ写真に色を付けたりするなど、さまざまな編集ができるという。他にも、ベッドルームの画像にスタンドライトの画像を追加し、ベッドの脇に置かれた様子を生成するなど、複数の入力画像を結合する操作も可能としている。
加えて、Googleの大規模言語モデル(LLM)「Gemini」を活用し、現実世界の物理的な認識能力も向上した。デモでは、2辺の長さを示した直角三角形の画像から、残りの1辺の長さを導き出す様子などが確認できる。
Gemini 2.5 Flash Imageは、リリース時点でGeminiのAPIと、Googleが提供する開発者向けのプラットフォーム「Google AI Studio」「Vertex AI」で利用できる。価格は、100万出力トークンあたり30ドルで、1枚の画像の出力につき0.039ドル(1290出力トークン)掛かる。その他の入出力については「Gemini 2.5 Flash」のAPI利用料金に準じる。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
現役組み込みエンジニアがAIを業務利用して分かったこと――期待と限界と現実解
-
2
「ほんだし」のラベルがAIでぐちゃぐちゃに…… 味の素、公式Xの投稿画像について謝罪
-
3
なぜ「相場の半額」にできた? 「ヒューマノイド界のトヨタ」目指すZEALSの“したたか”な戦略
-
4
「データがない」「スキルがない」「発想が広がらない」 味の素冷凍食品は“3つのない”をどう解消した?
-
5
なぜ「純国産AIは無理」なのか? さくらとSakana AIが示す「ソブリンAI」の現実解
-
6
「MicrosoftよりGoogle」で6億円削減も? 舞鶴市、千代田区が明かすIT刷新とAI活用の成功法則
-
7
業務効率に「不満」6割 なのに最も効くのは「生成AI」でも「ツール」でもなかった
-
8
Claude、Codex、Qwen……そのAI用語、どう読む? 読み方クイズ30問
-
9
「AI進化の裏でモノづくりは30年止まっている」、直列工程を並列化する産業OS
-
10
メルカリが明かす「Claude Code全社展開」「シャドーAI対策」を支える仕組み
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR