Google、画像生成AI「nano-banana」発表 画像内の人やモノの一貫性保つ性能強化 編集も自然言語で自在に
米Googleは8月26日(現地時間)、新たな画像生成AIモデル「Gemini 2.5 Flash Image」(通称:nano-banana)を発表した。3月に発表した前モデル「Gemini 2.0 Flash」に比べ、複数の画像を生成する際に画像内の人やモノの一貫性保持する機能や、自然言語の指示による画像編集の性能などを強化したという。
一般的に画像生成AIは、1つの画像を基準として、画像内の人やキャラクター、モノを別の角度から見たバージョンを出力したり、異なる背景に配置したりする際、それらの外観を保つことが苦手とされる。
一方、Gemini 2.5 Flash Imageでは、この外観の一貫性を維持する性能を強化した。デモ画像では、チェスの駒を持つ女性が、別の画像ではカーレーサーの衣装を着たり、アーチェリーをしたりする姿が再現されている。
また、自然言語の指示による画像編集性能も高めた。画像の背景をぼかしたり、被写体のポーズを変えたり、モノクロ写真に色を付けたりするなど、さまざまな編集ができるという。他にも、ベッドルームの画像にスタンドライトの画像を追加し、ベッドの脇に置かれた様子を生成するなど、複数の入力画像を結合する操作も可能としている。
加えて、Googleの大規模言語モデル(LLM)「Gemini」を活用し、現実世界の物理的な認識能力も向上した。デモでは、2辺の長さを示した直角三角形の画像から、残りの1辺の長さを導き出す様子などが確認できる。
Gemini 2.5 Flash Imageは、リリース時点でGeminiのAPIと、Googleが提供する開発者向けのプラットフォーム「Google AI Studio」「Vertex AI」で利用できる。価格は、100万出力トークンあたり30ドルで、1枚の画像の出力につき0.039ドル(1290出力トークン)掛かる。その他の入出力については「Gemini 2.5 Flash」のAPI利用料金に準じる。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
よく見られているカテゴリー
アクセスランキング
-
1
「Claude Fable 5」「Mythos 5」全面停止 米政府の指令により Anthropicは早期復旧を宣言
-
2
最新AI「Fable 5」でYouTube動画作ってみた 想像以上の出来に驚愕、ただし大きな弱点も
-
3
「ChatGPTのコネクタでつながるし、M365 Copilotいらなくない?」→有識者3人に聞いてみた 知らないと損するコンテキスト管理「Work IQ」の仕組み
-
4
データセンター建設に足りないのは「発電」ではなく「送電」 AI需要で電力消費26%増、Gartner予想
-
5
“AIが電力使いすぎ問題” 「電力不足」懸念で、発電能力より深いボトルネックとは
-
6
「もはや宗教」のClaudeに焦るOpenAI 流出メモが暴いた覇権交代のリアル
-
7
「猫も杓子もAI」な現状は今後も続くのか?【後編】AI時代に必要な3つの検討事項
-
8
トヨタが抜かれる日――キオクシア首位奪取、2005年「時価総額トップ10」を振り返る
-
9
Anthropic、「Mythos 5」「Fable 5」の提供を一時停止 米政府指示を受け
-
10
中国が人型ロボット開発競争をリードする「納得の理由」 日本に残された逆転シナリオは?
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR