米Googleは8月26日(現地時間)、新たな画像生成AIモデル「Gemini 2.5 Flash Image」(通称:nano-banana)を発表した。3月に発表した前モデル「Gemini 2.0 Flash」に比べ、複数の画像を生成する際に画像内の人やモノの一貫性保持する機能や、自然言語の指示による画像編集の性能などを強化したという。
一般的に画像生成AIは、1つの画像を基準として、画像内の人やキャラクター、モノを別の角度から見たバージョンを出力したり、異なる背景に配置したりする際、それらの外観を保つことが苦手とされる。
一方、Gemini 2.5 Flash Imageでは、この外観の一貫性を維持する性能を強化した。デモ画像では、チェスの駒を持つ女性が、別の画像ではカーレーサーの衣装を着たり、アーチェリーをしたりする姿が再現されている。
また、自然言語の指示による画像編集性能も高めた。画像の背景をぼかしたり、被写体のポーズを変えたり、モノクロ写真に色を付けたりするなど、さまざまな編集ができるという。他にも、ベッドルームの画像にスタンドライトの画像を追加し、ベッドの脇に置かれた様子を生成するなど、複数の入力画像を結合する操作も可能としている。
加えて、Googleの大規模言語モデル(LLM)「Gemini」を活用し、現実世界の物理的な認識能力も向上した。デモでは、2辺の長さを示した直角三角形の画像から、残りの1辺の長さを導き出す様子などが確認できる。
Gemini 2.5 Flash Imageは、リリース時点でGeminiのAPIと、Googleが提供する開発者向けのプラットフォーム「Google AI Studio」「Vertex AI」で利用できる。価格は、100万出力トークンあたり30ドルで、1枚の画像の出力につき0.039ドル(1290出力トークン)掛かる。その他の入出力については「Gemini 2.5 Flash」のAPI利用料金に準じる。
Google、「Gemini」の環境負荷を公表 テキストプロンプト1回で「水5滴分、TV視聴9秒以下」
Googleの「Gemini」、好みを記憶する機能をデフォルトに 「一時チャット」も可能
Google、AIコーディングエージェント「Jules」を一般公開 Gemini 2.5 Pro搭載
Google、マルチエージェントAI「Deep Think」提供開始 「AI Ultra」プランで
Google検索の「AIモード」に学生向け新機能 PDFアップロードやCanvasなどCopyright © ITmedia, Inc. All Rights Reserved.