Googleの「Gemini」に、ロボット向け新モデル 自律的にタスクを分解して動作、“雑な指示”にも対応
米Googleは9月26日(日本時間)、ロボット向けのAIモデル「Gemini Robotics 1.5」と「Gemini Robotics-ER 1.5」を発表した。同社のLLM「Gemini」の技術を活用しており、同社が3月に発表したロボット向けAIモデルの後継モデルに当たる。複雑な手順が必要なタスクに対し、自律的にタスクを分解してロボットを駆動できるという。
Gemini Robotics 1.5は、視覚・言語情報をもとにロボットを動かす「VLA」(Vision Language Action)モデル。一方、Gemini Robotics-ER 1.5は、視覚・言語情報を統合的に処理する「VLM」(Vision Language Model)となっている。
ロボットを動かす際は、Gemini Robotics 1.5とGemini Robotics-ER 1.5を組み合わせて利用する。人から指示を受けると、まずGemini Robotics-ER 1.5が、物理的な世界についての推論や、Web検索などのツールを活用し、タスクの計画を策定する。次にGemini Robotics 1.5がこの計画に基づき、タスクを細かいアクションに分解し、段階的に実行する。
例えば「洗濯物を色分けして」という指示を受けると、Gemini Robotics 1.5は「まず、『色分け』とは白い服は白いカゴへ、それ以外の色の服は黒いカゴへ入れることだと、タスク全体の目的を理解する。次に、『赤いセーターを拾い上げ、黒いカゴに入れる』といった具体的なステップを考え、さらには『セーターをつかみやすくするために、一度手前に引き寄せる』など、各ステップを実行するための細かな動作レベルまで考える」(Google)
また、同モデルは、異なるロボットの機体を動かす性能にも優れているという。ロボットアーム「ALOHA 2」で学習した動きを、ロボット企業である米Apptronikの人型ロボット「Apollo」などでも再現できたとしている。
一方、Gemini Robotics-ER 1.5は、物理的な状況に基づく推論性能が高いといい、Googleが用意したベンチマーク「Embodied Reasoning Question Answering 」では、米OpenAIのAIモデル「GPT-5」などを上回るスコアを獲得したとアピールしている。
Gemini Robotics-ER 1.5は同日から、Googleが提供する開発者向けプラットフォーム「Google AI Studio」で提供する。Gemini Robotics 1.5は、Googleの一部のパートナー企業向けに提供中。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
「ほんだし」のラベルがAIでぐちゃぐちゃに…… 味の素、公式Xの投稿画像について謝罪
-
2
なぜ「純国産AIは無理」なのか? さくらとSakana AIが示す「ソブリンAI」の現実解
-
3
現役組み込みエンジニアがAIを業務利用して分かったこと――期待と限界と現実解
-
4
人型ロボが“人間超え”――助走なしで高さ2mのジャンプ、時速45kmで走行も 中国Unitreeが開発中の新モデルを公開
-
5
「データがない」「スキルがない」「発想が広がらない」 味の素冷凍食品は“3つのない”をどう解消した?
-
6
なぜ「相場の半額」にできた? 「ヒューマノイド界のトヨタ」目指すZEALSの“したたか”な戦略
-
7
「MicrosoftよりGoogle」で6億円削減も? 舞鶴市、千代田区が明かすIT刷新とAI活用の成功法則
-
8
Claude、Codex、Qwen……そのAI用語、どう読む? 読み方クイズ30問
-
9
「AI進化の裏でモノづくりは30年止まっている」、直列工程を並列化する産業OS
-
10
業務効率に「不満」6割 なのに最も効くのは「生成AI」でも「ツール」でもなかった
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR