Googleの「Gemini」に、ロボット向け新モデル 自律的にタスクを分解して動作、“雑な指示”にも対応
米Googleは9月26日(日本時間)、ロボット向けのAIモデル「Gemini Robotics 1.5」と「Gemini Robotics-ER 1.5」を発表した。同社のLLM「Gemini」の技術を活用しており、同社が3月に発表したロボット向けAIモデルの後継モデルに当たる。複雑な手順が必要なタスクに対し、自律的にタスクを分解してロボットを駆動できるという。
Gemini Robotics 1.5は、視覚・言語情報をもとにロボットを動かす「VLA」(Vision Language Action)モデル。一方、Gemini Robotics-ER 1.5は、視覚・言語情報を統合的に処理する「VLM」(Vision Language Model)となっている。
ロボットを動かす際は、Gemini Robotics 1.5とGemini Robotics-ER 1.5を組み合わせて利用する。人から指示を受けると、まずGemini Robotics-ER 1.5が、物理的な世界についての推論や、Web検索などのツールを活用し、タスクの計画を策定する。次にGemini Robotics 1.5がこの計画に基づき、タスクを細かいアクションに分解し、段階的に実行する。
例えば「洗濯物を色分けして」という指示を受けると、Gemini Robotics 1.5は「まず、『色分け』とは白い服は白いカゴへ、それ以外の色の服は黒いカゴへ入れることだと、タスク全体の目的を理解する。次に、『赤いセーターを拾い上げ、黒いカゴに入れる』といった具体的なステップを考え、さらには『セーターをつかみやすくするために、一度手前に引き寄せる』など、各ステップを実行するための細かな動作レベルまで考える」(Google)
また、同モデルは、異なるロボットの機体を動かす性能にも優れているという。ロボットアーム「ALOHA 2」で学習した動きを、ロボット企業である米Apptronikの人型ロボット「Apollo」などでも再現できたとしている。
一方、Gemini Robotics-ER 1.5は、物理的な状況に基づく推論性能が高いといい、Googleが用意したベンチマーク「Embodied Reasoning Question Answering 」では、米OpenAIのAIモデル「GPT-5」などを上回るスコアを獲得したとアピールしている。
Gemini Robotics-ER 1.5は同日から、Googleが提供する開発者向けプラットフォーム「Google AI Studio」で提供する。Gemini Robotics 1.5は、Googleの一部のパートナー企業向けに提供中。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
よく見られているカテゴリー
アクセスランキング
-
1
「Claude Fable 5」をサブスクの標準機能に――AnthropicのエンジニアがXに投稿 7月8日以降の「早期復活目指す」
-
2
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
3
AIに「相手に電気ショックを与えろ」と命じ続けたらボタンを押すのか? 11のLLMで“ミルグラム実験” 抵抗できたのは……
-
4
「Claude Fable 5」の性能が落ちた? 提供停止前後で比べた結果 米AI企業2社がそれぞれ報告
-
5
人型ロボットが工場で稼働する様子を6日間生配信、作業成功率99.99%をうたう 中国メーカー
-
6
3万円で「Yahoo!ニュース」にPR掲載 プレスリリースをAIで「ニュース風記事」に
-
7
AIに詳しくなくても大丈夫、月額制で中小企業のAI活用をプロが支える新サービス
-
8
AIで“ゲームキャラの出産二次創作”を何千回と生成する人も……ChatGPTの会話57万件から見えたヘビーな利用実態
-
9
Meta、「Claude Codeと組織改編で爆速開発」のはずが「想定より加速せず」 ザッカーバーグ氏、社内集会で発言
-
10
NTT、独自のAIモデル「tsuzumi 2」発表 “国産AI開発競争”に「負けられない」と島田社長
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR