Google DeepMind、ロボットの行動を改善する新VLAモデル「RT-2」発表
米Google傘下のGoogle DeepMindは7月28日(現地時間)、視覚と言語を行動に翻訳する新しいVLA(Vision-Language-Action)モデル「RT-2」を発表した。
RT-2 は、Web上のテキストと画像でトレーニングされたTransformerベースのモデルで、ロボットのアクションを直接出力できる。LLM(大規模言語モデル)をWeb上のテキストデータでトレーニングするのと同様に、RT-2はWeb上のデータから知識を転送してロボットの動作に情報を与える。
これにより、従来は例えば「コーラの空き缶をゴミ箱に捨てて」という命令を実行するためには、コーラの缶とはなにか、それが空になっていることはどうやって判断するか、物体を掴むにはどうすればいいのか、ゴミ箱とはなにか、ゴミ箱に捨てるというアクションはどういうものか、など、膨大な定義をロボットに教える必要があったところ、初めてコーラの空き缶を見ても、それがコーラの空き缶だと認識でき、「捨てる」というアクションの意味も理解するようになる。
Google DeepMindのロボティクス責任者、ヴィンセント・ヴァンホーク博士は「RT-2はWebデータの大規模なコーパスから知識を転送できるため、ゴミが何であるかを理解しており、明示的なトレーニングなしで識別できる」と説明する。「ポテトチップスの袋やバナナは、食べた後にゴミになる。RT-2は視覚言語トレーニングデータからそれを理解できる」。
デモでは、「バナナをドイツの国旗の上に置いて」「コーラの缶をテイラー・スウィフトの肖像の近くに移動して」「イチゴをイチゴが入っているボールに入れて」などの命令を実行させている。国旗やテイラー・スウィフトについてはWeb上の画像から学習したのだろう。
モデル名から分かるように、RT-2には先代にあたるRT-1があった。2022年12月に発表したRT-1は、ロボットが自分の経験から学習し、それを他のロボットと共有できるようにする相互に学習できるようにするロボティクストランスフォーマー(RT)モデルだった。
RT-2モデルをテストした結果、新しいタスクの実行効率はRT-1は32%だったところ、RT-2は62%に向上したという。「RT-2を使えば、ロボットは人間と同じようにさらに学習することができ、学習した概念を新しい状況で使うことができる」とヴァンホーク氏は語った。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
「Xが情報収集に役立たない……」熊本地震で不満の声続出 「Twitterを返して」
-
2
メルカリ、梨の転売疑惑に「盗品の出品は確認されず」 誹謗中傷には利用制限も
-
3
「こんなのに追われたら……」急斜面もやすやす爆走、中国製の車輪付き四足ロボのデモ動画が話題 最高時速20km超
-
4
検索結果に「詐欺ではありません」と表示させる詐欺手口、警視庁が注意喚起 AI要約も餌食に
-
5
はてな、11億円流出の調査報告書を公開 偽警察、口外禁止、残業・休出200時間超、孤立……ほころびが連鎖
-
6
Z世代に聞く次の流行、「AIイラスト」が1位に 「Claude Code」も上位
-
7
東野圭吾さん死去、Xなどで追悼相次ぐ 「ガリレオ」など数々の人気作、エンジニアから転身
-
8
NVIDIAやMicrosoftなど30社超、オープンAIの防御ツール共同開発の「Open Secure AI Alliance」設立
-
9
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
10
「あ、その情報メモしたい!」を叶えるワイヤレスイヤフォン、Nothing「Ear (3a)」
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR