ロボットが計器読み取り可能に、Googleが産業現場向けAIモデル「Gemini Robotics-ER 1.6」発表 Boston Dynamicsとも連携
Google DeepMindは2026年4月14日(現地時間)、ロボット向け視覚言語モデル(VLM)「Gemini Robotics-ER 1.6」(以下、ER 1.6)を発表した。空間認識や計測器の読み取りなど、産業現場で求められる能力を高めたモデルとされる。米Boston Dynamicsと連携し同社の4足歩行ロボット「Spot」に同モデルを搭載。施設の巡回点検における計器の読み取り、撮影を可能にした。
ER 1.6は3つの特徴的な機能を持つモデルだ。1つ目は「Pointing」(指差し)という、指差し確認をするように複数の物体を認識する機能だ。物体の正確な検出や、物体間の比較、物体の奇跡のトラッキングにも活用される。ER 1.6は複雑なタスクの推論の前段階でこの機能を使い、タスクの精度を向上させたという。
2つ目は「Success Detection」(成功検出)だ。これはタスクが完了したかどうかをロボット自身が判断する機能で、失敗時の再試行や次工程への移行を自律的に実行するのに必要なものだ。ER 1.6は複数のカメラの映像を認識する能力が強化され、タスクが完了したかどうかを多角的に分析、把握できるようになったという。
3つ目は「Instrument Reading」(計測器読み取り)だ。前世代の「ER 1.5」にはなかった新機能で、工場や施設の温度計、圧力計など常時監視が必要なアナログ計器の値をモデルが認識できるようになった。ER 1.6は画像の拡大やPointing、コード実行を段階的に組み合わせることで、針の位置や目盛りの間隔を高精度に解釈するという。
ER 1.6は、ER 1.5および「Gemini 3.0 Flash」と比較して、これら全てのタスクで成功率が向上した。特に計測器読み取りタスクでは、ER 1.5の23%、Gemini 3.0 Flashの72%に対し、ER 1.6は93%を達成。安全性面でも、実際の負傷報告に基づくシナリオテスト「ASIMOV」において、テキストや物体の認識能力ではGemini 3.0 Flashを上回った。
ER 1.6は、「Gemini API」および「Google AI Studio」を通じて開発者向けに提供されている。開発を始めるための「Google Colaborate」環境も公開されている。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
よく見られているカテゴリー
アクセスランキング
-
1
農水省の“クソダサ”ポスター話題 「AIよりよっぽど良い」の声も 担当者に狙いを聞いた
-
2
え、21日で37テラも? 高性能SSDを食いつぶす「あのAIツール」にご用心:886th Lap
-
3
AIに「相手に電気ショックを与えろ」と命じ続けたらボタンを押すのか? 11のLLMで“ミルグラム実験” 抵抗できたのは……
-
4
ソフトウェアエンジニアの仕事は「ループを書くこと」になる 内側ループと外側ループ(ハーネス)入門
-
5
Anthropicの営業はAIエージェントをこう使う! 日本法人メンバーが明かす手の内
-
6
復活した「Fable 5」 米政府からのオーダーに対して、Anthropicはどう対策したのか
-
7
AIで“ゲームキャラの出産二次創作”を何千回と生成する人も……ChatGPTの会話57万件から見えたヘビーな利用実態
-
8
光接続の標準規格「OCI」対応シリコン、GFが27年に投入
-
9
「Claude Fable 5」をサブスクの標準機能に――AnthropicのエンジニアがXに投稿 7月8日以降の「早期復活目指す」
-
10
「ねこ」検索で「手押し一輪車」表示――モノタロウが守った、生成AIに“譲れない”購買体験
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR