ロボットが計器読み取り可能に、Googleが産業現場向けAIモデル「Gemini Robotics-ER 1.6」発表 Boston Dynamicsとも連携
Google DeepMindは2026年4月14日(現地時間)、ロボット向け視覚言語モデル(VLM)「Gemini Robotics-ER 1.6」(以下、ER 1.6)を発表した。空間認識や計測器の読み取りなど、産業現場で求められる能力を高めたモデルとされる。米Boston Dynamicsと連携し同社の4足歩行ロボット「Spot」に同モデルを搭載。施設の巡回点検における計器の読み取り、撮影を可能にした。
ER 1.6は3つの特徴的な機能を持つモデルだ。1つ目は「Pointing」(指差し)という、指差し確認をするように複数の物体を認識する機能だ。物体の正確な検出や、物体間の比較、物体の奇跡のトラッキングにも活用される。ER 1.6は複雑なタスクの推論の前段階でこの機能を使い、タスクの精度を向上させたという。
2つ目は「Success Detection」(成功検出)だ。これはタスクが完了したかどうかをロボット自身が判断する機能で、失敗時の再試行や次工程への移行を自律的に実行するのに必要なものだ。ER 1.6は複数のカメラの映像を認識する能力が強化され、タスクが完了したかどうかを多角的に分析、把握できるようになったという。
3つ目は「Instrument Reading」(計測器読み取り)だ。前世代の「ER 1.5」にはなかった新機能で、工場や施設の温度計、圧力計など常時監視が必要なアナログ計器の値をモデルが認識できるようになった。ER 1.6は画像の拡大やPointing、コード実行を段階的に組み合わせることで、針の位置や目盛りの間隔を高精度に解釈するという。
ER 1.6は、ER 1.5および「Gemini 3.0 Flash」と比較して、これら全てのタスクで成功率が向上した。特に計測器読み取りタスクでは、ER 1.5の23%、Gemini 3.0 Flashの72%に対し、ER 1.6は93%を達成。安全性面でも、実際の負傷報告に基づくシナリオテスト「ASIMOV」において、テキストや物体の認識能力ではGemini 3.0 Flashを上回った。
ER 1.6は、「Gemini API」および「Google AI Studio」を通じて開発者向けに提供されている。開発を始めるための「Google Colaborate」環境も公開されている。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
よく見られているカテゴリー
アクセスランキング
-
1
「ポンコツ」と呼ばれたM365 Copilotの逆転劇、GPT-5が転換点 活用の秘訣は“脱・プロンプト職人”
-
2
人間 vs. 人型ロボ、より多く作業をこなせるのは? 生配信で対決した結果…… 米企業
-
3
「AIデータセンターの電力需要が急増」はホント? 発電大手Jパワー社長が明かした“報道との温度差”
-
4
キオクシア社長「記録的な増収増益」 3カ月の売上収益1兆円、純利益は2990%増 好決算の背景は
-
5
伊藤忠商事や三菱ケミカルなど16社が参画 大手企業の「暗黙知」を活用する新プロジェクト
-
6
NEC社長が説く AI時代と新たな安全保障環境の到来で「ITサービスはこう変わる」
-
7
「邪魔すぎ」――LINE入力欄の“新AI機能”が不評 消し方は?
-
8
生成AIで3Dモデルを自動作成 専門スキル不要でテキストや画像から3D化
-
9
OpenAI、「ChatGPT」に個人向け資産管理機能 金融口座と連携
-
10
Python 3.15に追加されるlazy importと内包表記でのアンパッキングについて調べてみた
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR