SpaceXAI、「Grok 4.6」を発表 総合指標で「GPT-5.6 Sol Max」に並ぶと謳う
米SpaceXのSpaceXAIは8月12日(現地時間)、AIモデル「Grok 4.6」を発表した。前世代の「Grok 4.5」をベースに、多数の手順をまたいで作業を続けるエージェント用途と、対話的・視覚的な成果物の作成に重点を置いたモデルとしている。
ベンチマークでは、9種類の指標を合成した「Artificial Analysis Intelligence Index」で61を記録し、米OpenAIの「GPT-5.6 Sol Max」と並んだ。米Anthropicの「Fable 5 Max」の62には届かなかったが、Grok 4.5 Highの56からは伸びている。
個別の評価では、経済的に価値のある業務を測る「GDPVal-AA v2」で1753、ナレッジワーク系の「AA-Briefcase」で1577、法務分野の「Harvey LAB(Vals)」で15.8%と、比較対象の中で最高値を示した。一方、ソフトウェアエンジニアリング系の「DeepSWE v1.1」(65.9%)やターミナル操作の「Terminal-Bench v3.0」(26%)ではGPT-5.6 Sol Maxが上回っている。競合モデルの数値は、各開発元が公表したシステムカードやリーダーボードから引用したとしている。
Grok 4.6は同日から、Grok Build、Cursor、Grok Bot、APIでの提供のほか、OpenRouter、Vercel、Cloudflareなどのパートナー経由でも提供される。Grok Bot(β)は同社が前日に公開したクラウド上の仮想コンピュータで常時稼働するAIエージェントサービスだ。
API料金は入力100万トークン当たり2ドル、出力100万トークン当たり6ドルから。高速版はこの2倍となる。CursorとGrok Buildでは、提供開始から1週間、プランに含まれる利用量を2倍にするキャンペーンを実施する。
SpaceXAIによると、Grok 4.6は大まかな製品アイデアから動作する初版を作る作業に特に強く、なじみのない領域を調査した上でアプリケーションを構造化し、フィードバックを受けながら改良を重ねられるという。作業が長時間に及ぶ場合には、次の工程に進む前にモデルが自らの成果を検証する動きも見られ始めたとしている。
学習面では、Grok 4.5より長い追加事前学習に加え、Grok 4.5を使って再生成したデータによるSFT(教師ありファインチューニング)の実施に加え、カーネル最適化やWeb開発、CADなどの領域固有の環境を含む強化学習を実施した。安全性についても、モデルの能力に合わせてセーフガードを改良・調整し、リリース前の能力評価とセーフガード調整のテストは過去最大規模になったとしている。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
YouTube、収益化基準を2027年に大幅引き上げへ 新規参加条件が従来の2倍に
-
2
「めっちゃカメレオン」2000万本突破 日本の2人が開発、発売から2カ月で
-
3
Google新スマホ「Pixel 11シリーズ」正式発表 「Gemini Intelligence」向けに設計 カメラも強化
-
4
Anthropic、「Claude」で生成したテキストに“見えない透かし” 日本を含むグローバルに適用へ
-
5
Google、折りたたみスマホ「Pixel 11 Pro Fold」発表 10%軽く、1mm薄くしつつ耐久性強化
-
6
Google版“AirTag”こと「Pixel Tag」登場 10億台のAndroidネットワークで居場所を探知
-
7
RIZAP運営のECサイトに不正アクセス カード情報含む個人情報が流出の可能性 サイトは一時閉鎖
-
8
中国発AIエージェント「Manus」、Metaから独立へ 中国政府が買収に反発、一部ユーザーデータは削除に
-
9
SpaceXAI、AIエージェント「Grok Bot」発表 クラウド環境で常時稼働、GrokやCursorの有料ユーザー向けに
-
10
「食事中に水を飲むと食べ過ぎない」、実はウソ? 食べる量を左右していたのは…… 米研究者が検証
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR