AIが長時間タスクをこなす性能、想定を超えるスピードで成長 MythosとGPT-5.5がブレークスルーか
AIエージェントが自律的にタスクを処理できる時間が、研究機関の予想を上回る速さで伸びている。複数の第三者機関による最新の評価では、米Anthropicの「Claude Mythos Preview」(以下、Mythos)や米OpenAIの「GPT-5.5」といった最新モデルが既存モデルの性能を大きく上回り、既存の評価環境が測定限界に達しつつあることが明らかになった。
米国の非営利研究機関METRは5月8日(現地時間、以下同)、Mythosの評価結果を公開し、同モデルが50%の確率で完遂できるソフトウェアエンジニアリング、機械学習、サイバーセキュリティに関するタスクの長さ(50%タイムホライズン)を「16時間以上」と算出した。METRは現行の測定に使用しているタスク群では、16時間を超える測定が信頼性に欠けると指摘し、同モデルの能力の上限を正確に評価できていないとした。
英国の政府機関AI Security Institute(AISI)は2月、AIモデルが80%の確率で完遂できるサイバーセキュリティ関連タスクの長さ(80%タイムホライズン)が2024年後半以降「4.7カ月ごとに倍増」していると推定。これは25年11月時点の試算「8カ月ごと」から大幅に加速している。
しかし、その後公開されたMythosとGPT-5.5はこの推定値をさらに上回った。AISIはこの成長スピードが新たなトレンドになるのか、これらのモデルが特殊なのかは不明だとしている。
METRとAISIは、AIの性能が想定を上回る速さで向上している状況を受けて、より高性能なモデルを評価できる手法を開発中だとしている。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
アクセスランキング
-
1
「アサヒ・ニチレイの惨劇」はどう防げた? 米HP幹部が語る“ネット遮断AI”と日本攻略
-
2
Geminiの「Gem」廃止へ、11月17日から「スキル」へ刷新
-
3
富士通が脱人月モデルへ CROが説く「AI時代のバリュープライシングへの転換」とは
-
4
ファナックがAI溶接エージェント実演 ロボット制御装置が安全PLCに
-
5
生産能力2倍へ、リコー厚木新棟はペロブスカイト太陽電池など事業拡大の布石に
-
6
AIが書いたコードは「ブラックボックス」でいい? Claude Code作者が語るプロトタイプと本番の線引き
-
7
AIを使ったCOBOLのJava変換、「百害あって一利なし」 AI活用の“落とし穴”を考察
-
8
安川電機が熟練工の「感覚」をAIロボットで再現、カメラで見ながらアーク溶接
-
9
損保ジャパン、Gemini Enterpriseを従業員約2万人に展開 標準機能の制約をどう補っている?
-
10
AIエージェントに頼るだけでは失敗する 「あと5年」で打つべき次の一手
SpecialPR
ITmedia AI+ SNS
インフォメーション
注目情報をチェック
ITmedia AI+をフォロー
あなたにおすすめの記事PR