CxO Insights

OpenAIの「AGI到達」宣言に待った! 評価テスト「99.9%」のカラクリと評価団体が反論した真実

» 2026年09月20日 08時00分 公開
[湯川鶴章、エクサウィザーズ AI新聞編集長]
ExaWizards

 米OpenAIが「AGI(汎用人工知能)の時代に入った」と宣言した最新モデル「GPT-6 Astra」について、AGI測定用の評価テスト「ARC-AGI-3」を運用する米ARC Prize財団が「AGIとは言えない」と異論を表明し、議論を呼んでいる。

 OpenAIが宣言の根拠の一つとした「ARC-AGI-3で99.9%」という数字も、評価団体側が中立的な条件で測定すると「62.7%」にとどまり、宣言を支える土台そのものが揺らぎ始めている。

photo OpenAIは9月3日、Astraを「世界で最も知的で、最も整合したモデル」として発表した(以下、写真提供:ゲッティイメージズ)

「AGI時代へようこそ」 評価団体が突きつけた「62.7%」の現実

 OpenAIは9月3日、Astraを「世界で最も知的で、最も整合したモデル」として発表した。発表文では「ARC-AGI-3で99.9%」とほぼ満点の成績を掲げ、記者向け説明会でグレッグ・ブロックマン(Greg Brockman)社長は「個人的には、もう到達したと思う」と述べ「AGIの時代へようこそ」という言葉で説明会を締めくくった。

 ARC-AGI-3は、事前にルール説明のない未知のゲーム環境にAIを置き、自力で法則を探らせ、目標を推測して解かせるテストだ。暗記した知識では解けないため「AIと人間の間に残された知能の差」を測る指標として広く引用されてきた。ここで99.9%という数字が出れば、AGI到達の宣言につながるのは自然な流れに見えた。

 しかし同日、ARC Prize財団は自前の検証結果を公表した。Astraの進歩自体は高く評価し「フロンティアモデルの能力における画期的な節目だ」として賞賛している。一般人約500人の平均データより少ない操作回数で96%の課題をクリアし、試行錯誤の効率性において人間並みに達したと認めている。

 だが、AGIに達したかという点については明確に否定した。「このテストで満点を取っても、AGI達成の証明にはならない」と発足時から規定していたことを再確認し「Astraは大きな前進だが、AGIとは言えない」との立場を崩さない。

 ARC-AGI-3はあくまでルールと正解が決まったパズルであり、正解のない現実世界の複雑な課題を自力で解決できるかを測るものではないからだ。同財団の共同創設者であるマイク・クヌープ(Mike Knoop)氏もX(旧Twitter)で「AGIと呼ぶ証拠はまだない。誰も答えを知らない問題を自力で切り開く力は、まだ実現していない」と投稿している。

「記憶リセット」か「思考の継続」か 37ポイントを跳ね上げたテスト条件

 ARC Prize財団が問題視するのは、99.9%という数字が「どのような条件で測定されたか」という点だ。同財団は検証結果を2種類の条件で公開している。財団側が用意した中立な「標準テスト条件」(標準ハーネス)では62.7%。一方で、OpenAIの専用ツールを使った「個別最適化条件」(プロバイダー・アダプター)では99.9%となった。

 ここでいう「ハーネス」(テスト用ソフトウェア)とは、AIモデルの周囲を包む試験環境のことだ。AIがどんな補助ツールを使えるか、作業の合間に思考内容をどこまで覚えていられるかを制御する。

 標準テスト条件は、どの企業のAIモデルにも同じ制約を課す簡素な仕組みだ。ゲームを1回操作するごとにやりとりが区切られ、次の操作へ持ち越せる記憶は、AIが自分で書き残したメモデータだけに限られる。

 一方、OpenAI専用の条件では、同社のシステム機能をフル活用し、メモだけでなく「AIが頭の中で考えていた途中の思考プロセス」もそのまま次の操作へ引き継げる。例えるなら、手動かすたびに記憶をリセットされながら解くのが標準テスト条件であり、途切れることなく考えを深められるのが専用条件だ。全く同じモデル、同じ問題でありながら、テスト環境の違いだけで「37ポイント」もの差がついた。

 AI周辺の仕組みがどれほど影響したかを示すデータがある。モデルにじっくり考えさせる設定と、ほとんど考えさせない設定を比較したところ、専用の記憶保持ツールを使えば、ほとんど考えさせない設定でも96.7%を記録した。

 これは標準テスト条件で最もじっくり考えさせた場合の62.7%を、34ポイントも上回る。つまり「AIモデルがどれだけ深く考えたか」よりも「過去の記憶を保持できる仕組みがあったか」の方が、テストの点数を大きく左右していたことになる。

 ARC Prize財団は、この2つの数字は「測っている対象が異なる」と説明する。標準テスト条件の62.7%は、各社のモデルを全く同じ土俵に置いて比較した実力値だ。財団側は、本物のAGIであればこの過酷な条件でも解けるべきだと考えている。

 一方、99.9%という数値は、OpenAIが自社モデル用に用意した記憶補助ツールを組み合わせた際の上限値であり、他社モデルとの単純比較には使えない。今後は成績表に両方の数字を、条件明記の上で併記するという。

「パズルの満点=AGI」ではない 正解のない現実に立ちはだかる壁

 「99.9%という成果はモデル自体の知能ではなく、周辺ツールの力によるものではないか」と見る専門家は多い。

 AI研究者のローハン・ポール(Rohan Paul)氏はXで「同じモデルで37ポイントもスコアが動くのは、テストがモデルの頭脳ではなく補助ツールの性能を測ってしまっている証拠だ」と指摘。オランダのITメディアである蘭TNWも9月6日の検証記事で「99.9%を出したのはモデルとツールを組み合わせたシステム全体であり、モデル単体の性能とは区別すべきだ」と強調した。

 しかし「モデル単体と補助ツールをわざわざ切り離して評価することに意味があるのか」という反論も存在する。

 ARC Prize財団のプレジデントであるグレッグ・カムラット(Greg Kamradt)氏はXで、Astra以前から複数の研究チームが独自の補助ツールを組み合わせて90%以上の高得点を出していた事例を挙げた。

 米半導体大手NVIDIA(エヌビディア)のシステム上で動作させた米Anthropicのモデル「Claude Opus 5」が、単体での30.2%から全問正解までスコアを伸ばした例もある。補助ツールによって点数が跳ね上がること自体は珍しくない。

 今回のAstraが異質なのは、補助ツールを一切使わない素の状態でも62.7%という高得点に達し、記憶を引き継ぐ機能を足しただけで99.9%まで到達した点にある。周辺ツールが勝手に問題を解いたのではなく「モデルが自分の思考を忘れずにいられさえすれば、自力で解ける」ことを示しているという見方だ。

 さらに、人間の受験条件と比較する視点もある。ARC-AGI-3における人間の基準データは、一般の被験者が普通に記憶を保ったままプレイした結果だ。標準テスト条件はAIに対して「一手ごとにメモ以外の記憶を消去する」という、人間よりもはるかに厳しいハンデを課している。人間のプレイ条件に近いのは、むしろ記憶を引き継げる専用条件の方だという意見もある。

 もっとも、この反論を考慮したとしても、ARC Prize財団の「まだAGIとは呼べない」という最終結論が揺らぐわけではない。同財団はAGIを「人間ができるあらゆる技能を、人間と同じ効率で身につけられるシステム」と定義しており、単一のパズルテストで高得点を取ったことだけを理由にAGIと認定することはないからだ。

 どれほど高得点であっても、あらかじめ正解が用意されたパズルと、正解のない課題が山積みである現実世界の仕事とでは意味が異なる。

 同財団が2027年初頭に公開を予定している次世代テスト「ARC-AGI-4」では、あらかじめ決められた正解が存在しない、より現実に近い課題を扱う方向で開発が進められている。99.9%か62.7%かという数字の議論の裏で、AI評価の焦点は「AIは思考できているか」から「その思考力は、答えのない現実世界の課題にどこまで通用するのか」という真の汎用性を問うフェーズへと移行している。

photo AI評価の焦点は「その思考力は、答えのない現実世界の課題にどこまで通用するのか」という汎用性を問うフェーズへと移行している

本記事は、エクサウィザーズが運営するAI新聞内の記事「『AstraはまだAGIではない』 評価団体が反論」(2026年9月7日掲載)を、ITmedia ビジネスオンライン編集部で一部編集の上、転載したものです。

著者プロフィール

湯川鶴章

AIスタートアップのエクサウィザーズ AI新聞編集長。米カリフォルニア州立大学サンフランシスコ校経済学部卒業。サンフランシスコの地元紙記者を経て、時事通信社米国法人に入社。シリコンバレーの黎明期から米国のハイテク産業を中心に取材を続ける。通算20年間の米国生活を終え2000年5月に帰国。時事通信編集委員を経て2010年独立。17年12月から現職。主な著書に『人工知能、ロボット、人の心。』(15年)、『次世代マーケティングプラットフォーム』(07年)、『ネットは新聞を殺すのか』(03年)などがある。


視聴無料・LIVE配信:
AI経営時代を勝ち抜く「CxO Insights 2026 秋」

photo

  • 開催日:10月15日(木)
  • 形式:オンラインセミナー
  • 参加費:無料

© エクサウィザーズ AI新聞

アイティメディアからのお知らせ

SaaS最新情報 by ITセレクトPR
あなたにおすすめの記事PR