OpenAIの「AGI到達」宣言に待った! 評価テスト「99.9%」のカラクリと評価団体が反論した真実
米OpenAIが新モデル「GPT-6 Astra」の発表に伴い「AGI」(汎用人工知能)到達を宣言したのに対し、評価テストを運用する米ARC Prize財団が「AGIとは言えない」と異論を唱えた。根拠とされたテストの「99.9%」という高得点は、OpenAI専用の記憶補助機能を使った結果であり、標準条件では「62.7%」に急落。さらに財団は、正解のあるパズルを解くだけでは現実世界の課題を解決するAGIの証明にならないと指摘する。
米OpenAIが「AGI(汎用人工知能)の時代に入った」と宣言した最新モデル「GPT-6 Astra」について、AGI測定用の評価テスト「ARC-AGI-3」を運用する米ARC Prize財団が「AGIとは言えない」と異論を表明し、議論を呼んでいる。
OpenAIが宣言の根拠の一つとした「ARC-AGI-3で99.9%」という数字も、評価団体側が中立的な条件で測定すると「62.7%」にとどまり、宣言を支える土台そのものが揺らぎ始めている。
「AGI時代へようこそ」 評価団体が突きつけた「62.7%」の現実
OpenAIは9月3日、Astraを「世界で最も知的で、最も整合したモデル」として発表した。発表文では「ARC-AGI-3で99.9%」とほぼ満点の成績を掲げ、記者向け説明会でグレッグ・ブロックマン(Greg Brockman)社長は「個人的には、もう到達したと思う」と述べ「AGIの時代へようこそ」という言葉で説明会を締めくくった。
ARC-AGI-3は、事前にルール説明のない未知のゲーム環境にAIを置き、自力で法則を探らせ、目標を推測して解かせるテストだ。暗記した知識では解けないため「AIと人間の間に残された知能の差」を測る指標として広く引用されてきた。ここで99.9%という数字が出れば、AGI到達の宣言につながるのは自然な流れに見えた。
しかし同日、ARC Prize財団は自前の検証結果を公表した。Astraの進歩自体は高く評価し「フロンティアモデルの能力における画期的な節目だ」として賞賛している。一般人約500人の平均データより少ない操作回数で96%の課題をクリアし、試行錯誤の効率性において人間並みに達したと認めている。
だが、AGIに達したかという点については明確に否定した。「このテストで満点を取っても、AGI達成の証明にはならない」と発足時から規定していたことを再確認し「Astraは大きな前進だが、AGIとは言えない」との立場を崩さない。
ARC-AGI-3はあくまでルールと正解が決まったパズルであり、正解のない現実世界の複雑な課題を自力で解決できるかを測るものではないからだ。同財団の共同創設者であるマイク・クヌープ(Mike Knoop)氏もX(旧Twitter)で「AGIと呼ぶ証拠はまだない。誰も答えを知らない問題を自力で切り開く力は、まだ実現していない」と投稿している。
「記憶リセット」か「思考の継続」か 37ポイントを跳ね上げたテスト条件
ARC Prize財団が問題視するのは、99.9%という数字が「どのような条件で測定されたか」という点だ。同財団は検証結果を2種類の条件で公開している。財団側が用意した中立な「標準テスト条件」(標準ハーネス)では62.7%。一方で、OpenAIの専用ツールを使った「個別最適化条件」(プロバイダー・アダプター)では99.9%となった。
ここでいう「ハーネス」(テスト用ソフトウェア)とは、AIモデルの周囲を包む試験環境のことだ。AIがどんな補助ツールを使えるか、作業の合間に思考内容をどこまで覚えていられるかを制御する。
標準テスト条件は、どの企業のAIモデルにも同じ制約を課す簡素な仕組みだ。ゲームを1回操作するごとにやりとりが区切られ、次の操作へ持ち越せる記憶は、AIが自分で書き残したメモデータだけに限られる。
一方、OpenAI専用の条件では、同社のシステム機能をフル活用し、メモだけでなく「AIが頭の中で考えていた途中の思考プロセス」もそのまま次の操作へ引き継げる。例えるなら、手動かすたびに記憶をリセットされながら解くのが標準テスト条件であり、途切れることなく考えを深められるのが専用条件だ。全く同じモデル、同じ問題でありながら、テスト環境の違いだけで「37ポイント」もの差がついた。
AI周辺の仕組みがどれほど影響したかを示すデータがある。モデルにじっくり考えさせる設定と、ほとんど考えさせない設定を比較したところ、専用の記憶保持ツールを使えば、ほとんど考えさせない設定でも96.7%を記録した。
これは標準テスト条件で最もじっくり考えさせた場合の62.7%を、34ポイントも上回る。つまり「AIモデルがどれだけ深く考えたか」よりも「過去の記憶を保持できる仕組みがあったか」の方が、テストの点数を大きく左右していたことになる。
ARC Prize財団は、この2つの数字は「測っている対象が異なる」と説明する。標準テスト条件の62.7%は、各社のモデルを全く同じ土俵に置いて比較した実力値だ。財団側は、本物のAGIであればこの過酷な条件でも解けるべきだと考えている。
一方、99.9%という数値は、OpenAIが自社モデル用に用意した記憶補助ツールを組み合わせた際の上限値であり、他社モデルとの単純比較には使えない。今後は成績表に両方の数字を、条件明記の上で併記するという。
「パズルの満点=AGI」ではない 正解のない現実に立ちはだかる壁
「99.9%という成果はモデル自体の知能ではなく、周辺ツールの力によるものではないか」と見る専門家は多い。
AI研究者のローハン・ポール(Rohan Paul)氏はXで「同じモデルで37ポイントもスコアが動くのは、テストがモデルの頭脳ではなく補助ツールの性能を測ってしまっている証拠だ」と指摘。オランダのITメディアである蘭TNWも9月6日の検証記事で「99.9%を出したのはモデルとツールを組み合わせたシステム全体であり、モデル単体の性能とは区別すべきだ」と強調した。
しかし「モデル単体と補助ツールをわざわざ切り離して評価することに意味があるのか」という反論も存在する。
ARC Prize財団のプレジデントであるグレッグ・カムラット(Greg Kamradt)氏はXで、Astra以前から複数の研究チームが独自の補助ツールを組み合わせて90%以上の高得点を出していた事例を挙げた。
米半導体大手NVIDIA(エヌビディア)のシステム上で動作させた米Anthropicのモデル「Claude Opus 5」が、単体での30.2%から全問正解までスコアを伸ばした例もある。補助ツールによって点数が跳ね上がること自体は珍しくない。
今回のAstraが異質なのは、補助ツールを一切使わない素の状態でも62.7%という高得点に達し、記憶を引き継ぐ機能を足しただけで99.9%まで到達した点にある。周辺ツールが勝手に問題を解いたのではなく「モデルが自分の思考を忘れずにいられさえすれば、自力で解ける」ことを示しているという見方だ。
さらに、人間の受験条件と比較する視点もある。ARC-AGI-3における人間の基準データは、一般の被験者が普通に記憶を保ったままプレイした結果だ。標準テスト条件はAIに対して「一手ごとにメモ以外の記憶を消去する」という、人間よりもはるかに厳しいハンデを課している。人間のプレイ条件に近いのは、むしろ記憶を引き継げる専用条件の方だという意見もある。
もっとも、この反論を考慮したとしても、ARC Prize財団の「まだAGIとは呼べない」という最終結論が揺らぐわけではない。同財団はAGIを「人間ができるあらゆる技能を、人間と同じ効率で身につけられるシステム」と定義しており、単一のパズルテストで高得点を取ったことだけを理由にAGIと認定することはないからだ。
どれほど高得点であっても、あらかじめ正解が用意されたパズルと、正解のない課題が山積みである現実世界の仕事とでは意味が異なる。
同財団が2027年初頭に公開を予定している次世代テスト「ARC-AGI-4」では、あらかじめ決められた正解が存在しない、より現実に近い課題を扱う方向で開発が進められている。99.9%か62.7%かという数字の議論の裏で、AI評価の焦点は「AIは思考できているか」から「その思考力は、答えのない現実世界の課題にどこまで通用するのか」という真の汎用性を問うフェーズへと移行している。
本記事は、エクサウィザーズが運営するAI新聞内の記事「『AstraはまだAGIではない』 評価団体が反論」(2026年9月7日掲載)を、ITmedia ビジネスオンライン編集部で一部編集の上、転載したものです。
著者プロフィール
湯川鶴章
AIスタートアップのエクサウィザーズ AI新聞編集長。米カリフォルニア州立大学サンフランシスコ校経済学部卒業。サンフランシスコの地元紙記者を経て、時事通信社米国法人に入社。シリコンバレーの黎明期から米国のハイテク産業を中心に取材を続ける。通算20年間の米国生活を終え2000年5月に帰国。時事通信編集委員を経て2010年独立。17年12月から現職。主な著書に『人工知能、ロボット、人の心。』(15年)、『次世代マーケティングプラットフォーム』(07年)、『ネットは新聞を殺すのか』(03年)などがある。
© エクサウィザーズ AI新聞
関連記事
請求書は青天井 Microsoftトップが「AIモデル大手に主導権を渡すな」と叫ぶ真意
MicrosoftのナデラCEOらが相次いで「AIモデル大手に主導権を渡すな」と叫び、波紋を広げている。企業の独自ノウハウが汎用モデルに吸収されるリスクや、AIエージェント化に伴う「青天井の請求書」への恐怖が背景にある。しかし、脱モデル依存を煽る2大巨頭の正論の裏には、自社プラットフォームへ顧客を囲い込もうとする思惑も透けて見える。エンタープライズAIの最新の地政学を考える。
「学歴は無価値に」 米トップエンジニアが明かす、AI時代に“大化けする人材”の共通点
「履歴書の時代は終わった」──AIの普及によって、企業の採用や人材評価のルールが大きく変わり始めている。
売上高93%増のPalantirが独走 AI競争の主戦場「制御層」を奪い合う3陣営
AI競争の焦点はモデル性能から、企業の業務・データ・権限を管理しAIを現場で動かす「コントロールプレーン」(制御層)へと移った。20年前から「オントロジー」(業務の地図)を蓄積してきた米Palantir Technologiesは第2四半期決算で売上高93%増と異次元の成長を記録。この独壇場に対し、米Snowflakeなどのデータ陣営、Amazon Web Servicesなどのクラウド陣営、米OpenAIなどのモデル陣営が参入し「法人AIの覇権」を巡る最終戦争が始まった。
中国は敵ではない NVIDIAトップが警告する「米中共存」とAIインフラの盲点
米NVIDIAのジェンセン・フアンCEOは、中国をAIの脅威とみなして封じ込めようとする米国の現在の政策姿勢に、真っ向から異を唱えた。「中国を敵に仕立て上げることは最善の答えではない、彼らと対話することが最も安全な道だ」という。「競争相手と敵は違う」というファン氏のこの一言が、議論の出発点だ。
人間は「取締役」、AIが「CEO」 サム・アルトマンがAGI論争を終了させてまで語りたかった「ASI」の未来図
「AGI」(汎用人工知能)は、気付かないうちに到達してしまった――だから次はASI(超知能)の定義を決めよう」。米OpenAIのサム・アルトマンCEOは、AGIをめぐる終わりのない論争に決着をつけるかのような提案をしている。宣言を急ぐ裏には、Microsoftとの間に抱える“巨額契約の時限爆弾”があった。AIがCEOになる」衝撃の未来図とは?
「人間がコードを書く時代は終わった」 “Claude Code”が引き起こす「知能の価格崩壊」
AIがソフトウェアを書く時代が、いよいよ本格的に始まりつつある。「GitHub」の公開コミットの約4%が、米AnthropicのAIエージェント「Claude Code」によって書かれていて、2026年末には20%以上に達するという。この変化は、単なる「AIコーディングツール」の普及ではない。PCの使い方そのものが変わり始めている。
AIによる“社会崩壊”まで残り3年 トップ識者が警告する「地獄のシナリオ」
AIがもたらす生産性の爆発は、最終的には人類に豊かさをもたらす可能性がある。しかしその途中には、社会が崩壊しかねない危険な移行期があるという。
AI競争は「Googleの圧勝」で終わるのか? Gemini 2.5 Proの衝撃
米国のテック系人気ユーチューバーの何人かが、こぞって「AI開発競争はGoogleが勝利した」という見出しの動画をアップしている。これでGoogleの勝利が決定したのかどうか分からないが、少なくともOpenAIの首位独走の時代は終わったのかもしれない。



