検索
レビュー

理論値以上のゲーミング性能を発揮できる秘密は? MSI Claw 8 EX AI+で知る「Intel Arc G3 Extreme」の実力(3/5 ページ)

IntelがポータブルゲーミングPCに特化したSoC「Intel Arc G3」シリーズをリリースした。このSoC、理論性能だけを見るとライバルに劣るのだが、実際にゲームを遊ぶと性能面で“逆転”することがある。その秘密に、「MSI Claw 8 EX AI+」を通して迫る。

Share
Tweet
LINE
Hatena
※本記事はアフィリエイトプログラムによる収益を得ています

Arc G3 ExtremeもRyzen AI Z2 Extremeもスペックを“盛っている”

 理論性能値だけを見ると大差を付けられているArc G3 Extremeが、なぜゲームパフォーマンス、いやグラフィックス性能においてRyzen AI Z2 Extremeを“しっかりと”上回っているのか。

 これについて、GPU回りに詳しい人なら「『RDNA 3』以降のRadeonはGPUコア(Compute Unit:CU)を増やさずに、CU当たりのSIMD演算器を増やしただけだけ。理論性能は上がるけど実行性能はそれほど上がらないのは当然ですよ」とツッコむだろう。でも、ちょっと待ってほしい。実は、IntelもPanther Lakeの内蔵GPU(Arc B300シリーズ)で同じ方向性の「改良」を受けている。

 要するに、Arc G3 Extremeが内蔵するArc B390 Graphicsの「7.07TFLOPS」というピーク性能も“盛った”値と言えなくもないのだ。

 順を追って解説したい。

SIMD演算器の追加は効果薄?

 AMDはRDNA 3以降のアーキテクチャ、製品でいうと「Radeon RX 7000」シリーズ以降のGPUにおいてCU当たりのSIMD演算器を2倍に増やした。CU自体を2倍にせず、CUが搭載するSIMD(Single Instruction/Multiple Data:並列処理を行う手法の1つ)用の演算器を2倍としたのだ。これが、RDNA 3以降のRadeonシリーズにおいて理論性能値が高めに出る秘密である。

 この2倍に増やしたSIMD演算器は、依存関係がないSIMD演算に限り同時並列で動かせる「デュアルイシュー」を実現できる一方で、近代ゲームグラフィックスではデュアルイシューが働くケースが減ってきたとされる。もう少し具体的にいうと、シェーダープログラムの複雑化と高度化によって「依存関係のないSIMD演算」が減少し、結果としてSIMD演算器を2倍にしたことの恩恵を受けづらくなっているのだ。

 強いていうと、「理論性能値ほどの実効性能が発揮できない」ことがRDNA 3以降のRadeon GPUの弱点である。

RDNA 3
AMDはRDNA 3アーキテクチャでCU1基当たりのSIMD演算器を2倍に増やしている。この構造は、現行の「RDNA 4アーキテクチャ」(Radeon RX 9000シリーズ)でも踏襲されている

 とはいえ、この方向性のチューニングはIntel Arcシリーズも同様である。

 IntelのGPUアーキテクチャでは、Xeアーキテクチャの単位ベクトル演算器である「Xe Vector Engine(XVE)」におけるSIMDの実行レーン数は、初代Xe GPUでは8レーン(SIMD8)だったのに対して、2世代目のXe2 GPUでは16レーン(SIMD16)に倍増した。その代わり、XVE自体の数はXeコア1基当たり16基から8基に半減している。

 一応、これらを式で表すとこうなる。

Xe GPUのXeコア1基当たりの演算器:SIMD8×16 XVE=128基

Xe2 GPUのXeコア1基当たりの演算器:SIMD16×8 XVE=128基

 筆者は、この方針転換(構造改変)を「処理できるスレッド数を半分にする代わりに、一度にこなせる演算密度を増やした」と解釈している。ある意味で「命令パイプラインを太くして、実ワークロードでのハードウェア稼働率を底上げする」という、実戦的なアーキテクチャの最適化といえなくもないのだが、結局のところピーク時の理論性能(TFLOPS)の数字を稼ぐ設計とも表現できる。

 “やり口”だけ見れば、RDNA 3以降のRadeon GPUも、Xe2 GPUも同じ改変をしているのだ。

Render Slice
Xe2 GPUのRender Sliceの模式図。モバイル系SoCの内蔵GPUでは、これが最大で2基搭載されることになる

Xe3 GPUはXeコアを増やして“同じこと”をやっている

 Arc G3シリーズを含むPanter LakeアーキテクチャのSoCが内蔵する「Xe3 GPU」ではこれがどうなったかというと、Xeコアの構成自体は変えずに、1つのRender Sliceに搭載するXeコアを4基から6基に増やすことで性能を強化している。

 Render SliceにはXeコアだけではなく、「ラスタライザ」「ジオメトリパイプライン」「ピクセルバックエンド(ROP)」といった固定機能のグラフィックスハードウェアを内包している。NVIDIAのGPUでいうところの「GPC(Graphics Processing Cluster)」に相当し、これだけを切り出しても単体のGPUを機能を果たせるようになっている。

 Arc G3シリーズにおけるXe3 GPUのRender Sliceは、ノートPC向けのSoCにおけるXe2 GPUと同じ2基しかない。

 要するに、Xe3 GPUでは「Xeコアを4基に据え置いてRender Sliceの数を増やす」のではなく、「Xeコアを6基に増やしてRender Sliceの数を据え置く」という選択をしたのだ。少し言い変えると、固定機能のグラフィックスハードウェアの数はそのままにして演算器だけ増やしたということになる。

 単位時間当たりのピクセルスループットはそのままで、ピーク理論性能(TFLOPS)の数字だけを稼ぐ設計の“延長線上”にあるともいえる。

Xe3
Xe3 GPUのRender Sliceは、Xe2 GPUと同じ2基構成だ。しかし、Xeコアが1.5倍に増量されているので、演算性能は同クロックで動かしても1.5倍になる

 このことについて、Xe3 GPUの“肩”を持つような解説をしておこう。

 「Xeコアを6基に増やしてRender Sliceの数を据え置く」という選択は、昨今のゲームグラフィックスにおいてCompute Shader(コンピュートシェーダー)への依存度が上がっているという事実を踏まえたものだ。RDNA 3以降のRadeon GPUにおけるSIMD演算器の増量も、同じことがいえる。

 今や、一部の高度なゲームエンジン(例えば「Unreal Engine 5」)では、特殊なライティングや特殊なラスタライズ処理まで、Compute Shaderで実践するようになっている。ゆえに、GPUがこの方向のチューニングを受けることは、ある意味でごく自然なことなのだ。

Copyright © ITmedia, Inc. All Rights Reserved.

ページトップに戻る