ハイエンドスマホ向け新型SoC「Snapdragon 8 Elite」にみるAI半導体の進化(2/4 ページ)

» 2024年11月28日 19時30分 公開

鍵を握る「NPU」のチューニング

 Microsoftは5月に掲げた「Copilot+ PC(新しいAI PC)」の動作要件の1つに、「CPU/SoCが統合するNPUの性能が40TOPS以上」というものがある。

 NPUは推論ベースのAIが用いる演算に特化したプロセッサのことで、NPUは脳のニューラルネットワークになぞらえた「Neural Processing Unit」の略称だ。NPUはAIのオンデバイス実行に重要であると同時に、NPUがAIのオンデバイス実行の全てではないことには留意したい。

 繰り返しだが、NPUは推論演算に特化している。ゆえに当該の演算を高速かつ省電力で実行可能だ。同様の演算はGPU(Graphics Processing Unit)」でも行えるが、NPUの方が効率面でメリットがある。LLMを始めとして、オンデバイス動作を前提とする生成AIは「学習」は行わず、推論のみを行うことが多い。

 ゆえにNPUの性能が、ほぼイコールでCPU/SoCのAI性能ということになりやすい。

シディカ・ネバカー氏 ハイエンドスマホ向けの新型SoC「Snapdragon 8 Elite」のAI推論(インターフェンス)性能について解説するQualcomm Technologiesのシディカ・ネバカー氏(製品マネジメント担当シニアディレクター)

 ただし、NPUの性能指標とされている「TOPS」、つまり1秒当たりの命令処理回数が必ずしも実際の性能を示すものとは限らない点にも注意が必要だ。

 例えば「Aの推論を実行するのに、○TOPSの性能が必要」というただし書きあると、そのNPUがどの程度の推論を実行する“キャパシティ”を備えるか、おおよその目安にはなる。しかし、「Aの推論」を「○TOPS」の処理性能を持つ“異なる”NPUで処理した場合、その結果(パフォーマンス)がイコールになるとは限らないのだ。

 というのも、NPUによって得意とする(最適化している)演算方法や、演算結果をメモリに書き込む速度が異なるからだ。TOPSの数字はマーケティング的には分かりやすく、ユーザーにとっても参考になるものの、数値だけでNPUの“強み”と“弱み”を知ることは難しい。

 そういう観点では、「MLCommons」が開発した機械学習ベンチマークテスト「MLPerfシリーズ」は、推論ベースのAIにおける客観的なパフォーマンスを知る手段としてデファクトスタンダードとなっている。

MLPerf MLPrefシリーズは、任意団体であるMLCommonsが管理している

 このあたりの話題は、Qualcommが2月に公表したブログエントリーやホワイトペーパーで詳細に解説されている。

 QualcommのSoC「Snapdragonシリーズ」に搭載されているNPU「Hexagon(ヘキサゴン)」は、元々は信号変換処理を担うDSP(Digital Signal Processor)として搭載されていた。その出自から、かつてのHexagonは大量の積和(MAC:Multiply Accumulate)演算に特化していた。

 しかし、昨今のAI処理では大量の行列(Matrix/Tensor)演算が発生する。行列演算とは、すなわち大量のMAC演算でもある。ゆえに、昨今のHexagonはAIにおける推論実行に最適化するチューニングが施されている。

 先に紹介したホワイトペーパーでは、文中でHexagonがどのようなチューニングを施されてきたのか紹介している。例えば2022年12月に発表されたハイエンドスマホ向けSoC「Snapdragon 8 Gen 2」のHexagonでは、AI推論の実行におけるレイヤーが10層以上になっても、実行単位である「Microtile(マイクロタイル)」内でScalar演算/Vector演算/Tensor演算を独立して演算処理できるようにした。これにより、メインメモリへのアクセス回数が減少し、結果的に実効性能の大幅な引き上げに成功したという。

 またAI推論では「浮動小数点」ではなく「整数演算」が主に用いられるが、実行する推論の内容によっては必ずしも高精度でなくても構わない。そこでSnapdragon 8 Gen 2のHexagonでは「INT4」演算をハードウェアレベルでサポートした。例えば「INT8」ならINT4の2倍の数を扱えるが、そこまでの精度を必要としない場合はINT8の演算器を「INT4×2」の演算器として運用することで、実効速度の向上と消費電力の削減を両立した。

Snapdragon 820 SnapdragonのNPU「Hexagon」のルーツをたどると、2015年にリリースされた「Snapdragon 820(MSM8916)」に搭載されたDSPにたどり着く(ホワイトペーパーより引用)

 そして2023年10月に披露されたハイエンドスマホ向けSoC「Snapdragon 8 Gen 3」では、メインメモリとしてLPDDR5X-4800をサポートすることでメモリのアクセススピードを改善した。

 「AI推論とメモリって関係があるの?」と思うかもしれないが、LLMを実行する際には「モデル」がメモリ上に大量に展開されるため、NPUとメモリは頻繁にデータをやりとりする。言い換えると、メモリのアクセススピードが速ければ、その分だけLLMからの回答(レスポンス)も早く得られることになるため、メモリの容量とアクセススピードは重要なのだ。

 メモリのアクセス速度の改善は、少なくとも今後数年にわたってLLMの実行に必要十分なパフォーマンスが得られるよう志向した結果だと考えられる。現に、Snapdragon 8 Gen 3を搭載するスマホにおいて、オンデバイスである程度の規模のLLMを動作させる試みは行われている。

Snapdragon 8 Gen 3 Snapdragon 8 Gen 3では、メインメモリのアクセススピードを引き上げている。これはAIの推論パフォーマンスを向上するための取り組みだ(ホワイトペーパーより引用)

 今回、新たに登場したSnapdragon 8 Eliteでも、Hexagonの構造に少し手が入っている。ITmedia Mobileに掲載したレポートでも触れているが、今回のHexagonではScalar演算とVector演算を担うユニットが事実上2倍に増えた。Tensor演算ユニットは、大量の行列演算、AI推論的にいうと「畳み込み演算」を担い、Vector演算はトークン処理にまつわる演算に活用されている。

 現在の生成AIの基本的な理論「Transformer」では、「プロンプト」など入力された文書をいったん推論エンジンが理解できるトークンに変換(エンコード)した上で畳み込み演算を行い、結果を人間が解釈できる形に復元(デコード)して出力するというプロセスを取る。現状のLLMは、トークンが長大化してしまう傾向があるため、特にVector演算を強化することが、実効性能の向上に直結するというわけだ。

 先述の通り、CPU/SoCの開発では少なくとも5〜7年程度先を見据える必要がある。5〜7年先のユースケースをにらみつつ、CPU/SoCの“どこ”を“どのように”強化するのかという方向性を的確に探れるかどうかが、半導体メーカーの腕の見せ所となる。

デモ Snapdragon 8 Elite搭載のスマホでレシートを読み取り、割り勘を行わせるデモ展示。画像認識のみならず、命令の解釈やレシートの読解にもLLMが活用されている
Vector演算 LLMのトークン長大化に対応するためにVectorユニットを大幅強化している

Copyright © ITmedia, Inc. All Rights Reserved.

アクセストップ10

2026年07月28日 更新
  1. 鳴り物入りで登場した「Copilotキー」が早くもお蔵入りか──チャットボットからAIエージェントへの移行が示すMicrosoftの誤算 (2026年07月27日)
  2. 64GBメモリ/2TBストレージ/Ryzen AI Max+ 395搭載のハイエンドミニPC「MINISFORUM MS-S1 MAX」がタイムセールで27%オフの43万2799円に (2026年07月25日)
  3. なぜ元Appleエンジニアは熱意を失い起業したのか? スマートグラス「Even G2」イベントで語られた、次世代機「G3」へのロードマップ (2026年07月27日)
  4. 480mm水冷に160mmファン搭載ケース! 夏のアキバは「大風量パーツ」がアツい (2026年07月27日)
  5. エアコンがない部屋を冷やせる「Dreemstar 冷風扇」がセールで50%オフの9980円に (2026年07月23日)
  6. 高価なグラフィックスカードを守る「過熱保護ケーブル」に注目! 夏を乗り切るNoctua製簡易水冷も販路拡大で続々入荷 (2026年07月25日)
  7. ポタ電と組み合わせて使える「Soraiori ポータブルエアコン」がセールで16%オフの2万9980円に (2026年07月27日)
  8. NVIDIAが次世代AI超解像技術「DLSS 5」の今秋投入を明らかに/MicrosoftとMistralが欧州におけるAI演算能力の拡大で戦略的提携を発表 (2026年07月26日)
  9. プラネックス、10GbE接続に対応した5ポート搭載アンマネージドスイッチ (2026年07月24日)
  10. Jackery、定格1500Wを実現するポータブル電源「1000 New」の新モデル 19%小型化 (2026年07月27日)
最新トピックスPR

過去記事カレンダー