ニュース

次世代技術「HBC」からスマートグラスを動かす「1bit AI」の限界と可能性まで――パーソナルデバイスの最新AI事情:Snapdragon Summit 2026(2/2 ページ)

Qualcommが開催した「Snapdragon Summit 2026」では、パーソナルデバイスにおけるオンデバイスAIの最前線が語られた。本稿では、スマートグラスなどで注目を集める「1bit AIモデル」の実用性と限界、そして次世代SnapdragonがどのようにAI処理へと最適化されていくのか、Qualcomm担当者の声とともに読み解く。

前のページへ |       

Snapdragonは今後どのようにAIに最適化されていくのか?

 ウェアラブルデバイスにおけるAI対応の課題は、AIモデルのオンメモリ展開における容量の制約にあったが、スマートフォンやPCに搭載されるSnapdragonではどのような形でAI最適化が進み、今後ハードウェアはどうなっていくのだろうか。ポイントをまとめてみた。

 今回発表された「Snapdragon 8 Elite Extreme Gen 6」で目立った機能強化といえば、Prime CoreがモバイルSoCのCPUとしては初の5GHzを突破したことだ。

 しかし地味と言っては失礼だが、CPUを含め全体にブラッシュアップが図られており、AI推論実行の上で下支えとなっている。

advertisement

 1つは「ANF(Adreno Neural Fusion)」と呼ばれる、Adreno GPUにおけるAI超解像にも利用されているニューラル処理用のMatrix Coreだ。

 Hexagon NPUにおいてもTransformer専用の固定機能ブロックの追加やコンテキスト長の拡大に対応して、KV CacheやSoftmaxでのスワップアウトによる処理速度低下を防ぐことで高いトークン生成速度を維持している。

 この他、ローカルSRAMを50%増量することで外部DRAMへのアクセスを最小限に抑え、NPU内部でコンテキストや推論を維持してアクセス遅延を減らす工夫が行われている。

 そして注目は、Oryon CPUに搭載されたCPUコア間で共有L2キャッシュプールを動的配分するFlex Cacheだろう。AIエージェントの世界では与えられたタスク(目標)を完遂するために、別のAIエージェントを呼び出したり、あるいは必要なタスクを何度も立ち上げて目標に向かって再帰処理を繰り返すという、いわゆる「Orchestrator(指揮者)」的な役割がAIエージェントには与えられることになる。

 ただ、基本的にユーザーの指示は具体的ではなく、その“意図”を理解してコンピュータが実行可能なタスクに分解する処理が発生することになり、再帰処理の“マスター”を担う部分がCPUの役割となる。

 前出のスクマー氏によれば、実際にアクションを実行する前に全ての処理を完了する必要があり、多くのマルチスレッド処理を有効にすることが非常に重要になるという。この性能を生かすのがFlex Cacheの役割の1つであり、CPUコア間で発生するやり取りをL2キャッシュ内で完結させることで外部DRAMとのアクセスを最小限にし、パフォーマンス向上へと結びつくわけだ。


AIエージェント時代のSoCを象徴する機能拡張ともいえる「Oryon Flex Cache」

 スクマー氏は、現状のモバイル(PC)SoCのAI処理には、3つのボトルネックが存在するという。1つは演算性能で、主に「Time to First Token(初回トークン生成における遅延)」において演算器(NPU)の性能がレスポンスを左右するという。前述のようにSnapdragonでは着実にこの部分を強化しており、改善が進んでいるといえる。

 2つめがメモリの帯域幅で、「Time to First Token」をクリアすると、その後の生成トークンレートは帯域幅の壁にぶつかる。同氏によれば、特にスマートフォンやウェアラブルなどのモバイル機器の世界ではメモリ帯域幅に強い制約があり、基板設計上からLPDDR5を4チャンネル(毎秒約80~100GB)で動かすのが物理限界になるという。

 そして3つめに問題になるのがメモリ容量の壁で、旺盛なデータセンター需要からHBM増産でウェハーが奪われた結果、DRAM価格の高騰により、OEM側でメモリ容量を増やすことがコスト的に厳しくなっているという話だ。

 3つめについては時間が解決するしかないが、2つめの問題解決の鍵となるのが初日の基調講演レポートでも触れられていた「HBC(High Bandwidth Compute)」だ。

 以前のレポートでも説明したように、もともとはデータセンター向けSoCのDragonflyとセットで発表された技術であり、仕組み的には2026年6月に開催された「Investor Day 2026」の技術資料でもまとめられている。

 「Near Memory Compute」と呼ばれるプロセッサコアの“ダイ”とメモリの距離を近付けて電力ロス低減(低発熱)とアクセス帯域向上を図る仕組みであり、消費電力やコスト面で優位にあるという。

 とはいえ、データセンター向けのHBCをそのままモバイルに応用しようとすると発熱や電力消費が高すぎて機器設計やバッテリ枯渇の課題があるため、それをモバイル向けに最適化させようというのがポイントとなる。

 詳細については2027年3月のMWCで発表されるというが、おそらくは2028年から2029年以降の実用化を目指す技術になるとみられる。


Investor Day 2026で公開された「HBC(High Bandwidth Compute)」に関する資料の抜粋。HBMについて解説している

HBCに関する解説。LPDDRをスタッキングしてSoCのダイに近接させるようだ

競合技術に比べて、費用対効果面もメリットが大きいという

(取材協力:クアルコムジャパン)

前のページへ |       

Copyright © ITmedia, Inc. All Rights Reserved.