検索
Special

AI推論の「メモリ足りない問題」を解消 CXL対応KVキャッシュサーバはなぜ注目されるのかAIインフラにおける『縁の下の力持ち』CXL

AI推論処理能力のスケーラビリティ確保やリソース最適化を考慮したインフラ設計においては、メモリの能力をどう最大化させるかが課題になる。本稿では業界標準の新規格「CXL」と、CXLを採用したインフラ設計において重要なポイントを解説する。

PC用表示
Share
Tweet
LINE
Hatena
PR

AIインフラの主役交代――GPUから「メモリ」へ。CXLが切り拓くAI推論の新時代

 生成AIの進化が止まらない。大規模言語モデル(LLM)は数百億から数兆規模のパラメーターを持つようになり、企業においてはRAGやAIエージェントなど、より高度な活用が始まっている。

 AIインフラというと、多くの人はGPUを思い浮かべるだろう。実際、ここ数年のAIブームはGPU性能の向上に支えられてきた。しかし、AIの利用が本格化した今、業界の注目はGPUそのものから「メモリ」へと移りつつある。

 その背景にあるのが、「メモリの壁」(Memory Wall)と呼ばれる課題だ。

AIの性能を制約するのは計算能力ではない

 従来のコンピュータシステムは、CPUやGPUの演算性能向上が性能改善の中心だった。しかし生成AIの推論処理では事情が異なる。

 LLMの推論は「プレフィル」と「デコード」の2つのフェーズに大別される。プレフィルは入力されたプロンプトを一括処理する工程であり、GPUの演算能力が重要だ。デコードは1トークンずつ文章を生成するが、その度に過去の会話履歴や計算結果を参照する必要がある。

 このとき利用されるのが「KVキャッシュ」だ。KVキャッシュは過去の計算結果を保持し、再利用して推論を高速化する仕組みだ。だが、会話が長くなるほど容量が膨大になる。現在の生成AIでは、このKVキャッシュがGPUメモリ(VRAM)を圧迫し、推論性能を制限する大きな要因になっている。

 問題なのは容量だけではない。GPUは高速に演算ができても、必要なデータをメモリから十分な速度で取り出せなければ待ち時間が発生する。これが「メモリの壁」だ。

 近年では、AI推論処理の多くが演算性能ではなくメモリアクセス性能に依存しているとされており、GPUの性能向上だけでは限界が見え始めている。

従来の対策が抱える限界

 こうした問題に対し、これまでもさまざまな対策が講じられてきた。代表的なものが量子化だ。KVキャッシュやモデルデータの精度を落とし、必要なメモリ量を削減する。しかし精度低下による品質への影響は避けられない。

 GPUを追加する方法もあるが、GPUは非常に高価であり、消費電力や冷却コストも比例して増加する。SSDなどのNVMeストレージにデータを退避させる方法もあるが、DRAMやVRAMと比べてレイテンシが大きく、AI推論性能への影響が避けられない。

 つまり、これらは根本解決ではなく対症療法にすぎないのだ。

CXLがもたらすパラダイムシフト

 そこで注目されているのが「CXL」(Compute Express Link)だ。CXLはIntel、AMD、Arm、NVIDIA、Microsoft、Googleなど、業界を代表する企業が参加する「CXL Consortium」によって策定されたコンピューティングリソース間通信の新しい業界標準規格だ。

 ガートナーは、2028年までに新規出荷されるサーバの過半数がCXL対応メモリを搭載すると予測している*。これは単なる新技術ではなく、サーバアーキテクチャそのものを変える可能性を持っている。

 CXL最大の特徴は、メモリをサーバ単位で固定的に利用するのではなく、共有リソースとして扱えることにある。

 従来は各サーバが独立したメモリを持っていたため、余ったメモリリソースを他のサーバで利用できなかった。CXLはPCIeをベースとしながら低レイテンシでメモリにアクセスでき、キャッシュコヒーレンシー機能でデータ整合性も自動的に維持する。CXL 3.0以降のファブリック機能を活用すれば複数のサーバやGPUから利用可能なメモリプールを構成し、ホスト間でのデータ整合性も維持可能だ。必要な時に必要な分だけメモリを割り当てられるため、メモリ利用効率が飛躍的に向上する。

 つまりCXLは、将来的にメモリをネットワーク越しに利用可能にする技術として注目を集めているのだ。

* https://enterprisezine.jp/article/detail/19027

AI推論時代に重要性を増すKVキャッシュ

 これからのコンピューティング環境の設計において特に注目すべきなのは、AI推論におけるKVキャッシュの扱いだ。

 学習フェーズではGPU演算能力が重要だが、企業で実際に利用されるAIサービスの多くは推論が中心だ。チャットbotやAIエージェント、RAG、コールセンター支援、文書検索などはいずれも推論処理が主体となる。そして推論処理では、長いコンテキストや大量の同時接続を処理するために、巨大なKVキャッシュの効率的な管理が極めて重要になる。

 今後、AIが企業システムに深く組み込まれるほど、GPU性能競争だけでなく「いかにKVキャッシュを効率よく扱うか」が競争力を左右することになるだろう。

ペンギンソリューションズが示した実用解

 こうした課題に対して、ペンギンソリューションズ(旧:日本ストラタステクノロジー)は業界でも先進的な取り組みを進めている。

 同社はCXL Consortiumにも参加し、「SMART Modular」ブランドで「CXL Type-3」メモリ製品を展開している。さらに2026年には、実運用を前提としたCXLベースKVキャッシュサーバ「MemoryAI KV Cache Server」を発表した。

図
MemoryAI KV Cache Server(提供:ペンギンソリューションズ)《クリックで拡大》

 この製品は最大11TBのメモリを搭載でき、GPUメモリに収まりきらないKVキャッシュをCXLメモリへオフロードする機能を持つ。

 この機能を実装したことで、次のような効果が得られる。

  • OOM(Out of Memory)問題の解消
  • メモリの壁の緩和
  • GPU稼働率向上
  • AIの応答開始時間(TTFT)の短縮
  • 長大コンテキストへの対応
  • GPUクラスタのライトサイジング

 NVIDIAが提供する分散推論フレームワーク「NVIDIA Dynamo」が目指す階層型KVキャッシュ管理にも適合することから、今後のAI推論基盤の中核技術として位置付けられている。

AIインフラの次なる主戦場

 これまでAIインフラの議論はGPU中心だった。AIモデルは今後も巨大化し、長文脈化し続ける。GPUだけを増やすアプローチは限界に近づいており、メモリ中心のインフラ設計が不可欠だ。CXLはその未来を支える「縁の下の力持ち」として、AIインフラの新しい標準となるだろう。

 今後のAIインフラは、CPU中心からGPU中心へ移行したように、さらに「GPU中心からメモリ中心」へと進化していく可能性がある。

 生成AIブームの次に訪れるのは、AI推論の本格普及だ。これからのAIインフラを語る上で、CXLとKVキャッシュサーバは欠かせない存在になっていくだろう。

連載「AIインフラにおける『縁の下の力持ち』 CXL」

 本稿のより詳しい情報は、ペンギンソリューションズのブログ「AIインフラにおける『縁の下の力持ち』 CXL」を参照ください。


※この記事は、ペンギンソリューションズより提供された記事をITmedia エンタープライズ編集部で一部編集したものです。

Amazonギフトカードが当たる!アンケート実施中

本記事に関連して「AIインフラと推論処理」についてのアンケートを実施しています。回答された方の中から抽選で10名様に、Amazonギフトカード(Eメールタイプ)3000円分をプレゼントいたします。当選者には、アイティメディアIDにご登録のメールアドレス宛にギフトをお送りします。当選者発表はギフトの送付をもってご連絡とさせていただきます。ぜひ下記アンケートフォームよりご回答ください。

ログイン または 会員登録(無料)いただくとアンケートフォームが表示されます。オレンジ色の「アンケートに回答する」ボタンからアンケート回答をお願いいたします。

Copyright © ITmedia, Inc. All Rights Reserved.


提供:ペンギンソリューションズ株式会社
アイティメディア営業企画/制作:ITmedia エンタープライズ編集部/掲載内容有効期限:2026年8月21日

Amazonギフトカードが当たる!

「AIインフラと推論処理」についてのアンケートを実施しています。アンケートにご回答いただいた方の中から、抽選で10名様にAmazonギフトカード3000円分をプレゼントいたします。

ページトップに戻る