Google、LLMのメモリ消費を6分の1に削減する新技術「TurboQuant」発表
米Googleは3月24日(現地時間)、新たな圧縮手法「TurboQuant」に関する研究により、LLMを実行するために必要なメモリ量を6分の1に削減できる可能性があると発表した。
この技術は、AIモデルが情報を処理する際に用いる高次元ベクトルデータのサイズを極限まで圧縮し、大規模AIや検索エンジンにおけるメモリのボトルネックを解消するものという。特に、LLMの推論時に頻繁に使用される情報を一時保存する「キーバリュー(KV)キャッシュ」の圧縮において、モデルの精度やパフォーマンスを犠牲にすることなく大幅な効率化を実現するとしている。
TurboQuantは、データの構造を単純化して大部分の圧縮を行う「PolarQuant」と、そこから生じた微小な誤差を1ビットのデータで数学的に補正する「QJL」という2つの手法を効果的に組み合わせている。これにより、事前の追加学習やファインチューニングを行うことなく、KVキャッシュを実質的にわずか3ビットまで圧縮可能になる。
実際のロングコンテキストテストでは、タスクの精度を完全に維持したままメモリサイズを6分の1以下に縮小できたほか、米NVIDIAの「H100」上での計算速度が最大8倍に向上するなど、顕著なパフォーマンス改善が確認された。
この手法は、「Gemini」のような大規模モデルにおけるKVキャッシュのメモリ不足問題を解決する強力な手段となるだけでなく、膨大なデータベースからユーザーの意図や意味を読み取って類似情報を探す「ベクトル検索」の劇的な高速化にも貢献すると期待されている。
Googleは、AIがさまざまな製品に統合されていく中で、こうした基礎的なデータ圧縮技術の重要性は今後ますます高まっていくとしている。なお、TurboQuantに関する一連の研究成果は、リオデジャネイロで4月23日から開催の国際会議「ICLR 2026」で発表する予定だ。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
「楽天銀行から数百万が勝手に移動」「残高が0に」……楽天証券のシステム不具合、連休中に発生
-
2
「クリスタ」素材、大量非公開でユーザー混乱 人物だけでなくペンや公式素材まで セルシス「誤判定もあった」が……
-
3
台風25号で“地下神殿”また稼働 雨水が流れ込む動画公開 今年度7回目で過去最多に
-
4
大雨で「首都圏外郭放水路」稼働 濁流が“地下神殿”を満たすまでの動画公開 国交省
-
5
JCOM障害「インターネットが使えない」 サポート窓口もつながりにくく
-
6
NTT東西が「にじさんじ電報」発売 ポップアップ台紙にはライバーの複製手書きメッセージ
-
7
楽天証券、追加認証の必須化で一部にトラブルか 「無限ループ」「ログインできん」
-
8
「モンスト」キャラの声をAI生成、MIXIのニュース紹介企画に批判続出 実施見合わせへ
-
9
J:COM「ネットつながらない」障害、約9時間で復旧 原因は「調査中」
-
10
ゼロから声を作れる音声生成モデル「Gemini 3.8 Flash TTS」公開 「Gemini Notebook」でも利用可能に
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR