2030年までに、1兆パラメータを持つLLMの推論コストが90%以上削減される ガートナー予想
この記事は新野淳一氏のブログ「Publickey」に掲載された「マイクロソフト、Claude CodeやGitHub Copilotに「このアプリをデプロイせよ」と指示すればAIが最適なインフラ構成やサービスでデプロイしてくれる「Azure Skills Plugin」公開」(2026年3月25日掲載)を、ITmedia NEWS編集部で一部編集し、転載したものです。
米調査会社のガートナーは、2025年と比較した場合の大規模言語モデルにおける推論実行のコストが、1兆個のパラメータを持つモデルでは2030年までに90%以上削減されるとの予想を発表しました。
この大きなコスト削減効果は、半導体およびインフラにおける処理効率の向上、モデル設計の革新、チップ利用率の向上、推論特化シリコンの利用増加、特定のユースケースに向けたエッジデバイスの応用などの複数の技術改善を組み合わせたことで実現されると、同社のウィル・ソマー氏(シニアディレクター兼アナリスト)は述べています。
この予想は2つのシナリオに分かれています。
1つは、最先端のチップ技術を前提とした「フロンティアシナリオ」(最前線シナリオ)です。
そしてもう1つは、既存の半導体の代表的なベンチマークを基にした「レガシーブレンドシナリオ」です。
いずれのシナリオでも処理コストは大きく削減されると予想されていますが、「レガシーブレンドシナリオ」は処理能力を低く想定しているケースにおいて、その絶対的コストは「フロンティア」シナリオよりもかなり高くなっています。
処理コストの削減がそのまま利用コストに結びつかない
ただし、こうしたLLMの処理コスト削減が、そのまま利用する企業側におけるAIのコスト削減には結びつかないとガートナーは警告しています。
それは一般的な生成AIのチャットbotの利用に比べて5倍から30倍のトークンが処理されるAIエージェントの利用が企業で広まることで、全体としてはより多くのトークンを処理することになり、それがトークンあたりの処理コスト削減の効果を打ち消してしまうからだと説明されています。
今後企業がコスト面で効率的に生成AIを活用するには、日常的で高頻度なタスクについては安価な小規模かつドメイン固有の言語モデルで処理し、高度で複雑な処理のみ高コストが想定される本格的に大規模な言語モデルで処理すべきだとガートナーはアドバイスしています。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
ITmedia NEWSに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
SpecialPR
本日の新着記事
アクセスランキング
-
1
「食事量は1日1200kcal以下、でも肥満」な人を14日間追跡調査 痩せない理由は……米コロンビア大などの研究
-
2
なぜ酒蔵の許諾なしに? 「VTuberコラボ日本酒」騒動、主催者が経緯説明 仲介者による調整で「準備進んでいると認識」
-
3
かっぱ寿司「配布前のコラボグッズ、フリマで買わないで」 プリキュアコラボ発表日に注意喚起
-
4
LINEヤフーグループ、自己都合退職急増 前年度比65%増の2791人
-
5
「ペンギンを返して」→「3匹全部採用して」 批判殺到のSuica新キャラ、ファンアートが空気を変えた? SNSの声
-
6
「ランジェリーパープルじゃない」「買おうと思ってたのに」 iPhone 18 Pro/Pro Maxの色に落胆の声
-
7
幻の「ちいかわ」コラボ第3弾皿、捨てちゃうの? くら寿司に聞いてみた
-
8
Anthropic在籍の研究者2人も同調──「AIが人類を滅ぼしかねないと本気で考えている」
-
9
「iPhone 18」シリーズ徹底比較 「17」シリーズとの違いをチェック
-
10
映画「バックルームズ」が怖くなかったマンガ家、基になったネット都市伝説にハマって本作の楽しみ方を理解する
ITmedia NEWS SNS
インフォメーション
注目情報をチェック
ITmediaNEWSをフォロー
あなたにおすすめの記事PR