PR

「AIはクラウドで十分」は本当か? トークン爆発時代のコストとROIをNVIDIAに問う

AIエージェントの普及によって、予想を超える従量課金の増大に直面している企業は多い。AIインフラ投資のROIをどのように評価して、自社に適した環境を構築すべきだろうか。

 AIエージェントが浸透する中、企業は予想を超える従量課金の増大に直面している。コスト削減のために利用を制限すれば社員の生産性や意欲を損ない、外部サービスへの依存を放置すれば事業継続リスクが強まる。

 コストをいかに抑えて、モデルやデータをどこまで自社で制御するか。そして、AIによるリターンをどのように評価するか。これらが、AIインフラ投資の主要な論点になっている。

 企業はAIインフラへの投資をどう判断し、どのような環境を構築すべきなのか。エヌビディアでAIファクトリー事業を担う石田大樹氏と、Agentic AIソフトウェアの事業開発を担当するシニアマネージャーの津田恵理子氏に、ITmedia AI+編集長の井上輝一が聞いた。

左からエヌビディアの津田恵理子氏(エンタープライズ事業本部 ソフトウェア ビジネスデベロップメント シニアマネージャー)、石田大樹氏(AIファクトリープラットフォーム事業部 ディレクター)、ITmedia AI+編集長の井上輝一

※以下、敬称略

「トークン爆発」が突きつけたコストとモデル主権

井上: 前回は「『AIファクトリー』とは何か」を伺いました。あれから数カ月がたち、市場の反応はどう変化していますか。

石田: 市場の関心は、AIファクトリーのハードウェアそのものより、その上で動くエージェントAIなど、ユーザーにより近いソフトウェアへ移っている印象です。

 その結果、生じているのが「トークン爆発」です。AIを早くから導入している企業ほどトークン消費量が大幅に増えて、課金負担が重くなっています。最近はコストの懸念を訴えるお客さまの声をよく聞くようになりました。

津田: 背景にはコスト問題に加えて、オープンウェイトモデルの品質向上もあります。1兆パラメーターを超えるモデルが登場して、コーディングなどの実務でも「オープンモデルで十分使える」という認識が広がりました。

 AIモデルの主権や事業継続性への不安も大きな要因です。過去に一部のモデルの提供が突然止まった事例のように、外部サービスへの過度な依存にはリスクが伴います。マネージドサービスの場合、モデルの更新で回答が変わってしまい、厳格な業態では試験のやり直しが発生する懸念もあります。

石田: AIの業務同士でクラウドのGPUリソースを取り合うリスクもあります。いざ基幹業務を回そうとしてもGPUが足りない事態が起き始めており、「自分たちで確実に使えるリソースを手元に持っておくべきだ」という考えが出てきています。

ROIは単一ユースケースではなく、基盤全体で積み上げる

井上: そうした不安や課題感から「オンプレミス環境も検討すべきか」という相談が増えているのですね。

 ただし、環境の構築費や電力コストを考えると「クラウドの方が安い」となりがちです。ROI(費用対効果)はどのように捉えるべきでしょうか。

津田: 全社のハードウェア投資と一括で捉えずに、まずは処理件数や作業時間の削減、顧客満足度の向上など効果測定しやすいユースケース単位で見ることが重要です。

 加えて、面倒な作業から解放されて社員が本来の仕事に集中できるといった、金銭化できない定性効果も無視できません。

 さらに重要なのは、1つのユースケースだけで全額回収しようとしないことです。個別の部門で判断せず、ガードレール機能やモデルを共通化し、GPUリソースをプール化して需要に応じて柔軟に配分することで、AIインフラ全体でROIを積み上げる視点が不可欠です。

石田: 動かしたいアプリケーションのGPU消費量を全社で束ねて、統合基盤をどう設計するかというアプローチが欠かせません。

 ただし大企業になるほど組織が縦割りで、現場からのボトムアップだけでは「現行業務の延長」の議論になりがちです。将来を見据えてトップダウンで意思決定する企業の方が、導入はスムーズに進んでいる印象です。

ROIを最大化する「ハイブリッドルーティング」

井上: 実際に経営層やIT部門から相談を受けた際、NVIDIAとしてはどのような解決策をお勧めしていますか。

津田: 最も関心を持たれるのは、コスト問題に直結する「ハイブリッドルーティング」のアプローチです。コーディングエージェントなどの普及でトークン費が激増して、利用制限をかける海外企業が出始めていますが、生産性を上げるツールを取り上げてしまうのは大きな損失につながります。

 エージェントの処理を分解してみると、高度な推論が必要な部分は一部で、要約や翻訳など定型的なタスクが多く含まれるケースが多々あります。そうしたタスクには、自社でホストする軽量なオープンモデルで対応可能です。

 「NVIDIA NeMo Switchyard」などの仕組みを使えば、このルーティングを自動化できます。実際、高性能なクローズドモデル単体で全て処理した場合と、そのクローズドモデルと300億パラメーター規模の軽量モデル「NVIDIA Nemotron 3.5 Lightning」を組み合わせて、タスクを自動で振り分けた場合を比較した事例があります。

 その結果、最も高度なタスクを処理するためにクローズドモデルを呼び出す必要があったのは全体の7%にとどまりました。残りのシンプルなタスクはNVIDIA Nemotron 3.5 Lightning 30Bで処理して、全体のトークンコストを約73%削減できました。

石田: 機密性の高い処理は社内のモデル、その他はクラウドにといった適材適所に使い分ければ、セキュリティとコスト削減を両立させられます。次世代プラットフォーム「NVIDIA Vera Rubin」のリファレンスデザインでも、多様なワークロードに応じてさまざまなサーバ構成を提示しています。「オンプレかクラウドか」の二者択一ではなく、要件に合わせて最適解を選ぶ「ハイブリッドルーティング戦略」がこれからのスタンダードになるはずです。

自社データで小型モデルを鍛えて運用負担を軽減

井上: 軽量なモデルを自社でホストして活用できれば、ROIはさらに向上させられそうですね。

津田: その通りです。Nemotronのようなモデルを自社の業務データでチューニングすれば、特定業務で大規模モデルと同等の精度を出すことも十分に可能です。

 小型モデルなら消費するGPUリソースも少量で済みます。重要なのは、既存のモデルをそのまま利用するだけでなく、モデルのチューニングやRAGを通じて、自社のデータやノウハウをAIシステムに取り込むことです。その上で、用途や要件に応じて最適なモデルを選択し、柔軟に切り替えられる基盤を整える。特定のモデルに依存せず、自社の知見をAIの価値へ継続的に変える仕組みこそがAIファクトリーのポイントです。

井上: 一方で、自社環境でオープンモデルを運用するとなると、ハードルが高く感じられませんか。

津田: ご指摘の通り、オープンウェイトのモデルは持ってきただけで動くわけではなく、推論エンジンの選定や最適化、必要なライブラリと依存関係の管理、脆弱(ぜいじゃく)性への対応など、推論サービスとして運用するための環境を整える必要があります。

 そこでNVIDIAが提供しているのが、コンテナ型のソフトウェア「NVIDIA NIM」です。設定や脆弱性対応などが完了した状態で提供されるため、AIモデルの自社専用APIエンドポイントをスピーディーに立ち上げられます。一度これを使うと「運用の手間が省けて楽だからずっと使い続けたい」とおっしゃる方は多いですね。

石田: ハードウェアからソフトウェアまで、AIは複雑なスタックで成り立っています。われわれは「5 Layer AI Cake」(5層のAIケーキ)と呼んでいますが、GPUだけを考えればいいわけではなく総合的な設計が必要です。

 とはいえ、全ての企業が最初から巨大なAIインフラを組めるわけではありません。最初は手頃なワークステーションで試して、実績が出たらリファレンスアーキテクチャで本番環境にスケールアップできます。NVIDIAにはパートナーさまと共に、導入から運用まで一貫して寄り添い支えるエコシステムがあります。「何から始めるべきか」といった段階から気兼ねなくお声がけいただきたいですね。

止まらない“優秀な同僚”を支えるAIインフラの条件

井上: 今後、AIエージェントの活用やそれを制御するプラットフォームの導入が進む中、AIインフラはどのような存在になるとお考えですか。

石田: 近年はさらにミッションクリティカルになり、まさに“必需品”になってきた実感があります。NVIDIAとして最先端の技術に挑戦し続けつつ、信頼性の高い環境を確実に提供できるかがこれまで以上に問われていると感じます。

津田: これまでのチャット型AIは、人がプロンプトを入力して、その問いや指示に応じて回答を返す、いわば必要なときに人が利用するツールでした。しかしAIエージェントやそれらを制御するプラットフォームが登場して、人間が都度指示しなくてもシステムを24時間監視し、問題への対応やレポート作成を継続的に担えるようになっています。まるで“優秀な同僚”が常に隣にいるような状態です。 AIが日常業務を継続的に担うようになるほど、それを支える基盤には高い可用性が求められます。AIの停止が業務の停滞や停止に直結して、事業継続上の重大なリスクとなり得るためです。

 もはやAIを使わない選択肢はありません。だからこそクラウドの利便性を生かしながら、万が一利用が難しい状況になった際も自社環境で縮退運転できるハイブリッド基盤を持ち、選択肢をバランスよく持てる状態が企業の安心につながると思います。

井上: 最後に、AI投資に悩む読者にメッセージをお願いします。

石田: AIファクトリーに投資して後悔はしないと思います。コンピュータは「コスト」から「利益を生む存在」に変わりました。AIインフラを賢く使い分ければ、その利益はさらに最大化されます。企業の皆さまも一歩を踏み出して、新しい世界を楽しんでいただきたいですね。

津田: まずはご自身でエージェントを試して、その威力を体感してみていただきたいなと思います。

 また、AI活用を進める際には特定サービスに依存せず、新しい技術にも柔軟に対応できる選択肢を自社で持つこと。それこそが、変化の激しい時代において企業を守り抜く強力な戦略になるはずです。

印刷する
SNSでシェア

関連記事

提供

エヌビディア合同会社

アイティメディア営業企画/制作:ITmedia AI+編集部/掲載内容有効期限:2026年12月5日