AIエージェントを手元で常時稼働 Meta「Muse Glimmer」公開AIニュースピックアップ

Metaが、AIエージェントを手元のPCやMacで常時動かすためのモデルを公開した。300億パラメータのモデルが、なぜGPU1基のメモリに収まるのか。企業のIT部門にとって、ローカルでの実行はどのような選択肢になるのか。

» 2026年08月13日 07時00分 公開
[ITmedia]

この記事は会員限定です。会員登録すると全てご覧いただけます。

 Metaは2026年8月10日(現地時間)、同社のAI研究組織Meta Superintelligence Labsが開発したAIモデル「Muse Glimmer」を公開した。パラメータ数は300億(30B)で、モデルの重みをApache 2.0ライセンスで公開する。常時稼働のローカルエージェント向けに最適化し、MacやPCに搭載するコンシューマー向けGPU1基で動作するとしている。

 ただし、300億パラメータのモデルは、通常の精度では55GBを超えるメモリを必要とする。コンシューマー向けGPUの搭載メモリはこれに届かない。

30Bモデルはなぜ1基のGPUで動くのか

 Metaは、モデルの重みを約4bit精度に圧縮する量子化と、複数のトークンをまとめて生成する投機的デコードを組み合わせ、24GBまたは32GBのメモリ枠にモデル全体を収めた。

 量子化によって、言語モデル部分は20GB未満に縮んだ。これにより、モデルの作業用メモリに当たる「KVキャッシュ」や、画像を理解するための知覚エンコーダ、後述するドラフターモデルを同時に動かす余裕が生まれる。Metaは、この圧縮によるエージェントタスクの精度低下は最小限か、ほとんどないと説明する。

 生成速度は投機的デコードで補う。言語モデルは通常、トークンを1つずつ順番に生成する。長い推論の連鎖や多段のツール呼び出しでは、この方式では応答が遅くなる。Muse Glimmerには「DFlash」を基にした軽量のドラフターモデルが付属する。ドラフターがトークンの塊をまとめて提案し、本体のモデルが並列で検証して、正しいトークンを採用しながら誤りを修正する。Metaは、出力の品質を保ったまま、逐次生成よりも大幅に速く生成できるとしている。ドラフターには量子化版も用意し、メモリの追加消費を抑えた。

 Metaは17GB版の量子化モデルと量子化したドラフターを組み合わせ、MacBookの「M4 Max」「M5 Max」搭載機と「GeForce RTX 5090」搭載機で生成速度を測定した。投機的デコードによる速度の向上幅は、測定した3つの環境の中でGeForce RTX 5090が最も大きい。

DFlashによる投機的デコードを使った場合の生成速度の変化(出典:Metaの公式ブログ)

 学習では、上位モデル「Muse Spark」の出力を使うロジット蒸留で事前学習した。中間学習では、より長い文脈とエージェント寄りのデータを使う。事後学習では、教師ありファインチューニングにオンポリシー蒸留と強化学習を組み合わせた。

ローカル実行で何ができるのか

 想定する用途は、ローカルで動くAIエージェントや関数呼び出し、手元でのコーディング、LLMの出力を別のLLMに評価させる「LLM as a judge」などだ。Metaは、エージェント用途に必要な能力として以下の8点を挙げ、それぞれについて学習と評価を実施したとしている。

  1. エンドツーエンドのタスク完遂:「DeepSearch QA」「MCP-Atlas」「τ-Bench」「SWE-Bench」といったベンチマークで、一連の作業を最後までやり切る能力を測った
  2. ツール利用:長時間の処理の中で、決められた形式に沿って幅広い関数を呼び出す
  3. 多段の推論:長い工程にわたって一貫した計画を保ちながら推論をつなぐ
  4. 失敗からの復旧:ツール呼び出しが失敗したり想定外の結果を返したりした場合に、処理を止めずに原因を診断して再試行する
  5. マルチモーダル入力:専用の知覚エンコーダを備え、テキストと画像を交互に受け取る。スクリーンショットや図表、文書を会話と併せて解釈する
  6. スキャフォールドへの対応:「OpenClaw」をはじめとするエージェントの制御方式で動作する
  7. 推論の強度制御:品質と速度のバランスに応じて推論の強さを選べる
  8. 多言語対応:100を超える言語のデータで学習した

 Metaは、同じサイズ帯のモデル「Gemma4-31B」「Qwen3.6-27B」と比較して、広く使われる複数のベンチマークで高い性能を示したとしている。公開に当たっては、同社が定める「Advanced AI Scaling Framework」の基準で評価し、重みを公開する形での提供について該当する全カテゴリーを確認したという。

 入手経路はHugging Faceで、開発者向けドキュメントも併せて公開した。llama.cpp、MLX、ExecuTorchへの最適化した統合は数日中に提供する。ローカル実行ではOllama、LM Studio、Unsloth、大規模な提供ではvLLMとSGLangに対応し、Together AI、Fireworks AI、OpenRouterを経由した利用もできる。PyTorchの学習機能「TorchTitan」を使えば、自社の用途に合わせた追加のチューニングも可能だ。Metaは、AMD、Arm、Dell、Intel、NVIDIAと組み、機器ごとの性能最適化を進めるとしている。

Copyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。

アイティメディアからのお知らせ

注目のテーマ

あなたにおすすめの記事PR