モデル性能だけでは選べない Kimi K3から考える、企業で使うAIの調達基準:AIビジネスのプロ 三澤博士がチェック 今週の注目論文
Kimi K3の技術レポートが明かした価値は、2.78兆パラメータという規模だけではありません。自律エージェントをどのような環境で訓練し、何をもって「仕事を完了した」と判定したのでしょうか。後編では、訓練と評価の環境から企業が自社で持つべきコア領域を考えます。
この連載について
AIやデータ分析の分野では、毎日のように新しい技術やサービスが登場している。その中にはビジネスに役立つものも、根底をひっくり返すほどのものも存在する。本連載では、ITサービス企業・日本TCSの「AIラボ」で所長を務める三澤瑠花氏が、データ分析や生成AIの分野で注目されている最新論文や企業発表をビジネス視点から紹介する。
前編では、Kimi K3の技術レポートから、2.78兆パラメータと100万トークンの文脈を支えるアーキテクチャを読み解きました。そこで見えたのは、モデルを「動かせること」と、必要な速度や可用性を備えた業務サービスとして「使えること」は別問題だという事実です。実際、Moonshot AIは2026年8月、Kimi K3をAzure、AWS、Google Cloudで提供するための収益分配契約を3社と協議していると報じられました(2026年9月上旬時点で未締結)。
後編は視点をモデルの中身から広げて、このモデルがどのような環境で鍛えられ、どう採点されたのかに注目します。
差がついているのは、モデルよりも訓練環境
初期モデルの構築である「事前学習」を終えたモデルを、実用的な振る舞いへ仕上げる工程(事後学習)には、3つのステップがあります。まず、教師ありファインチューニング(SFT)で初期能力を与え、実行結果を機械的に検証できる環境やモデル評価器を用いた強化学習(RL)で専門能力を高め、最後に複数の専門モデルを1つのモデルへ統合します。
普段AI開発に関わらない読者の方にはイメージしにくいのが、中核となる強化学習の方法です。初期の強化学習はAIが出したテキストに対して、人間が回答の良しあしを手動で採点するスタイルでした。しかし「Kimi K3」をはじめ、OpenAI、Anthropicなどが公開している最先端モデルはエージェントを用いた強化学習をしています。エージェントによる強化学習とは、AIモデル自身を自律エージェントとして仮想のパソコン環境に入れ、実際にツールを動作させ、その実行結果から自動的にフィードバックを得て自習させるというものです。
実務で使えるコードを書き、「Slack」や「Gmail」などのアプリを連携させて自律的に仕事を完遂する能力を高めるうえでは、モデルを実際に行動させ、その実行結果から学ばせる動的な強化学習環境が重要な役割を果たします。
この最先端の訓練において、Kimi K3がレポートを通じて手法を明かした点は画期的です。
Kimiチームはこのエージェント訓練を「一般タスク」「汎用エージェント」「コーディングエージェント」という3つの領域に分けました。さらにそれぞれを「思考の深さ」(推論レベル:low、high、max)の3段階に分けて訓練し、合計9つの専門モデルを作りました。これらを最終的に1つのモデルへ融合させるプロセスまで明らかにしています。
先行する非公開モデルも、裏では同様の「思考レベルに応じた訓練と融合」を実行していると推測されますが、その具体的な手法はブラックボックスのままです。Kimi K3は事後学習の設計を本技術レポートで詳しく開示し、モデルの重みに加えて、サンドボックス基盤「AgentENV」やエキスパート並列実装「MoonEP」、KDAカーネル「FlashKDA」など一部の主要基盤を公開した点に価値があります。ただし、訓練と評価の環境全体がそのまま再現可能な形で公開されたわけではありません。
さらに、Kimiチームが用意した訓練と評価の環境のスケールも圧倒的です。複数の模擬日にまたがる持続的な環境の中で、GmailやSlackなどの実在サービスを模したアプリケーションをまたぎ、相互依存的なイベントに対処させ、長大な実行と検証のループを実施しました。
特定のシステムに依存させない工夫
より興味深いのは、その訓練の方法です。
一般的に、AIエージェントを特定のシステムやプロンプトのルールに固定して訓練してしまうと、AIはその特定の手法に慣れてしまい(過学習)、環境が少しでも変わると使い物にならなくなります。
これを防ぐため、Kimiチームはシステムプロンプトやメモリ管理、ツールとの連携といったエージェントの構成要素を細かくモジュール化しました。
これらのモジュールを組み合わせることで、自社の「Kimi Code」だけでなく、「Claude Code」や「Codex」といった主要なエージェント実行環境を模した構成を再現できる仕組みを整えました。
これにより、Kimi K3は特定の実行基盤への依存(過剰適応)を回避し、異なるツール仕様やプロンプト構成にも柔軟に対応できる汎用性を獲得しました。
採点の対象は「環境が実際にどうなったか」
評価の作り込みも徹底しています。長期的なアシスタント業務のために、Gmail、「Notion」、Slack、「Canvas」といった実在アプリケーションの模擬実装が用意され、その上に人事、法務、金融の専門業務を模した課題が設計されました。エージェントは複数の模擬日にまたがって持続する環境の中で、アプリケーションをまたいで発生する相互依存的なイベント群に対処します。1回の試行が数千回のツール呼び出しと数百万トークンの文脈に達することもあり、各イベントには決定的なルールまたは別のモデルによる評価基準が個別に付いています。
自律実行タスク(AET)と呼ばれる枠組みでは、エージェントに初期状態、制約付きの目標、ツールによる行動空間、実行予算、そして独立した検証者が与えられます。
- 参照となる手順書なし:タスクの分解、ツールの選択、計画、エラーからの復旧、いつ終わらせるかの判断まで自分で行う必要があります
- 「やったつもり」の自己申告に報酬は出さない:強化学習における報酬は、エージェントが自己申告した完了報告ではなく、検証者エージェントによる最終的な環境状態の評価に基づいて与えられます
自律実行タスク(AET)におけるAIの試行錯誤と進捗。ブラックボックス化されたシステムの複製タスクにおいて、Kimi K3が自らツールを呼び出しながらタスクを完遂していく推移。縦軸の完成度曲線(タスク進捗)が「AIの自己申告」ではなく、独立した検証者が「システムの最終状態」をチェックして採点した進捗となっている(技術レポート図10より引用、日本語は筆者による)
測り方を変えれば、その裏をかく挙動も現れます。Kimiチームはこうした不正行為を検出してペナルティを与える仕組みを構築しました。
- 長文回答による加点狙いへの対策:正解を機械的に検証できない一般タスクでは、出力を長くして高評価を狙う挙動を抑えるため、一定の長さを超えた候補は比較で自動的に負けとするルールを設定
- 見掛け上の高速化への対策:GPUカーネル最適化のタスクでは、CUDAグラフの再生、入力のキャッシュ、精度の切り下げといった見掛け上速く見せる手口を検出して罰則を与える仕組みを用意し、開発中に新しい手口が観測されるたびにルールを拡張したとされている
ここで注目すべきは、公開されたものとされていないものの差です。
レポートが公開を明記しているのは、モデルの重みに加え、AgentENVやMoonEP、FlashKDAなど一部の基盤です。一方で、模擬アプリケーション群、知識グラフによるタスク合成、各種の検証者については、公開の記載がありません。
つまり、重みを手に入れても、この評価環境は付いてきません。
自社業務についても、業務を再現でき、検証でき、AIの自己申告に頼らない評価環境を持てるかどうかが、ベンダー比較とPoC評価の精度に直結します。ここは、実装を外部へ委託する場合でも、業務の目的と合格基準を定義し、最終的に受け入れる主導権は企業自身が持つべきコア領域です。
結論
企業に本レポートが提示した真の価値は、モデルの説明そのものではなく、その裏側で明かされた運用の考え方にあります。今後LLM(大規模言語モデル)を調達、内製化する際に企業が本当に持つべきなのは、なんでもできる巨大なLLMではなく、次の3つの力です。
- 自社の業務を厳密に定義する力:AIに何を完了させるのか、どのデータと権限を使わせるのか、どこまで自動化し、どこで人へ引き継ぐのかを決める
- 仕事を厳格に採点する力:AIの自己申告ではなく、業務の最終状態、規約違反、再現性を確認し、本当に仕事が終わったかを判定する
- 必要な品質と応答時間を妥当な原価で提供する運用設計:モデルの選定だけではなく、キャッシュ、要求の分離、監視、障害時の復旧まで含めて設計する
これらは外部ベンダーへ実装を委託してはいけないという意味ではありません。実装や運用を委託しても、業務の目的と合格基準を定義し、最終的に受け入れる責任は企業側に残ります。
オープンソースAIの真の民主化とは、無料で賢いモデルが手に入ることではありません。企業自身が「自社の業務をどう定義し、どう厳格に採点するか」という評価の主権を取り戻すことにかかっています。
Copyright © ITmedia, Inc. All Rights Reserved.
関連記事
2.78兆パラメータなのに「8GBで動く」Kimi K3 それでも企業利用が難しい理由
2026年7月、Moonshot AIが2.78兆パラメータのオープンウェイトモデル「Kimi K3」を公開しました。誰でも入手できる巨大モデルの登場は、オンプレミスでのAI内製化を目指す企業に何をもたらすのでしょうか。
OpenAI「GPT-6 Astra」発表 "重大"と判定された使用不可の能力とは
OpenAIは最新AIモデル「GPT-6 Astra」の提供を始めた。幅広い業務での性能向上をうたう一方、同社は一部の機能を制限し、監視の仕組みを組み込んだ上で段階的に展開する。同社が“重大”と判定した能力とは何か。
AIエージェントを手元で常時稼働 Meta「Muse Glimmer」公開
Metaが、AIエージェントを手元のPCやMacで常時動かすためのモデルを公開した。300億パラメータのモデルが、なぜGPU1基のメモリに収まるのか。企業のIT部門にとって、ローカルでの実行はどのような選択肢になるのか。
AIエージェント活用を阻む“予算の壁” セールスフォースらの新機能は打開策になり得るか?
企業にとってはあらかじめAI利用コストを想定できないと投資が決まらない。そうなると予算が立てられず、ROIの見通しもつかない。そんな企業のAIエージェント活用に立ちはだかる“予算の壁”を打破するにはどうすればよいのか。セールスフォース、IBM、マネーフォワードが提供を開始した最新機能はその打開策となるのか。