小林啓倫のエマージング・テクノロジー論考

Googleが“自社AIの裏切り”に備え始めた 異例の構想「AI Control Roadmap」とは(1/3 ページ)

 米Googleの研究組織であるGoogle DeepMindは6月、「GDM AI Control Roadmap」(以下、AI Control Roadmap)と題した全36ページの文書を、解説ブログと共に公開した。自社内で稼働するAIエージェントを潜在的な「内部脅威」とみなし、その行動を監視・統制するための技術的な計画をまとめている。

 これは「Gemini」のようなAI製品の発表ではなく、自律的にタスクをこなすAIを社内配備する際の「内部ガードレール」のフレームワークである。

 前回の連載記事でも触れたように、AIエージェントをどう制御するか、というテーマへの注目が日に日に高まっている。しかしAIを開発する企業自身が、自社のAIを「信頼できない存在」として扱う前提のセキュリティ計画を公表するのは異例だ。

 そこで本記事では、AI Control Roadmapの中核を成す2つの概念、AIエージェントの一連の振る舞いを追跡する「行動軌跡監視」と、モデルの能力に応じて統制を段階的に強化する「能力連動型ガバナンス」を解説してみたい。

AIコントロールは「第2の防衛線」

 まず前提となる「AIコントロール」という概念を整理しておこう。AIの安全性というと、AIモデルの価値観や目標を人間の意図に沿わせる取り組み、いわゆる「アラインメント」が思い浮かぶ。

 一方、AIコントロールはこれとは異なるアプローチだ。アラインメントは主にAIモデルのトレーニングをどう適切にするかという話だが、AIコントロールはアラインメントが完全ではない場合に備えて、モデルの「外側」に設けるシステムレベルの防御(第2の防衛線)を指す。

 具体的には、自動監視やアクセス制御、実行環境の堅牢(けんろう)化、インシデント対応などを組み合わせる。仮にアラインメントが不十分で、人間の意図とずれた目標を持つAIエージェントが現れても、引き起こされる被害を一定以下に抑え込むことを狙う。

 AI Control Roadmapの主な対象はエージェント型のAIだ。文書内では「エージェント型配備」(agentic deployments)として「コードの作成・実行や社内インフラとのやりとりを含むツール利用を可能にする、ハーネス(エージェントの実行基盤)上へのAIモデルの配備」と定義している。

 Google DeepMindは、こうしたエージェントがAIの研究開発やサイバー防御を支える「イノベーションのエンジン」になりつつあると指摘する。エージェントが中核業務を担う存在になるからこそ、その振る舞いを統制する仕組みが重要になるわけだ。

「検知回避」と「攻撃実行」の性能測定

 AI Control Roadmapが掲げる防衛条件は2つある。第1に、不整合な意図または行動を信頼できる水準で「検知」できること。第2に、攻撃の試みを「予防・遮断・復旧」できることだ。

 この2つの条件を維持するために、エージェントの能力を2つの独立した軸で捉える。1つは、推論を隠したり監視者を欺いたりできる能力の程度を示す「検知回避能力」。もう1つは、自律性や長期計画、サイバー能力を用いて重大な攻撃目標を実現できる能力の程度を示す「攻撃実行能力」だ。

 前者に対して4段階の検知レベル(D1~D4)、後者に対して3段階の予防・対応レベル(R1~R3)を設定し、モデルの能力が上がるほど防御を引き上げる。これが「能力連動型ガバナンス」の骨格である。

 Google DeepMindは、その全体を貫く原則について「攻撃を検知し防ぐわれわれの能力は、AIエージェントが検知を回避し攻撃を実行する能力を上回らなければならない」と表現している。

“AI版内部不正者”を想定

 AI Control Roadmapの脅威モデルは、極めて保守的なものになっている。セキュリティ上の最悪ケースとして、高能力モデルを丸ごと「信頼できないモデル」として扱い、そのモデルから起動される全てのエージェントやインスタンスも信頼しない。さらに、それらが共通の敵対的目標を持ち、互いに協調しながら監視を回避しようとする可能性まで想定する。

 一方、人間と一定能力以下の弱いモデルは、防御を支援する「信頼できる主体」として扱う。ゼロトラスト(何も信頼しないことを前提に設計するセキュリティの考え方)の発想を、自社のAIそのものに適用した形といえる。

 この脅威像は、企業セキュリティで長年研究されてきた「内部不正者」に似ているが、AIならではの違いがある。

印刷する
SNSでシェア
SpecialPR

小林啓倫のエマージング・テクノロジー論考

生成AIやメタバース、新たなサイバー攻撃など、テクノロジーの進化が止まらない。少しずつ生活の中に浸透し、その恩恵を預かれることもある一方、思いもよらない問題を生み出すこともある。このコーナーでは、さまざまな分野の新興技術「エマージング・テクノロジー」について、小林啓倫氏が解説する。

この連載の記事をもっと見る

この記事の著者

関連記事

こんなメディアも見られています

ITmedia AI+に関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。

よく見られているカテゴリー

アクセスランキング

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10

SpecialPR

ITmedia AI+ SNS

X @itm_aiplusをフォロー

インフォメーション

ITmedia AI+をフォロー

あなたにおすすめの記事PR