ニュース

AIエージェントの暴走をハードとソフトで防ぐ──NVIDIAが「Open Agent Safety Platform」を発表、Anthropicらとも連携

NVIDIAは、自律型AIエージェントを安全に実行するためのプラットフォームを発表した。昨今報告されるエージェントの暴走問題に対処するため、カーネルレベルの隔離環境とハードウェアベースの監視を組み合わせ、ポリシー逸脱を即座に遮断するという。

 米NVIDIAは9月28日(現地時間)、AIエージェントの開発から展開までの安全性を強化するプラットフォーム「NVIDIA Open Agent Safety Platform」を発表した。エージェントを実行するソフトウェアやハードウェア全体にわたるガバナンス(統制)と制御を提供する。

 近年、AIエージェントが評価環境を抜け出し、本来アクセスすべきでないシステムに到達してしまう問題が複数報告されている。これらは、エージェントがアプリケーション層のセキュリティ制御を回避したことで発生したとしており、NVIDIAはエージェントの行動をモデルやエージェントの外部から独立して制御する仕組みが必要だと説明している。

 NVIDIAはブログで、この状況を1990年代のインターネット黎明(れいめい)期になぞらえている。当時のWebブラウザが、不正なコードからPCを守るために、タブごとの「サンドボックス」という独立環境を生み出したように、AIエージェントにもモデルの外部から独立して制御する「信頼のレイヤー」が必要だということだ。

advertisement

「Open Agent Safety Platform」の参加企業

エージェントシステムを構築する「5つの原則」

 プラットフォームの設計において、NVIDIAは5つのコア原則を掲げている。具体的には、「ポリシーが検証可能であること」「監視や制御がエージェントの外部(アウトオブバンド)で行われること」「モデルへの経路をコントロールポイントとすること」「エージェントの権限拡大に合わせて思考の可視化を行うこと」、そして「インフラ、ランタイム、アプリケーションの各層で責任を共有すること」だ。

 今回のNVIDIA Open Agent Safety Platformは、この原則に基づいてオープンソースソフトウェアの「NVIDIA OpenShell」と、ハードウェアを活用したシステム設計である「NVIDIA Sentry」の組み合わせで構成されている。

ソフトウェア層:ゼロトラスト環境を提供する「OpenShell」

 OpenShellは、カーネルレベルで隔離されたサンドボックス環境でエージェントを実行するランタイムソフトウェアだ。ファイルやネットワーク、プロセスに対するアクセス権限を厳密に定義したポリシーを適用し、エージェントの実行中も監視する。

 APIキーなどの認証情報はエージェントの外部で管理し、許可された要求にのみ本物のキーを付与する。同社のCPU「NVIDIA Vera」上で動作し、ArmやIntelなどサードパーティー製のコンピューティングプラットフォームにも拡張できるという。

ハードウェア層:ミリ秒単位で遮断する「Sentry」

 Sentryは、同社のDPU(Data Processing Unit)「NVIDIA BlueField-4」上で動作する独立した監視システムだ。エージェントの活動をチップレベルで継続的に監視し、ポリシーの境界を越えようとする動きを検知した場合、ミリ秒単位でエージェントを隔離し停止する。エージェントや攻撃者からは見えない帯域外の領域から、ハードウェアベースでセキュリティを適用するとしている。

 NVIDIAは、既にAnthropicやMicrosoftなど100以上の組織と協力し、エージェントのセキュリティ強化に取り組んでいる。OpenShellのソースコードなどは、GitHubなどを通じて提供している。

 例えばAnthropicは、「Claude Managed Agents」とOpenShellなどを統合し、サンドボックスを通じたエージェントへのアクセスを厳格に管理する。また、SpaceXAIは、コーディングエージェントの権限制御に、SalesforceはSlack上からのエージェント活動の可視化と人間による承認プロセスに本技術を応用している。

 AIエージェントが複雑で自律的なタスクを担うようになる中、その安全性を担保する強固なインフラの重要性は高まっている。NVIDIAのハードウェアとソフトウェアを融合させたアプローチは、エージェントエコノミーを安全に加速させるための重要な布石となりそうだ。

Copyright © ITmedia, Inc. All Rights Reserved.