AIに脆弱性を探させると、未検証の仮説や誤検知が大量に届く。Googleは社内のAIエージェントで自社Webアプリからクロスサイトスクリプティングの脆弱性を500件超発見しながら、誤検知をほぼゼロに抑えたという。決め手は、AIに判定を任せない検証の仕組みだった。
この記事は会員限定です。会員登録すると全てご覧いただけます。
大規模言語モデル(LLM)をセキュリティスキャンに応用する動きが広がる一方で、新たな課題が生まれている。AIが生成する脆弱(ぜいじゃく)性報告の相当部分が未検証の仮説や誤検知を含む「AIスロップ」(AIが生成した低品質なコンテンツ)で、セキュリティチームが対応に追われ、報告を受け取る製品チームの負担もかえって増えているという問題だ。Googleは2026年9月23日(現地時間)、公式ブログでこの課題への自社の取り組みを公開した。
同社の製品セキュリティチームは、自社Webアプリケーションの安全性を検査する社内AIエージェント「PageBreak」を開発した。2025年11月に試験運用を始め、2026年1月に本格的なプロジェクトに移行した。大規模に運用した結果、機密性の高いドメインを含むGoogleのWebアプリケーションから、500件を超えるクロスサイトスクリプティングの脆弱性を発見したという。
ただし、AIによる脆弱性発見で問われるのは件数よりも報告の精度だ。GoogleはPageBreakの報告について「誤検知はほぼゼロ」と説明する。従来のAIスキャナーと何が違うのか。
GoogleがPageBreakの中核に据えたのは、AIが立てた脆弱性の仮説を、実際に稼働する環境で攻撃コードを実行して確かめる「決定論的検証」だ。
PageBreakは潜在的な欠陥を見つけると、その仮説を脆弱性の種類ごとに用意された専用のバリデーター(検証プログラム)に渡し、実際のペイロード(攻撃コード)を実行して悪用可能かどうかを確認する。バリデーターはAIが書いたものではなく、検証結果が確実に再現できるよう設計されている。バリデーターの例は次の通りだ。
検証で確認できなかった候補は製品チームに送らない。Googleは、この運用によって製品チームが確度の高い報告に集中できるとしている。ただし、Googleによると現在のバリデーターでは全ての脆弱性の種類や複雑なシナリオを検証し切れず、見逃し(偽陰性)が生じるリスクがある。そのため、未検証の検出結果も捨てずに、次回スキャンの手掛かりや、バリデーターに不足している機能を把握するための材料として活用している。
PageBreakは複数のAIモデルで動作するが、利用の大半は「Gemini 3.1 Pro」や「Gemini 3.5 Flash」などGeminiモデルを基盤にしているという。
Googleは2025年に、Webの脆弱性を設計段階で排除する「高保証Webフレームワーク」の設計思想を公開している。PageBreakをこのフレームワークで構築したアプリケーション群に対して実行したところ、2026年9月4日時点で発見できたクロスサイトスクリプティングは数百のWebアプリケーション中2件にとどまった。その2件も、社内向けアプリケーションや堅牢(けんろう)化が不十分なデバッグ用エンドポイントに限られていた。Googleはこの結果について、セキュアバイデザインのフレームワークで安全なソフトウェアを構築するアプローチの価値を実環境で裏付けるものだとしている。
検証済みの脆弱性に絞っても、製品チームが受け取る報告の量は多い。GoogleはPageBreakを、自動でバグ修正を生成する社内の取り組み「CodeMender」などと連携させており、今後は製品チームの関与を修正案の確認だけに減らすことを目指すという。
Microsoft、セキュリティ製品の8月更新を公開 AIエージェント拡大に伴いDefenderやEntraなど機能拡張
「AIの暴走を止められない」 CISO座談会で見えたAIセキュリティの限界
便利さの裏で進む“静かな崩壊” AIセキュリティの死角を掘り下げる
NECが「AI自律型組織」を新設 「従業員はいらなくなる?」の問いに、CAXOはどう答えたかCopyright © ITmedia, Inc. All Rights Reserved.
本記事は制作段階でChatGPT等の生成系AIサービスを利用していますが、文責は編集部に帰属します。