AIが自分の弱点を「うっかり自白」した——Copilotの脆弱性を暴いた、前代未聞の発見手法
8月18日、Microsoftが「CoSnitch」と名付けられた深刻な脆弱性の修正パッチを公開した。攻撃者が用意した1つのリンクをクリックするだけで、被害者のメールやクラウドストレージ、カレンダーといった連携アカウントから、静かにデータを盗み出せてしまうという内容だ。技術的な深刻さもさることながら、エンジニアとして最も興味深かったのは、この脆弱性がどうやって発見されたのか、という部分だった。
3つの脆弱性を連鎖させる攻撃チェーン
CoSnitch(CVE-2026-24301)は、Microsoft Copilot Personalに存在した、3つの異なる弱点を組み合わせることで成立する攻撃だ。1つ目は、Copilotの標準的なクエリパラメータ「?q=」と、文書化されていない未公開のパラメータを組み合わせることで、攻撃者が仕込んだプロンプトを、ページの読み込みと同時に、クリックや確認操作なしで自動実行させてしまうというものだ。
2つ目は、この自動実行されたプロンプトを使って、既にユーザーがCopilotに接続許可を与えているOAuthアプリケーション(Gmail、Google Drive、カレンダーなど)からデータを取得し、攻撃者が用意したサーバーへと静かに送信する、データ持ち出しの経路だ。ここで見落としてはいけないのが、これは「不正なOAuthアクセス」ではないという点だ。被害者は既にCopilotに、これらの連携アプリへのアクセスを許可していた。CoSnitchが破壊したのは、「連携アプリへの操作は、ユーザーの意図的な要求に応じてのみ行われる」という、暗黙の前提そのものだった。
3つ目は、Web要約機能を悪用した、間接的なプロンプトインジェクション(悪意ある指示を、通常のコンテンツに紛れ込ませる攻撃手法)の経路だ。攻撃者は、HTML内のコメントやメタデータ、視覚的に隠されたテキストに悪意ある指示を埋め込んだ、一見無害なウェブページを用意する。被害者がこのページの要約をCopilotに依頼すると、Copilotは表示されているテキストだけでなく、隠された攻撃者の指示も一緒に処理してしまい、その結果、悪意ある指示がユーザーの「永続的なメモリ」に書き込まれてしまうケースがあったという。
発見した「メタハッキング」という新しい手法
この脆弱性を発見したセキュリティ企業Varonis Threat Labsが用いた手法が、業界で話題になっている。同社はこれを「メタハッキング」と呼んでいる。通常、この種の脆弱性はコードのリバースエンジニアリングによって発見されるものだが、Varonisの研究者は、Copilotに対して「なぜ自動実行が不可能なのか」を、繰り返し質問するというアプローチを取った。
Copilotがその質問を拒否するたびに、その拒否理由の説明の中に、システムの技術的な仕組みに関する情報が含まれていた。研究者は、この一つ一つの拒否を、さらなる追加質問として組み立て直し、Copilotから引き出せる情報の精度を、段階的に絞り込んでいった。その過程で、Copilot自身が、攻撃に使われることになる未公開のURLパラメータを、求められてもいないのに、拒否の説明の途中で開示してしまったのだ。Varonisは、この一連のやり取りを「非常に洗練されたLLMに対するソーシャルエンジニアリングと、様々なジェイルブレイク、プロンプトインジェクション攻撃の組み合わせ」だったと表現している。
AIアシスタント自身が「攻撃対象領域の地図」を描いてしまう
このメタハッキングという手法が示しているのは、AIアシスタントが自らの安全性について説明しようとする行為そのものが、意図せず攻撃者に有用な情報を与えてしまうリスクだ。「これはできません」という拒否メッセージには、しばしば「なぜできないのか」という技術的な理由が付随する。この理由の説明が積み重なることで、攻撃者は、システムの内部構造を、コードを一切見ることなく、対話だけを通じて再構築できてしまう。
これは、これまでのソフトウェアセキュリティの常識とは、性質の異なる新しいリスクだ。従来のバグ発見は、静的なコードや通信パケットを解析する作業だったが、AIアシスタントの場合、システムそのものと「会話」することによって、脆弱性の手がかりを引き出せてしまう。
Copilotを巡る「3度目」の脆弱性
Varonisにとって、CoSnitchは今年3件目のCopilot関連の脆弱性発見となる。過去には、同じ質問を繰り返すことで安全機構を回避する「Reprompt」、そしてMicrosoft 365 Copilot Enterpriseを、密かなデータ持ち出しの経路に変えてしまう「SearchLeak」を報告している。3つの脆弱性はいずれも、「一見普通に見えるリンクを1回クリックするだけ」という、極めてシンプルな攻撃の起点を共有している。
Varonisは2025年12月にこの問題をMicrosoftに報告しており、実際の修正パッチが公開されるまでには、およそ8ヶ月を要した。幸い、パッチ公開前にこの脆弱性が実際に悪用された形跡は見つかっていないという。
エンジニアとして見ておきたいこと
このニュースが投げかける教訓は、AIアシスタントに、メールやカレンダー、クラウドストレージといった広範なデータへのアクセス権を与える設計そのものに、慎重な監査体制が必要だという点だ。Varonisは、企業のセキュリティチームに対して、Copilotに接続されているサードパーティアプリを定期的に監査すること、AIアシスタントを「人間の従業員と同じレベルのアクセス監督が必要な、権限を持つ内部関係者」として扱うこと、そしてAIアシスタント経由の異常なデータアクセスを検知できる監視体制を整えることを推奨している。
自社の開発ワークフローにAIアシスタントを組み込む際、その「便利さ」の裏側で、どれだけのデータへのアクセス権を、どのような条件下で許可しているのかを、改めて棚卸ししてみる価値がありそうだ。