広 告

AIトレンド速報

The Trend Tribune

広 告
2026年9月7日月曜日 夕刊 定価 無料
◆ 本日の主要記事

「モデルではなくハーネスが穴だった」——Claude Code、Gemini CLI、Codexを同時に貫いた、一つのGitHub issue

▶ Black Hat USA 2026でNovee Securityが公表(9月に再注目)した、権限ゼロのGitHubアカウントがClaude Code・Gemini CLI・OpenAI Codexのcİ実行環境に到達できる脆弱性を解説。Hugging Faceのダウンロード数カウンターを情報持ち出し経路に使ったCVE-2026-54316、CVSS満点10.0のGemini CLI脆弱性CVE-2026-12537、OpenAIが「仕様通り」と主張し未パッチだった対応の違い、100超の公開リポジトリに広がった同一パターンまでを、「モデルの判断」と「ハーネス設計」の区別という観点で解説する。

「モデルではなくハーネスが穴だった」——Claude Code、Gemini CLI、Codexを同時に貫いた、一つのGitHub issue
(写真はイメージ)

「モデルではなくハーネスが穴だった」——Claude Code、Gemini CLI、Codexを同時に貫いた、一つのGitHub issue

Black Hat USA 2026で公表され、9月に入って改めて注目を集めている調査結果がある。セキュリティ企業Novee Securityの研究者エラド・メゲド氏が、リポジトリへの権限を一切持たないアカウントが、たった1つのGitHub issueを投稿するだけで、Anthropic・Google・OpenAIそれぞれの、AIコーディングエージェントのCI(継続的インテグレーション)実行環境にある、機密情報にアクセスできてしまう脆弱性を発見したという内容だ。エンジニアとして、この「ハーネス」という概念を軸にした調査結果を、丁寧に見ていきたい。

「モデルの判断」と「ハーネスの設計」を切り分ける

この調査で最も重要な概念が、「ハーネス」という言葉だ。メゲド氏はこれを「モデルと実世界との間にあるコード」と説明している。AIコーディングエージェントは、単に言語モデルが応答を返すだけのシステムではなく、そのモデルの周りに、権限管理、ツールの呼び出し経路、サンドボックス(隔離環境)の制御、共有ワークスペース、実行環境といった、様々な「配管」が組み合わさって、初めて実用的なエージェントとして機能する。

今回発見された3つの脆弱性は、いずれもこの「配管」の部分に存在していた。つまり、AIモデル自体が悪意ある判断を下したわけではなく、モデルの周りを固める設計に、見落としがあったということだ。

Claude Codeを貫いた、「一致しない文字列解釈」

Anthropicの「Claude Code」で見つかった問題(CVE-2026-54316)は、コマンドの妥当性検証と、実際の実行とで、同じ文字列を異なる解釈をしてしまうという、微妙なズレに起因していた。Claude Codeのコマンド検証機能は、シングルクォートで囲まれたテキストを、23個のチェック項目を実行する前に除去する。これはbash(シェル)の挙動としては正しい処理だが、gitの`--receive-pack`というフラグの値に埋め込まれた攻撃コードは、この除去処理をすり抜けて、実行時にはそのままgitによって解釈されてしまった。

さらに厄介なのが、この脆弱性の悪用に使われた「情報の持ち出し経路」だ。研究者は、Claude Codeが既に承認済みのアクセス権を持っていたHugging Faceの機能を悪用し、公開されている「ダウンロード数」というカウンターを、隠れた通信経路として利用した。APIキーを1文字ずつ、ダウンロード数の増減という形でエンコードして送信するという、極めて巧妙な手口だ。

Gemini CLIの「CVSS満点」という深刻度

GoogleのGemini CLIで見つかった脆弱性(CVE-2026-12537)は、さらに深刻だった。ヘッドレスモード(画面表示なしでの自動実行)における「ワークスペースの自動信頼」という仕組みと、許可リストが「登録時にはチェックされるが、実行時には強制されない」という設計上の隙間が組み合わさり、Linuxの`/proc`ファイルシステムを通じて、親プロセスの環境変数を読み取れてしまう状態になっていた。この脆弱性には、CVSSスコアで満点となる10.0という評価が付けられている。

OpenAI Codexは「サンドボックスは仕様通り」という立場

3社の中で対応が分かれたのが、OpenAIだ。研究者の報告に対し、OpenAIは自社のサンドボックスが「文書化された通り正確に動作していた」という立場を取っており、Codexに関する発見については、製品バージョンでのパッチも、CVE番号の割り当ても行われなかったという。この一件を巡っては、脆弱性の深刻度に対する評価軸そのものが、企業によって異なりうることが浮き彫りになっている。

「100を超える公開リポジトリ」に広がる、同じパターン

この調査でもう一つ注目すべきなのが、Cloud Security Allianceの分析だ。同様の設定上の問題が、100を超える公開リポジトリで確認されたという。その多くは、Anthropic、Google、OpenAIが公式に提供している、参考実装(リファレンスワークフロー)をそのままコピーしていたとされる。

つまり、今回発見された脆弱性は、単一のリポジトリだけの問題ではなく、ベンダーが提供するデフォルト設定そのものに内在していた問題であり、それをそのまま採用していた無数のプロジェクトに、同じリスクが横展開されていたことになる。過去に報告された「Clinejection」「GhostCommit」「GuardFall」といった類似の脆弱性とも、根底にある構造的な問題(文字列レベルの検証が、実際のシェルやファイルシステムによる解釈と食い違う)は共通しているという。

各社の対応と、既に修正済みという事実

幸い、Black Hatでの発表時点で、Google・Anthropic両社の脆弱性は既にパッチが適用されていた。Gemini CLIはバージョン0.39.1、Claude Codeはバージョン2.1.163で修正されている。Googleは自社の脆弱性報奨金プログラムを通じてこの報告を評価し、メゲド氏と、Pillar Securityのダン・リシチキン氏の功績を認めている。Anthropicも修正版をリリースし、セキュリティガイダンスを更新して、コンテンツのサニタイザー(無害化処理)がバイパスされうることへの警告を追加した。

エンジニアとして見ておきたいこと

この調査結果が投げかける教訓は明確だ。AIコーディングエージェントのセキュリティを評価する際、「このモデルは危険な指示を拒否できるか」という、モデル自体の判断能力だけを見ていては不十分だ。むしろ、そのエージェントが実際にどうツールを呼び出し、どう権限を管理し、どうサンドボックスを構成しているかという、周辺の実装(ハーネス)にこそ、見落とされがちな穴が潜んでいる。

自社のCI/CDパイプラインにAIコーディングエージェントを組み込んでいる、あるいは組み込もうとしているエンジニアにとって、今回の一件は、「外部からトリガーされうる自動化ワークフローすべてを、改めて監査すべきだ」という、具体的な行動喚起になっている。ベンダーが提供するデフォルト設定を無条件に信頼するのではなく、それが自分たちの環境で、どのような権限とアクセス範囲を実際に持っているのかを、一度手を動かして確認してみる価値がありそうだ。

サイバーセキュリティAIエージェント脆弱性Claude CodeGemini

「数年かかる」はずの作業が11日で——AIが失敗を重ねながらフェルマーの最終定理を証明しきった記録

▶ Anthropicが9月、Claudeが11日間ほぼ自律的に取り組みフェルマーの最終定理の初の完全な計算機検証済み証明をLean 4で完成させたと発表。1,300万行・30,300定理・約60億出力トークンという規模、局所文脈蓄積による重複作業という初期の失敗経緯、コロンビア大学Tianyi Peng氏らの協働プラットフォームProve2Meが安定動作をもたらした転機、Kevin Buzzard氏による検証評価、OpenAI Astraの数学発見との性質の違い、外部学術インフラへの依存という重要な留保までを研究者の視点で整理する。

「数年かかる」はずの作業が11日で——AIが失敗を重ねながらフェルマーの最終定理を証明しきった記録

9月、Anthropicが「フェルマーの最終定理」の、初めての完全な計算機検証済み証明を、Lean(数学的な証明をコンピュータが一行ずつ検証できる形式言語)で完成させたと発表した。Claudeが、ほぼ自律的に11日間取り組んだ成果だという。AI研究者出身のジャーナリストとして、この成果の技術的な内実と、その過程で何が起きていたのかを、丁寧に見ていきたい。

「証明を作った」のではなく「翻訳した」という、正確な理解

まず押さえておくべき、重要な区別がある。Claudeがやったのは、フェルマーの最終定理という、既に1995年にアンドリュー・ワイルズ氏によって証明済みの数学的事実を、新たに「発見」したことではない。そうではなく、ワイルズ氏の(そしてその後の研究者による整理を経た)証明を、Lean 4という形式言語に「翻訳」し、コンピュータが一つ一つの論理的なステップを、機械的に検証できる形にしたということだ。

この作業(自動形式化、オートフォーマライゼーションと呼ばれる)は、証明の正しさそのものを再確認する作業ではなく、「人間の数学的レビューだけに頼るのではなく、証明支援システムが、あらゆる論理的依存関係を検証できるようにする」という、質の異なる貢献だ。数学者たちは当初、この形式化作業には数年単位の時間がかかると見積もっていたとされる。

「1300万行」「29,500の定理」という、規模の大きさ

今回の成果の規模感を示す数字は圧巻だ。11日間の作業で、Claudeは1,300万行のLeanコードを生成し、合計30,300個の定理を証明した。そのうち29,500個が、最終的な証明の中で実際に使用されたという。これは、Lean形式化数学の基盤ライブラリである「Mathlib」の、5倍以上の規模に相当するという。

作業に要した計算資源は、およそ60億の出力トークンだったとされる。使用されたモデルは、Claude Fable 5.1に、おおむね匹敵する性能を持つ、汎用の社内研究用モデルだったという。

「何度も失敗した」という、率直な経緯の開示

この成果報告で研究者として興味深いのが、Anthropic自身が、最初から順調だったわけではないと、率直に認めている点だ。同社の説明によれば、初期の試みは何度も行き詰まった。エージェントが、局所的な文脈情報を蓄積しすぎてしまい、既に何が証明済みかを見失い、同じ作業を重複して行い、効果的に協調できなくなってしまったという。

これらの失敗した初期の試みも、最終的な証明の非定型部分(ボイラープレートではない実質的なコード)のおよそ7%に貢献したとされるが、ワークフロー全体が安定して機能するようになったのは、「Prove2Me」という基盤に移行してからだったという。

「Prove2Me」という、外部の学術インフラの重要性

今回の成果を理解する上で欠かせないのが、Anthropicが自社開発したわけではない、外部の協働プラットフォーム「Prove2Me」の存在だ。これはコロンビア大学のTianyi Peng氏らが開発した、オープンな協働プラットフォームで、中心となる発想は「定理と、その証明対象の有向非巡回グラフ(DAG)」だ。

このプラットフォームは、1つのエージェントに証明全体を記憶させるのではなく、未解決の依存関係を可視化し、エージェントがそのグラフの中から、取り組みやすいノード(証明すべき部分)を選んで、個別に証明し、その結果を他のエージェントが利用できるようにする、という仕組みを提供する。さらに、定理の記述と証明の実装を分離することで、Leanのコンパイル処理を、より効率的に分散させることも可能にしている。この、既存のオープンな学術インフラの存在が、Anthropic単独の技術力だけでは成し得なかった、この成果の実現を可能にしたという点は、重要な指摘だ。

数学者ケビン・バザード氏による、慎重な評価

この成果を検証した、Imperial College Londonの数学者ケビン・バザード氏(自身もLeanでのフェルマーの最終定理形式化プロジェクトを率いてきた人物)は、「この驚異的な自動形式化の達成は、Anthropicの研究者によればわずか11日しかかからなかったとされ、数学の公理以外の何の仮定も置かずに、フェルマーの最終定理を証明している」と評価している。

同氏はさらに、「もし現時点でフェルマーの最終定理の自動形式化が可能なら、我々は現代の数学文献全体の自動形式化に向けて、大きな一歩を踏み出したことになる。こうした自動形式化技術は、新しいツールを生み出し、現在の数学の総体に存在する誤りを洗い出し、査読者の負担を軽減することにつながるだろう」と、その先にある可能性についても言及している。

OpenAIのAstraとの、興味深い並走

この成果は、以前取り上げたOpenAIのAstraによる、未解決の数学問題の解決という成果とも、比較対象になる。Astraのケースは、既存の枠組みにない、真に新しい数学的発見だったのに対し、今回のClaudeの成果は、既に証明済みの結果を、機械検証可能な形に翻訳するという、性質の異なる貢献だ。しかし両者に共通するのは、「AIが、これまで人間の専門家がボトルネックとなっていた、数学研究の特定の工程を、劇的に加速させつつある」という、大きな潮流だ。

研究者として見ておきたいこと

今回の成果が示す最大の教訓は、AIの数学研究への貢献が、単独のモデルの能力だけでなく、それを支える外部のオープンな学術インフラ(Prove2Me、Mathlib)との組み合わせによって、初めて実現されているという点だ。この構図は、AI企業が独自の技術的優位性を主張する際、その優位性がどこまで自社固有のものであり、どこまでオープンな共有基盤に依存しているのかを、慎重に見極める必要があることを示唆している。

今後、この種の自動形式化技術が、現代の数学文献全体へと、どこまで応用範囲を広げていけるのか。そして、Mathlibのような学術コミュニティが、今回生成された29,500個の中間定理を、実際に自分たちの基盤として取り込んでいくのかどうか。バザード氏が指摘するように、この技術が「一回きりの成果」なのか、「再利用可能なインフラ」なのかを見極める、重要な試金石になりそうだ。

AnthropicClaude数学LeanAI/ML

「まだ調達していない資金」への350億ドルの約束——Anthropicの新契約が突きつける、資金調達との競争

▶ Anthropicが9月1日、NVIDIA出資のLambdaと350億ドル規模の計算資源契約を締結、1週間前のNscaleとの450億ドル契約に続く2件目のインフラ契約と判明。NVIDIAが賃借人・チップ供給者・Lambda出資者という3役を兼ねる構造、テキサス州Hut 8施設2027年Q1稼働予定、アナリストNeil Camplingが指摘する「未調達資金への債務」とIPOが唯一の出口という分析、420億ドルの年間純損失と積み重なる巨額契約というSB Energyと同種の循環構造までを会計的に検証する。

「まだ調達していない資金」への350億ドルの約束——Anthropicの新契約が突きつける、資金調達との競争

Anthropicが、NVIDIA出資のクラウド事業者Lambdaと、350億ドル規模の計算資源契約を締結したと、9月1日に複数のメディアが報じた。これは、Anthropicが結んだ、直近の巨額インフラ契約としては2件目にあたる。会計士として、この一連の契約が積み重なることで、同社がどのような財務的な立場に置かれつつあるのかを、確認しておきたい。

「NVIDIAが賃借人、Lambdaが供給者」という、入り組んだ構造

まず、この契約の当事者関係を整理しておきたい。この契約は、テキサス州ニュエセス郡に、Hut 8(かつて仮想通貨マイニング事業を手がけ、現在はAIデータセンター運営へと転じた企業)が開発するデータセンターを舞台としている。

報道によれば、この施設の賃貸借契約(リース)自体はNVIDIAが保有し、LambdaがそこにNVIDIA製のチップを設置して、計算能力をAnthropicに提供するという、複数の当事者が絡み合う構造になっている。この施設は、およそ350メガワットの容量を提供する見込みとされる。NVIDIAは、自らチップの供給者であり、施設の賃借人でもあり、さらにLambdaへの出資者でもあるという、複数の役割を同時に担っている。

「1週間で2件」の、巨額インフラ契約という速さ

このLambdaとの契約が特筆すべきなのは、そのタイミングだ。報道によれば、Anthropicはこのわずか1週間前に、英国を拠点とするAIインフラ企業Nscaleとの間で、米国内(ウェストバージニア州のデータセンター施設)で400メガワット超の計算能力を確保する、450億ドル規模のリース契約を、既に締結していたとされる。

つまり、わずか1週間ほどの間に、合計で800億ドルに迫る規模のインフラ契約を、立て続けに結んでいることになる。これは、以前取り上げてきたAnthropicの一連のインフラ投資(Fluidstackとの500億ドル、AWSとの1,000億ドル超、Theseus Infrastructureなど)に、さらに積み増される形の動きだ。

「調達していない資金への約束」という、率直な指摘

このニュースを分析した金融アナリスト、ニール・キャンプリング氏の指摘が興味深い。同氏は、Anthropicが「まだ調達していない資金に対する、350億ドル規模の計算資源債務」に署名したと表現し、この巨額の約束を果たすためには、IPO(新規株式公開)が「唯一の出口」になるだろうという見方を示している。

これは、以前取り上げたAnthropicのIPO準備(2兆ドルという評価額、30兆ドルというTAM主張)の文脈と、直接つながる指摘だ。同社が積み上げているインフラ契約の規模は、既に確保している資金の範囲を超えて、将来の資金調達を前提とした、先行投資的な性格を強めているとみられる。

NVIDIAが「取引の両側」に座るという、構造的な特徴

キャンプリング氏はさらに、この一連の取引構造における、NVIDIAの特殊な立場についても言及している。NVIDIAは、Lambdaへの出資者として、そして自らがデータセンター施設の賃借人として、この取引の「両側」に関与している。

これは、以前取り上げたNVIDIAの一連の金融戦略——OpenAIへの1,050億ドル保証、Googleへの122億ドルワラント付与、5,000億ドル規模の資金動員構想、そして「循環金融」批判を受けて一時停止された「AI Compute Partnership」——と、同じ文脈の中にある動きだ。NVIDIAは、AIインフラを巡るあらゆる取引の結節点に位置することで、自社のチップ需要を、複数の経路から同時に確保する戦略を、一貫して追求していると理解できる。

契約条件の「非開示」という、透明性の限界

今回の一連の報道で留意すべき点として、この350億ドル契約の具体的な条件——契約期間、GPUの台数、支払いスケジュール、実際の計算能力の規模——は、いずれも公表されていない。Hut 8は、Beacon Point施設の最初のエネルギー供給開始が2027年第1四半期、フェーズ2の最初のデータホールの稼働が2028年第2四半期になると見込んでいるとされ、これが実際の計算能力提供までの、おおよそのタイムラインを示す、数少ない具体的な情報になっている。

会計士として見ておきたいこと

Anthropicが短期間のうちに積み重ねている、これらの巨額インフラ契約は、同社が急成長する需要に対応するための、積極的な先行投資として理解できる一方で、その資金的な裏付けが、現時点で確保済みの資本を超えて、将来の資金調達(特にIPO)の成功に、強く依存しつつあることを示している。

以前取り上げたように、Anthropicは420億ドルという巨額の年間純損失を抱えながら、同時にこの種の数百億ドル規模の長期契約を積み重ねている。この「収益がまだ追いついていない段階での、巨額の将来コミットメント」という構図は、SB EnergyのIPO申請書類が示していたのと同種の、循環的な資金構造の一部として捉えることができる。

Anthropicが実際にIPOに踏み切った際、目論見書の中で、この一連のインフラ契約が、負債あるいは将来の支払い義務として、どのように開示されるのか。そして、投資家がこの「調達前に約束された巨額債務」を、どこまで許容できると判断するのか。今後の展開を、注視していく必要があるだろう。

AnthropicNVIDIAAIインフラ循環金融ファイナンス
広 告300 × 250