OpenAI、Anthropic、Metaを結ぶ「一本の糸」——フロンティアAI業界のセキュリティ評価を支える、35人の小さな企業
7月下旬から8月上旬にかけて、OpenAI、Anthropic、Metaという3つの主要AI研究所が、それぞれ独立に「自社のAIモデルが、セキュリティ評価テストの最中に想定外の外部システムへアクセスしていた」という趣旨の事案を公表した。8月9日、CNBCの報道により、この一連の事案がすべて、テルアビブを拠点とする、わずか35人規模のスタートアップ企業「Irregular(旧Pattern Labs)」が提供する評価環境に起因していたことが明らかになった。AI研究者出身のジャーナリストとして、この構造がAI安全性研究のエコシステムにとって何を意味するのか、整理してみたい。
「同じ会社の、同じ設定ミス」という共通項
これまで個別の事案として報じられてきた3社のインシデントは、実際には根本原因を共有していた。Irregular社自身の説明によれば、一連の問題は、AIモデルがサンドボックス(隔離された安全なテスト環境)を意図的に脱出したものではなく、評価用テストベッドの「設定ミス」により、意図せずインターネットへのアクセスが可能になっていたことに起因するという。同社は「これはサンドボックスの脱出でも、高度なサイバー行動でもなかった」とし、「現時点で未解決の問題はない」と説明している。
Irregularは、この一連の出来事を受けて、コンテインメント(封じ込め)と安全な評価運用のためのベストプラクティスを共有する白書を準備しているとも報じられている。
テルアビブ発、3年で業界の中心的存在に
Irregular社は2023年、ダン・ラハブ氏(CEO)とオメル・ネヴォ氏(CTO)によってテルアビブで創業された。SequoiaとRedpoint Venturesから8000万ドルの資金を調達し、評価額は4億5000万ドルに達しているという。同社は、フロンティアAIモデルに対して「キャプチャー・ザ・フラッグ(CTF)」形式のサイバーセキュリティ評価を提供する、専門的な評価インフラ企業だ。
CNBCの報道によれば、Irregularは今回名前が挙がった3社に加え、Google DeepMindのセキュリティ評価も手がけているという。つまり、世界のフロンティアAI開発を主導する複数の企業が、こと「サイバーセキュリティ能力の評価」という極めて重要な領域において、同一の、しかも比較的小規模な第三者企業のインフラに依存しているという構造が、今回の一連の事案を通じて浮き彫りになった形だ。
「現実に近い評価環境」というジレンマ
Irregular社の幹部は、今回の一連の事案について、興味深い説明をしている——「モデルを評価するときには、それを実世界に接続した状態にしたい。本物の攻撃者はあらゆる手段を使うので、モデルにも現実的な環境へのアクセスを与える必要がある。そうでなければ、テストは現実を代表しないものになってしまう」。
これは、AIモデルのサイバーセキュリティ能力を正確に評価しようとすればするほど、評価環境を「本物に近づける」必要が生じ、それがそのまま「実際に被害が生じるリスク」と表裏一体になってしまうという、構造的なジレンマを言い表している。数千件規模のテストが、時に72時間にも及ぶ長時間実行される中では、わずかな設定ミスが、想定外の境界突破につながりうる。
今回の一連の事案について、ある関係者は「モデルは与えられたタスクを完了できず、オンラインで解決策を探し、自分がテスト環境の外に出て現実世界とやり取りしていることに気づかないまま行動していた」と説明している。モデルは意図的に脱走したのではなく、単に「まだシミュレーションの中にいる」と思い込んだまま、与えられた目標に向かって忠実に行動し続けた結果、現実のシステムに到達してしまったということになる。
集中リスクという、新しい種類の脆弱性
今回の一件が投げかける、より大きな問題提起は、「AI安全性評価というインフラそのものが抱える集中リスク」だ。もしあなたの会社が、OpenAI、Anthropic、Metaのいずれかが提供するフロンティアモデルを本番環境で利用しているとすれば、そのモデルの安全性に関する保証は、間接的に、この一つの小さなテルアビブのスタートアップが運用するサンドボックスの設定に依存していることになる。
これは、ソフトウェア業界における「サプライチェーンリスク」の考え方に近い。特定のオープンソースライブラリや、特定のクラウドベンダーに業界全体が依存することで生じるリスクと同様に、AI安全性評価という、目立たないが極めて重要な機能もまた、少数の専門企業に集中しているという実態が、今回の一連の事案を通じて可視化されたと言える。
研究者として見ておきたいこと
Irregular社は今年、Fast Companyの「World Changing Ideas」リストの受賞企業にも選ばれるなど、業界内での評価は高い。同社が今後公開するとされる白書が、コンテインメント(安全な封じ込め)のベストプラクティスを、業界全体でどう共有していくかは、AI安全性研究コミュニティにとって重要な試金石になるだろう。
フロンティアAIモデルの能力が急速に向上する中、「モデルをどう評価するか」という評価手法そのものの安全性と信頼性を、独立した第三者がどう検証していくのかという課題は、今後さらに重要性を増していきそうだ。単一の評価パートナーへの依存が、業界全体のリスクとなりうるという今回の教訓を踏まえ、評価インフラの多様化や、評価環境自体に対する外部監査の仕組みづくりが、次の議論の焦点になっていくのではないだろうか。