静かに始まった、大きな地殻変動
9月10日、OpenAIが一つのAPIを公開した。派手な発表会もなければ、新しいモデル名もない。「Agents API」というそっけない名前の、パブリックベータだ。だが中身を読むと、これはこの数か月で一番エンジニアの働き方に効いてくる発表かもしれない、と感じた。
一言で言えば、OpenAIは「Codexを動かしている裏側の仕組み」を、丸ごと貸し出すことにした。ChatGPTの「Work」機能やコーディングエージェントのCodexを支えてきた、セッション管理・文脈処理・サンドボックス実行といった面倒な基盤部分が、いきなり1本のAPI呼び出しの向こう側に来た格好だ。
「ハーネス」とは何なのか
聞き慣れない人のために説明すると、「ハーネス」はエージェントを動かすための足場のようなものだ。モデル自体がどれだけ賢くても、それを実際のタスクに使うには、会話の文脈を保持し続ける仕組み、ツールを呼び出す仕組み、複数のサブエージェントに仕事を割り振る仕組み、そして安全にコードを実行するサンドボックスが要る。
これまでは、多くのチームがこの「足場」を自前で組んでいた。プロンプトチェーンを書き、ツール呼び出しのロジックを自分たちで管理し、セッションが切れないように独自の状態保存の仕組みを実装する。地味だが、プロダクションで長時間動くエージェントを作ろうとすると、ここが一番の労力を食う部分だった。
4つの部品でできている
OpenAIの公式ドキュメントによれば、Agents APIは4つの概念で構成されている。モデルとツール、MCPサーバーをまとめた「エージェント」。ファイルアクセスやコマンド実行のための「環境」、つまりサンドボックス。ターン間で状態を保持し続ける「セッション」。そして入出力そのものを表す「イベントとアイテム」だ。
サンドボックスの選び方も柔軟に設計されている。OpenAIがホストするサンドボックスを使ってもいいし、自前のインフラに`codex exec-server`を立てて接続することもできる。Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercelといったパートナー企業のサンドボックスとも最初から連携している。開発者は「どこで実行するか」だけを選び、あとの面倒はOpenAI側が引き受ける、という設計思想だ。
コンテキストの「圧縮」という発明
個人的に一番面白いと思ったのは、長時間セッションのための自動コンテキスト圧縮の仕組みだ。エージェントが何時間も働き続けると、会話履歴や作業ログがどんどん膨らんでモデルの処理できる範囲を超えてしまう。Agents APIは、セッションが上限に近づくと、それまでの文脈を自動で要約・圧縮し、エージェントが作業を続けるために必要な情報だけを残す。
もう一つの仕掛けが「ツール検索」だ。使いそうなツールの定義だけをその都度読み込むことで、トークン消費を抑えつつモデルのキャッシュを維持する。さらに「プログラム的なツール呼び出し」を使えば、ツールを並列実行したり、大量のデータをコード側でフィルタリングしてから必要な結果だけを文脈に戻したりできる。地味な機能に見えるが、これはエージェントを本番運用する際にコストが跳ね上がる最大の原因を、正面から潰しにきている。
サンドボックスは選べる、でもデータは米国から出られない
一方で気になる制約もある。現時点でAgents APIのデータレジデンシーは米国限定で、Zero Data Retention(データを一切保持しないモード)にも対応していない。自前のサンドボックスをどこの国に立てても、コントロールプレーン自体は米国内にとどまる。規制産業や米国外の企業にとっては、ここが導入のハードルになりそうだ。
実際に使った企業の声
すでに導入した企業の声も紹介されている。保険テック企業WithCoverageのエンジニアリング責任者は、これまで自前でプロンプトチェーンとツール呼び出しの管理を書いていたが、Agents APIによって複雑な多段階ワークフローの設計そのものを考え直せるようになった、とコメントしている。ある企業は、ケースレビューのワークフローを移行したことでコストが60%下がり、レイテンシーも改善したと報告した。派手な数字ではないが、実運用でのコスト削減効果として素直に信頼できる部類の報告だ。
「モデルの賢さ」から「基盤の成熟度」への競争へ
このAPIが示しているのは、フロンティアAIの競争軸が少しずつ変わりつつある、ということだと思う。モデルのベンチマークスコアを競う時代から、「エージェントを安定して長時間動かし続けるための基盤をどれだけ成熟させたか」を競う時代への移行だ。料金体系もシンプルで、Agents API自体には追加料金がかからず、使ったトークンとツールの分だけ課金される。
エンジニアとして見ておきたいこと
自前でエージェント基盤を組んでいるチームにとっては、今回の発表は「乗り換えるべきか、このまま自作を続けるべきか」を真剣に検討する材料になる。特にセッション管理やコンテキスト圧縮のような、機能追加のたびに地味に工数を食う部分を外部化できるのは大きい。ただし米国限定のデータレジデンシーという制約は、日本を含む海外拠点でエージェントを動かすチームにとって無視できない壁になる。しばらくはこの制約がどう緩和されていくかを注視しつつ、パートナーサンドボックス経由での実装を試す、というのが現実的な向き合い方になりそうだ。