「賢さ」と「速さ」、その二者択一が終わった日——OpenAIとCerebrasが実現した750トークン/秒の中身
8月13日、OpenAIが「Ultrafast」という新しいAPIサービス階層のプレビューを公開した。同社の最上位モデル「GPT-5.6 Sol」を、標準処理と比べて最大14倍、毎秒最大750トークンという速度で動かせるという。エンジニアとして興味深いのは、この高速化が、モデルを小さく軽量化することによってではなく、専用のハードウェアパートナーとの協業によって実現されている点だ。
これまでの「常識」を覆すアプローチ
これまでAI業界において、「リアルタイムに近い応答速度」を求める開発者には、事実上一つの選択肢しかなかった。より小さく、より能力の劣るモデルを選ぶことで、応答速度を稼ぐという妥協だ。OpenAI自身の説明によれば、Ultrafastは、この「速度か、賢さか」という長年のトレードオフを、初めて崩す試みだという。
Ultrafastは、GPT-5.6 Solという既存の最上位モデルそのものを、より高速なハードウェア上で動かす仕組みであり、モデルの中身自体を変更した新しいモデルではない。つまり「同じ賢さを保ったまま、提供する速度だけを変える」という発想だ。
Cerebrasの「ウェハースケールチップ」という切り札
この高速化を支えているのが、Cerebrasという企業が開発した「ウェハースケールチップ」と呼ばれる特殊な半導体だ。通常、半導体チップは、シリコンウェハーという円盤状の基板から、多数の小さなチップを切り出して製造される。しかしCerebrasのアプローチは全く異なり、ウェハー1枚全体を、切り分けずに1つの巨大なチップとして使う。
この設計により、通常のGPUクラスタでは避けられない「チップ間でのデータ移動」に伴う遅延を、大幅に削減できる。AIモデルの推論処理は、大量のパラメータデータを、演算ユニットとメモリの間で頻繁にやり取りする必要があるため、このデータ移動の速度が、最終的な応答速度のボトルネックになりやすい。Cerebrasのチップは、この物理的な制約そのものを、設計段階で解消するアプローチを取っている。
具体的な数字で見る「14倍」の中身
OpenAIとCerebrasが公開した比較データによれば、Ultrafastは、Anthropicの「Claude Opus 4.8」のFastモードと比べて5倍、「Claude Fable 5」と比べて11倍高速だという(Artificial Analysisが報告した各モデルの出力速度データに基づく)。
さらに具体的な実務上の効果を示す例として、2,500問からなる大学院レベルの化学・経済学・文学にまたがるベンチマーク「Humanity's Last Exam」を、GPT-5.6 Sol Ultrafastが、わずか11時間強で全問処理したという数字も公開されている。標準処理であれば、同じ作業により長い時間を要していたはずだ。
想定される用途は「待てない」タスク
OpenAIが例として挙げているのが、インシデント対応(システム障害への緊急対応)という用途だ。障害が発生している最中に、ログやコードの変更履歴、レポートをリアルタイムで分析させることで、エンジニアが原因を特定し、修正を準備する速度を、劇的に引き上げられる可能性があるという。
この他にも、コーディング支援、商取引、金融リサーチ、カスタマーサポートといった、応答速度がユーザー体験に直結する分野での活用が想定されている。Jane StreetのAIアシスタント開発チームからは、「Cerebrasによる速度向上は印象的で、開発者がより集中力を保ちながらモデルと協働できる、新しい働き方を可能にする」というコメントが寄せられている。
「NVIDIA依存からの多層化」という、もう一つの意味
このUltrafastの提供は、単なる速度競争の一環にとどまらない、もう一つの戦略的な意味も持っている。OpenAIは既に、独自のAIチップ開発チームを立ち上げていることを公表しているが、今回のCerebrasとの提携拡大は、NVIDIAへの依存度を下げ、複数のハードウェアパートナーを持つという「マルチベンダー戦略」の一環としても位置づけられる。
CerebrasとOpenAIは、以前から100億ドル規模のパートナーシップを結んでいたと報じられており、今回のUltrafastは、その関係をさらに一歩進める形の発表と言える。
「Up to」という表現に潜む留保
一方で、今回の発表を評価する際には、いくつかの留保点も押さえておきたい。OpenAIが示す「14倍」「750トークン/秒」という数字は、いずれも「最大で(up to)」という表現が付けられており、すべてのリクエストが常にこの速度を維持できるとは限らない。価格や、一般提供開始の正式な時期についても、現時点では公表されていない。
現在は限られた顧客のみを対象にしたプレビュー段階であり、実際にこのサービスを利用する開発者は、自分のワークロードで実際のレイテンシ、出力速度、信頼性、コストを測定した上で、導入を判断する必要があるだろう。
エンジニアとして見ておきたいこと
Ultrafastが示しているのは、AIモデルの競争軸が、単純な「知能の高さ」から、「その知能を、どれだけ速く実用的な形で届けられるか」という、インフラレベルの競争へと広がりつつあるという流れだ。
これまでリアルタイム性が求められる用途では、やむを得ず小型モデルを選択していた開発者にとって、この種の高速推論サービスは、設計の選択肢を大きく広げる可能性がある。今後、価格体系と一般提供の範囲がどう定まっていくのか、そして実際の本番環境での安定性がどこまで担保されるのか、続報を注視していきたい。