広 告

AIトレンド速報

The Trend Tribune

広 告
2026年8月18日火曜日 朝刊 定価 無料
◆ 本日の主要記事

「賢さ」と「速さ」、その二者択一が終わった日——OpenAIとCerebrasが実現した750トークン/秒の中身

▶ OpenAIが8月13日、GPT-5.6 Solを最大14倍・毎秒750トークンで動かす新API階層「Ultrafast」のプレビューを公開。Cerebrasのウェハースケールチップによるデータ移動遅延の削減、Claude Opus 4.8比5倍・Claude Fable 5比11倍という速度比較、Humanity's Last Examを11時間強で処理した実例、インシデント対応など想定用途、NVIDIA依存を減らすマルチベンダー戦略としての意味までを解説する。

「賢さ」と「速さ」、その二者択一が終わった日——OpenAIとCerebrasが実現した750トークン/秒の中身
(写真はイメージ)

「賢さ」と「速さ」、その二者択一が終わった日——OpenAIとCerebrasが実現した750トークン/秒の中身

8月13日、OpenAIが「Ultrafast」という新しいAPIサービス階層のプレビューを公開した。同社の最上位モデル「GPT-5.6 Sol」を、標準処理と比べて最大14倍、毎秒最大750トークンという速度で動かせるという。エンジニアとして興味深いのは、この高速化が、モデルを小さく軽量化することによってではなく、専用のハードウェアパートナーとの協業によって実現されている点だ。

これまでの「常識」を覆すアプローチ

これまでAI業界において、「リアルタイムに近い応答速度」を求める開発者には、事実上一つの選択肢しかなかった。より小さく、より能力の劣るモデルを選ぶことで、応答速度を稼ぐという妥協だ。OpenAI自身の説明によれば、Ultrafastは、この「速度か、賢さか」という長年のトレードオフを、初めて崩す試みだという。

Ultrafastは、GPT-5.6 Solという既存の最上位モデルそのものを、より高速なハードウェア上で動かす仕組みであり、モデルの中身自体を変更した新しいモデルではない。つまり「同じ賢さを保ったまま、提供する速度だけを変える」という発想だ。

Cerebrasの「ウェハースケールチップ」という切り札

この高速化を支えているのが、Cerebrasという企業が開発した「ウェハースケールチップ」と呼ばれる特殊な半導体だ。通常、半導体チップは、シリコンウェハーという円盤状の基板から、多数の小さなチップを切り出して製造される。しかしCerebrasのアプローチは全く異なり、ウェハー1枚全体を、切り分けずに1つの巨大なチップとして使う。

この設計により、通常のGPUクラスタでは避けられない「チップ間でのデータ移動」に伴う遅延を、大幅に削減できる。AIモデルの推論処理は、大量のパラメータデータを、演算ユニットとメモリの間で頻繁にやり取りする必要があるため、このデータ移動の速度が、最終的な応答速度のボトルネックになりやすい。Cerebrasのチップは、この物理的な制約そのものを、設計段階で解消するアプローチを取っている。

具体的な数字で見る「14倍」の中身

OpenAIとCerebrasが公開した比較データによれば、Ultrafastは、Anthropicの「Claude Opus 4.8」のFastモードと比べて5倍、「Claude Fable 5」と比べて11倍高速だという(Artificial Analysisが報告した各モデルの出力速度データに基づく)。

さらに具体的な実務上の効果を示す例として、2,500問からなる大学院レベルの化学・経済学・文学にまたがるベンチマーク「Humanity's Last Exam」を、GPT-5.6 Sol Ultrafastが、わずか11時間強で全問処理したという数字も公開されている。標準処理であれば、同じ作業により長い時間を要していたはずだ。

想定される用途は「待てない」タスク

OpenAIが例として挙げているのが、インシデント対応(システム障害への緊急対応)という用途だ。障害が発生している最中に、ログやコードの変更履歴、レポートをリアルタイムで分析させることで、エンジニアが原因を特定し、修正を準備する速度を、劇的に引き上げられる可能性があるという。

この他にも、コーディング支援、商取引、金融リサーチ、カスタマーサポートといった、応答速度がユーザー体験に直結する分野での活用が想定されている。Jane StreetのAIアシスタント開発チームからは、「Cerebrasによる速度向上は印象的で、開発者がより集中力を保ちながらモデルと協働できる、新しい働き方を可能にする」というコメントが寄せられている。

「NVIDIA依存からの多層化」という、もう一つの意味

このUltrafastの提供は、単なる速度競争の一環にとどまらない、もう一つの戦略的な意味も持っている。OpenAIは既に、独自のAIチップ開発チームを立ち上げていることを公表しているが、今回のCerebrasとの提携拡大は、NVIDIAへの依存度を下げ、複数のハードウェアパートナーを持つという「マルチベンダー戦略」の一環としても位置づけられる。

CerebrasとOpenAIは、以前から100億ドル規模のパートナーシップを結んでいたと報じられており、今回のUltrafastは、その関係をさらに一歩進める形の発表と言える。

「Up to」という表現に潜む留保

一方で、今回の発表を評価する際には、いくつかの留保点も押さえておきたい。OpenAIが示す「14倍」「750トークン/秒」という数字は、いずれも「最大で(up to)」という表現が付けられており、すべてのリクエストが常にこの速度を維持できるとは限らない。価格や、一般提供開始の正式な時期についても、現時点では公表されていない。

現在は限られた顧客のみを対象にしたプレビュー段階であり、実際にこのサービスを利用する開発者は、自分のワークロードで実際のレイテンシ、出力速度、信頼性、コストを測定した上で、導入を判断する必要があるだろう。

エンジニアとして見ておきたいこと

Ultrafastが示しているのは、AIモデルの競争軸が、単純な「知能の高さ」から、「その知能を、どれだけ速く実用的な形で届けられるか」という、インフラレベルの競争へと広がりつつあるという流れだ。

これまでリアルタイム性が求められる用途では、やむを得ず小型モデルを選択していた開発者にとって、この種の高速推論サービスは、設計の選択肢を大きく広げる可能性がある。今後、価格体系と一般提供の範囲がどう定まっていくのか、そして実際の本番環境での安定性がどこまで担保されるのか、続報を注視していきたい。

OpenAICerebras推論高速化半導体AI/ML

中国発の自動運転技術が、なぜ「ザグレブ」から欧州に広がるのか——Pony.aiとUberの2000台計画を読む

▶ Pony.aiとUberが8月14日、ザグレブでの既存サービスを起点に欧州4都市を追加し合計2,000台超のロボタクシーを展開する提携拡大を発表、中東展開も計画。技術・プラットフォーム・地元運用という三層分業モデル、中国国内のロボタクシーライセンス発給停止という背景、WeRide・Momentaなど同業他社の欧州展開ラッシュ、中国国内実績を欧州の規制・交通環境にそのまま外挿する危うさまでを懐疑的に検証する。

中国発の自動運転技術が、なぜ「ザグレブ」から欧州に広がるのか——Pony.aiとUberの2000台計画を読む

8月14日、中国の自動運転企業Pony.aiと配車大手Uberが、欧州における提携拡大を発表した。クロアチアの首都ザグレブで既に展開している商用ロボタクシーサービスを起点に、欧州の4都市を追加し、合計2,000台超のロボタクシーを展開するという計画だ。中東への展開計画も同時に発表された。ソフト屋として、この提携が持つ技術的・構造的な意味を見ていきたい。

「自社では展開しない」という、賢い分業モデル

Pony.aiとUberの提携で興味深いのは、両社が担う役割の明確な分業体制だ。Pony.aiはSAEレベル4(特定の条件下では完全に自律走行が可能で、緊急時の人間の介入が原則不要となる自動運転のレベル)の技術と、既存の大規模フリート運用から得た知見を提供する。Uberは、予約・決済・カスタマーサポートといった、既に世界中で確立されたモビリティプラットフォームを提供する。そして日々の車両運用は、市場ごとに選定される地元パートナーが担う。

ザグレブでの実例では、クロアチアのモビリティ企業Verneが、車両の所有と日常運用を担当している。この「技術提供者・プラットフォーム提供者・地元運用者」という三層構造は、自動運転技術を持つ企業が、各国・各都市ごとに一から現地法人を立ち上げる必要をなくし、展開速度を大きく引き上げる仕組みとして機能している。

中国企業にとっての「欧州」という選択

Pony.aiは既に、北京・上海・広州・深センといった中国の主要都市で、有人ドライバーなしの完全自律走行によるロボタクシーサービスを展開している実績を持つ。この実績を欧州に持ち込むという動きは、中国の自動運転企業が直面している、国内市場だけでは満たせない成長機会を、海外展開によって補おうとする戦略の表れと見ることができる。

興味深いのは、この提携が発表された背景に、中国国内でのロボタクシーライセンス発給が、業界全体の安全性審査によって数ヶ月間停止されていたという事情がある点だ。6月末にその審査が完了し、一部都市でライセンス発給が再開され始めているとも報じられている。国内の規制環境が一時的に不透明になる中、海外市場への展開を積極化させるというのは、企業のリスク分散戦略として理にかなっている。

「懐疑派」として見ておきたい、検証すべきポイント

この種の中国発の自動運転技術に関するニュースを評価する際、いくつか慎重に見るべき点がある。まず、今回の発表では「4都市」の具体的な名称や、「2,000台」という数字の達成時期が、まだ明らかにされていない。段階的に詳細を発表していくとされており、現時点ではあくまで意向表明という性格が強い。

また、中国国内での運用実績が、そのまま欧州の道路環境や交通規則、そして厳格化しつつある欧州のAI・自動運転関連規制のもとでも同じ水準を発揮できるかは、全く別の検証が必要だ。欧州は、これまで見てきたようにAI Actをはじめとする厳格な規制環境を持つ地域であり、中国国内での実績だけを根拠に、性能や安全性を単純に外挿するのは早計だろう。

業界全体で加速する「中国発自動運転の海外展開」

Pony.aiのこの動きは、孤立した事例ではない。競合のWeRideは、デンマークのGreenMobilityと提携し、2027年にデンマークでの自動運転車展開を計画している。同じくUberと提携するMomentaは、アジア企業として初めて、ドイツ全土でのロボタクシーテスト許可を取得したとも報じられている。

中国の自動運転企業群が、示し合わせたかのように欧州市場への展開を加速させているこの状況は、中国国内での技術的な成熟度の高まりと、国内市場の規制環境の不透明さという、2つの要因が組み合わさった結果だと考えられる。

ソフト屋として見ておきたいこと

Pony.aiとUberの提携拡大は、技術提供・プラットフォーム提供・地元運用という分業モデルによって、自動運転技術の国際展開を加速させる、一つの効果的な事業モデルを示している。この仕組み自体は、技術的にも事業戦略としても、十分に合理的なアプローチだ。

一方で、「2,000台」という威勢の良い数字が、実際にどのようなペースで、どの都市で実現していくのかは、今後の続報を注視する必要がある。中国国内での実績が、欧州という異なる規制・交通環境の中で、どこまで再現性を持つのか。Pony.aiは8月18日に第2四半期決算を発表する予定であり、そこで示される財務指標や運用実績の詳細も、この計画の実現可能性を判断する上で、重要な材料になりそうだ。

自動運転ロボタクシーUber中国欧州

「見つける」では並んだが「作る」では大差——中国発オープンモデルが突きつけた、能力評価の複雑さ

▶ 中国Z.aiが8月14日公開したGLM-5.3が、CyberGymベンチマークでAnthropicのMythos 5(83.8%)をわずかに上回る84.5%を記録したと発表。1ポイント未満の差が持つ統計的な限界、ExploitBenchでの54.4%対78.0%という脆弱性発見と武器化能力の決定的な差、8月28日まで保留される重みの公開、269プロジェクトから2,436件の脆弱性を発見した実地テスト、7,430億パラメータの追加事後学習という技術的経緯までを解説する。

「見つける」では並んだが「作る」では大差——中国発オープンモデルが突きつけた、能力評価の複雑さ

8月14日、中国のAI企業Z.ai(旧Zhipu AI)が、新モデル「GLM-5.3」を公開した。同社は、このモデルがサイバーセキュリティ関連のベンチマーク「CyberGym」において、Anthropicの制限付きモデル「Mythos 5」をわずかに上回るスコアを記録したと発表している。AI研究者出身のジャーナリストとして、この「わずかに上回った」という結果が、実際には何を意味し、何を意味しないのかを、丁寧に整理してみたい。

CyberGymというベンチマークが測るもの

CyberGymは、AIモデルがソースコードを検査し、セキュリティ上の欠陥を発見し、その欠陥が本物の脆弱性であることを確認できるかどうかを評価する、1,507個のタスクから構成されるベンチマークだ。Z.aiの発表によれば、GLM-5.3はこのベンチマークで84.5%のスコアを記録し、Mythos 5の83.8%、OpenAIのGPT-5.6 Solの83.6%を、いずれもわずかに上回ったという。

評価の条件についても、Z.aiは詳細を公開している。Claude Code 2.1.207というハーネス(評価用の実行環境)を使い、最大限の推論努力を設定した上で、ウェブツールは使用せず、温度パラメータ1.0、トップP 1.0、最大出力長128,000トークンという条件で、各タスクにつき1回の試行(Pass@1)で評価を行ったという。

「わずかな差」を正しく解釈する

まず押さえておくべきは、この84.5%対83.8%という差が、統計的にどこまで意味のある差なのかという点だ。1ポイントに満たないこの差は、ベンチマークの設計や評価条件のわずかな違いによっても十分に生じうる範囲であり、「GLM-5.3がMythos 5を明確に上回った」と断定できるほどの、大きな差ではない。

さらに重要な留保として、この数字はすべてZ.ai自身が発表したものであり、第三者による独立した検証を経ていない。競合他社のモデルのスコアを自社が引用する形で比較する際には、評価条件の違いが結果に影響を与える可能性も念頭に置く必要がある。

「見つける」能力と「作る」能力の、決定的な差

今回の発表で、研究者として最も注目すべきなのは、CyberGymのスコアの近さではなく、その先にある「ExploitBench」というベンチマークでの、はるかに大きな差だ。ExploitBenchは、発見した脆弱性を、実際に動作する攻撃コード(エクスプロイト)にまで組み上げられるかどうかを評価する、より高度なテストだ。

このベンチマークで、GLM-5.3は54.4%のスコアにとどまったのに対し、Mythos 5は78.0%、GPT-5.6 Solも76.5%と、いずれもGLM-5.3を大きく上回っている。時間制限付きの攻撃開発タスク(2時間以内に105個中何個を完了できるか)という、より実践的な評価軸でも、Mythos 5は181個相当のタスクをこなしたとされ、GLM-5.3との差はさらに際立つ。

つまり、「脆弱性を見つけて、それが本物かどうかを判定する」という比較的受動的な能力では、両者の差はほとんどないが、「見つけた脆弱性を、実際に武器化する」というより能動的で高度な能力では、依然として大きな開きが存在するということになる。これは、AIモデルのサイバーセキュリティ能力を評価する際に、単一のベンチマークスコアだけで全体像を判断することの危うさを、如実に示す事例だ。

オープンウェイトという点の意味

もう一つ注目すべきは、GLM-5.3がオープンウェイトモデル(学習済みパラメータが公開され、誰でもダウンロード・利用できるモデル)として提供されている点だ。ただし、実際のモデルの重みの公開は、安全性レビューのため、8月28日頃まで保留される予定だという。

Mythos 5がAnthropicによって厳格にアクセス制限された、いわば「門番付き」のモデルであるのに対し、これに迫る能力を持つモデルがオープンな形で流通するようになれば、サイバーセキュリティ研究における「デュアルユース」問題の性質は、大きく変わってくる。実際、GLM-5.3は中国国内のセキュリティチームによる実地テストで、269件のオープンソースプロジェクトから2,436件の脆弱性を発見し、そのうち1,097件が中〜高深刻度に分類されたとも報告されている。

前作からの技術的な進化

GLM-5.3は、前作のGLM-5.2と同じ7,430億パラメータの混合エキスパート型アーキテクチャをベースとしており、新しいモデルをゼロから学習させたのではなく、追加の事後学習(ポストトレーニング)によって能力を引き上げたモデルだという。Z.aiによれば、コーディング性能は前作から約50%向上したとされる。

これは、基盤となるモデルアーキテクチャを一度作り込めば、その後の性能向上を、比較的低コストな追加学習によって継続的に実現できるという、近年のAI開発における効率化トレンドを反映した事例と言える。

研究者として見ておきたいこと

今回のZ.aiの発表は、「中国のAI企業が、サイバー防御の分野でも米国のフロンティア研究所に急速に迫りつつある」という見出しになりやすいニュースだ。しかし、その中身を丁寧に分解すると、「脆弱性の発見・検証」という比較的基礎的なタスクでは確かに肉薄しているものの、「その脆弱性を実際に武器化する」というより高度なタスクでは、依然として明確な差が存在するという、より precise な実像が見えてくる。

AIモデルの能力を評価する際には、見出しになりやすい単一のベンチマークスコアだけでなく、そのベンチマークが実際に何を測っているのか、そして関連する複数のベンチマークの間でどのような差が存在するのかを、あわせて確認する習慣が重要だ。今後、GLM-5.3の重みが実際に公開された段階で、独立した研究者による、より詳細な検証結果が出てくることを期待したい。

Z.aiサイバーセキュリティベンチマークオープンソースAIAI/ML
広 告300 × 250