広 告

AIトレンド速報

The Trend Tribune

広 告
2026年8月4日火曜日 夕刊 定価 無料
◆ 本日の主要記事

OpenAIの未発表モデル「Astra」が、10個の未解決数学問題を2000ドルで解いた

▶ OpenAIが8月1日、未発表の次期主力モデル「Astra」が数学・理論計算機科学分野の10年以上未解決だった問題10個を解き、Lean 4形式の機械検証可能な証明とともに公開したと発表。2025年10月のエルデシュ予想を巡る誤った発表との違い、群論における27年来の未解決問題「非ソフィック群」の解決、約2000ドルという計算コスト、ライデン宣言が指摘するリスクへの対応状況を解説する。

OpenAIの未発表モデル「Astra」が、10個の未解決数学問題を2000ドルで解いた
(写真はイメージ)

OpenAIの未発表モデル「Astra」が、10個の未解決数学問題を2000ドルで解いた

8月1日、OpenAIが一風変わった発表を行った。まだ一般公開されていない次期主力モデル「Astra」が、数学と理論計算機科学の分野で10年以上未解決だった問題を10個解き、しかもその全てに「機械が検証できる証明書」を添えて公開したのだ。エンジニアとしてこのニュースが興味深いのは、成果そのものよりも「なぜ今回は信じられるのか」という部分にある。

「またAIが数学を解いた」への根強い不信感

このニュースを聞いて、既視感を覚えたエンジニアも多いはずだ。実は2025年10月にも、当時のOpenAI幹部が「GPT-5がエルデシュ予想の未解決問題を10個解いた」と発表したことがあった。しかしこの発表は数日で崩れ去った。数学者のトーマス・ブルーム氏が検証したところ、モデルは既存の文献から解法を「検索」していただけで、独自に証明を組み立てていたわけではなかったことが判明したのだ。

今回のAstraの発表が違うのは、当のブルーム氏自身が「これは重要なニュースだ」と評価している点である。彼を含む数学コミュニティを納得させた仕組みが、今回の発表の核心と言える。

証明を「読める」形ではなく「検証できる」形で出す

技術的なポイントは、Lean 4という「定理証明支援系」(数学的な証明を、プログラムのようにコンピュータが一行ずつ検証できる形式で記述するツール)を使って、10個すべての証明を形式化した点にある。

通常、AIが生成した数学の証明は、人間の数学者が読んで「正しそうだ」と判断するしかない。しかしLean形式の証明は、読者が自分のノートPCで実際にコードを走らせるだけで、証明が本当に正しいかどうかを機械的に確認できる。OpenAIが公開したリポジトリでは、証明の未完了箇所を示す「sorry」という予約語の出現数がゼロだと報告されている——つまり、全ての論理ステップに抜け漏れがない状態で完結しているということだ。

これは、AIの出力を「信じる」ことから「検証する」ことへとシフトさせる、実務上とても大きな違いだ。

目玉は27年間未解決だった群論の問題

10個の結果は、群論、フォン・ノイマン環、高次元幾何学、量子計算量、格子暗号、極値組合せ論と、幅広い分野にまたがっている。中でも目玉とされているのが、「非ソフィック群」と呼ばれる群の具体的な構成例を初めて示した結果だ。

これは、数学者ミハイル・グロモフ氏が1999年に「ソフィック性」という概念を提唱して以来、27年間にわたって誰も証明も反証もできなかった、群論における中心的な未解決問題だった。この問題が今回、初めて決着したことになる。

わずか2000ドルという計算コストの意味

OpenAIの研究責任者セバスチャン・ビュベック氏によれば、10個すべての解を導き出すのにかかった計算コストは、同社のAPI料金換算でおよそ2000ドルだったという。これは象徴的な数字だ。数十年単位で人類の頭脳を悩ませてきた問題が、コーヒー数百杯分程度のコストで解けてしまったことになる。

ただし、この数字を鵜呑みにする前に押さえておくべき点もある。これはあくまで「解を導出するのに使われたトークンの、リスト価格ベースでの費用」であり、そのモデルを訓練するために投じられた莫大な研究開発コストは含まれていない。

数学界からは「歓迎」と「慎重な期待」が同居

この結果は、単にAI企業の自己申告として消費されているわけではない。2026年6月には、テレンス・タオ氏やピーター・ショルツ氏、スコット・アーロンソン氏ら著名な数学者が名を連ねる「ライデン宣言」という文書が、国際数学連合の支持のもとで発表されていた。この宣言は、AIと数学の関わりにおけるリスクとして、結果の信頼性の低さ、出典の欠如、閉じた商用システムへの依存、誇張された主張、そして科学的独立性の喪失という5点を挙げている。

今回のAstraの発表は、この5つのリスクのうち少なくとも3つに正面から向き合う形で設計されている。証明はLean形式で検証可能であり、249ページに及ぶ技術文書と、モデルがどう推論を組み立てたかを説明する62ページの解説文書まで公開された。「結果だけ見せて信じてくれ」ではなく、「検証プロセスごと渡すので好きに疑ってくれ」というスタンスだ。

エンジニアとして見ておきたいこと

このニュースの本質は、「AIが数学を解けるようになった」という話ではない。「AIが出した結果を、第三者が独立に、しかも機械的に検証できる仕組みが整い始めた」という点にある。

生成AIの出力を実務に組み込む際、多くのエンジニアが直面するのは「この出力は本当に正しいのか、どうやって確認すればいいのか」という壁だ。今回のケースは数学という極めて検証しやすい領域での成功例だが、「AIの生成物に、検証可能な形式の裏付けをどう持たせるか」という発想は、コード生成や設計文書のレビューなど、より身近な開発現場にも応用されていく視点になりそうだ。

OpenAIは今後、10万人の学術研究者に2027年まで自社のフロンティアモデルへの無料アクセスを提供するとも発表している。研究インフラを自社プラットフォームに囲い込む動きとも取れるが、少なくとも「検証可能な証明」という文化が、AIと数学研究の関わり方の標準になっていくとすれば、それ自体は歓迎すべき方向性だろう。

OpenAIAstraAI/ML数学Lean形式検証

車をやめてロボットを作る——BYDが8月に投入する「初号機」の中身を検証する

▶ 中国EV大手BYDが8月に自社初のヒューマノイドロボットを体験施設「Di Space」で披露すると発表。Tesla、Xiaomi、XPENGなど中国自動車メーカーが相次いでヒューマノイド事業に参入する背景にある技術スタックの共通性、10万台規模とされる2026年出荷予測の検証しにくさ、そして比較対象としてFremont工場での生産開始時期が「今年後半」へと後退したTesla Optimusの現状を、懐疑的な視点で読み解く。

車をやめてロボットを作る——BYDが8月に投入する「初号機」の中身を検証する

中国のEV大手BYDが、8月に自社初のヒューマノイドロボットを発表すると正式に表明した。発表の場は同社が展開する体験施設「Di Space(迪空間)」で、来場者が実際にロボットと触れ合える形での披露になるという。「またEVメーカーがロボット参入か」で片付けたくなるところだが、中身を見ていくと、業界構造として無視できない動きが見えてくる。

自動車メーカーが続々とヒューマノイドに参入する理由

BYDに続けとばかりに、Tesla、Xiaomi、XPENG、一汽(FAW)、Chery、東風、長安、広汽(GAC)と、中国の自動車メーカーが軒並みヒューマノイド事業に手を伸ばしている。これは偶然ではない。自動運転車とヒューマノイドロボットは、「センサーで周囲を認識し、判断し、モーターやアクチュエータで物理的に動く」という技術スタックがかなり重なっている。

実際、自動車部品を手がけるTier1サプライヤーたち——均胜電子(Joyson Electronics)、RoboSense、禾賽科技(Hesai)、黒芝麻智能(Black Sesame)——も、車載グレードの技術をロボティクスに転用する動きを見せている。均胜電子は2026年の世界人工知能大会(WAIC)で、器用な手「霊犀(Lingxi)」や個体・液体ハイブリッドバッテリー、第3世代AIヘッドモジュール、電子皮膚などをフルスタックで展示していた。つまりBYDの参入は、自動車産業全体が持つ「認識・判断・駆動」のノウハウを、車という枠から解き放つ流れの一部と見るべきだろう。

「量産化検証」から「商用パイロット」へのフェーズ移行

業界予測によれば、ヒューマノイド市場は技術検証の段階から商用パイロットの段階へと急速にシフトしており、世界出荷台数は2026年中に10万台規模に達する可能性があるという。これが本当なら、大規模展開に向けた重要な転換点ということになる。

ここで筆者として強調しておきたいのは、この手の「〇万台」という数字は、業界予測や企業の自己申告であることが多く、独立した第三者による検証を経ていないケースがほとんどだという点だ。中国発のロボット関連の発表は特に、実際の稼働実績や量産体制の裏付けが薄いまま数字だけが独り歩きしやすい。今回のBYDの発表についても、「8月に披露される」という事実と、「その先どれだけ実用化・量産化されるか」は、切り分けて見ておく必要がある。

比較対象:Teslaの「Optimus」はどこまで進んでいるか

同じ自動車発のヒューマノイドとして比較になるのが、TeslaのOptimusだ。こちらは2026年1月の決算発表で、Fremont工場でのModel S/X生産終了とOptimus生産ラインへの転換が発表され、当初は「7月末から8月にかけて低ボリューム生産を開始する」というガイダンスだった。

しかし7月22日の株主向けアップデートでは、この具体的な時期の言及が「今年後半のどこかで(later this year)」という、より曖昧な表現に差し替えられている。7月2日時点の生産レポートにもOptimusの生産台数は一切記載されていない。マスク氏自身、初期の生産ペースは「非常に遅い」と繰り返し警告しており、10,000点を超える専用部品を使った全く新しい生産ラインであることを踏まえると、この遅延は驚くべきことではない。

Boston DynamicsのAtlasやFigureのFigure 03、Agility RoboticsのDigitといった競合が、既にHyundaiやBMW、GXOなどの現場で検証可能な稼働実績(Digitは9つの商用施設で65,000時間超の稼働記録)を積み上げているのに対し、Teslaは依然として「稼働台数」の公式な数字を一度も公表していない。ヒューマノイド業界を見るときは、「発表された生産開始時期」と「独立して検証可能な稼働実績」を、常に別のものとして扱う癖をつけておいた方がいい。

ソフト屋として気になる「機能する」の中身

BYDは今回、単なるコンセプト展示ではなく「機能するロボット」を披露し、来場者が実際に触れ合える体験型の展示にすると説明している。個人的にここが一番気になるポイントだ。「歩ける」「手を振れる」というデモレベルの機能性なのか、それとも物体を認識して掴む、簡単な指示に従って作業するといった、実用に近いレベルの自律性を備えているのか。この違いは、発表を見ただけでは判断できない。

過去にも「デモでは滑らかに動いていたロボットが、実は遠隔操作だった」というケースは、この業界で何度も繰り返されてきた。BYDの発表を評価する際は、8月の実演で何が「自律的に」行われ、何が「オペレーターの補助」なのかを、映像や現地レポートから慎重に見極める必要があるだろう。

エンジニアとして見ておきたいこと

自動車産業からのヒューマノイド参入ラッシュは、「認識・判断・駆動」という技術スタックの水平展開という意味で、産業構造として合理的な流れだ。BYDの参入もその文脈で理解できる。

一方で、中国発のロボット関連発表につきものの「数字の一人歩き」には、これまで同様に警戒しておきたい。8月のBYD発表で本当に見るべきは、展示会場の熱気ではなく、「どこまでが自律動作で、どこからが人間の補助なのか」という、地味だが本質的な部分だ。今後、実演映像や第三者による検証レポートが出てきた段階で、改めて評価したいと思う。

BYDヒューマノイド中国TeslaOptimusフィジカルAI

「安全性スコアが高いAI」は本当に安全なのか——ベンチマークそのものを検証した論文が突きつけた問い

▶ 7月30日にarXiv投稿された論文「Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks」が、R-Judge・InjecAgent・AgentHarm・AgentDojoという主要な安全性ベンチマーク自体の妥当性を、9組織・最大22モデルのパネルで検証。単純な判定方式でも高スコアが出てしまう指標の欠陥、ベンチマーク間でのランキング不一致、能力とミスアライメント安全性の負の相関(ρ=-0.44)とパネル拡大による変化、AgentHarmとジェイルブレイク耐性の収束的妥当性まで解説する。

「安全性スコアが高いAI」は本当に安全なのか——ベンチマークそのものを検証した論文が突きつけた問い

AIエージェントの安全性を測るベンチマークは、これまで数多く提案されてきた。R-Judge、InjecAgent、AgentHarm、AgentDojo——名前を聞いたことがある研究者やエンジニアも多いだろう。しかし7月30日にarXivに投稿された論文「Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks」は、そもそも「これらのベンチマークのスコアを、そのまま『AIエージェントの安全性』として引用してよいのか」という、根本的な問いを投げかけている。

ベンチマークという「ものさし」自体を疑う

この論文がユニークなのは、AIモデルそのものではなく、AIモデルを測るための「ものさし」であるベンチマーク側を検証対象にしている点だ。研究チームは、9つの開発組織(OpenAI、Meta、Qwen、Mistral、DeepSeek、Amazon、Anthropic、Google、Cohere)にまたがる最大22モデルを対象に、4つの主要な安全性ベンチマークを公式実装・公式スコアラーで動かし、さらにMMLUとGPQAという能力ベンチマークのスコアも独自に測定して「能力の総合指標」とした。

つまり「このモデルは安全性ベンチマークで高得点だった」という言説を、鵜呑みにせず一つ一つ検証し直した、という研究だ。

「常に危険と判定する」だけで高スコアが取れてしまう問題

最初に指摘されているのが、評価指標そのものの欠陥だ。R-Judgeというベンチマークは、AIの行動記録(トレース)を二値(安全か危険か)で判定し、F1スコアという指標で評価する。ところがこの論文の分析によれば、「常に『危険』と判定する」という、実質的に何も判断していないポリシーでも、F1スコアは0.690に達してしまう。これは、実際に判別能力を持つ21モデルのうち5モデルよりも高いスコアだ。

これは、評価に使われる指標の設計次第で、「何もしていない」判定方式が「優秀」に見えてしまうという、評価手法における典型的な落とし穴を示している。

ベンチマーク同士でランキングが食い違う

さらに厄介なのは、複数の広範囲カバー型ベンチマークが、同じ18モデルに対してそれぞれ異なる順位をつけてしまう点だ。論文では、この不一致の背景に「小規模パネル特有のアーティファクト(見かけ上の統計的パターン)」があることを突き止めている。

具体的には、R-Judgeの特異度(安全な行動を正しく安全と判定する能力)とAgentHarmの安全性スコアの相関係数は、7モデルという小さな標本では-0.64、18モデルに広げるとほぼゼロの+0.02にまで変化する。しかもランダムに7モデルを抽出した場合、4分の1のケースで相関係数の絶対値が0.5以上という、本来存在しないはずの強い相関が偶然出現してしまうという。評価対象のモデル数が少ないと、統計的なノイズを「意味のある傾向」と誤読してしまうリスクが高いことを、この研究は数字で示している。

「能力が高いAIほど危険」という逆説的な相関

この論文で最も議論を呼びそうなのが、能力とミスアライメント(AIが意図された振る舞いから逸脱すること)の関係性だ。能力の総合指標は、実際のタスク成功率とは正の相関(ρ=+0.60)を示す一方で、ミスアライメント安全性のスコアとは負の相関(ρ=-0.44、n=21)を示している。

対になる20モデルのパネルで見ると、この差はΔ=-1.00(95%信頼区間 [-1.48, -0.49]、p<0.001)という統計的に有意な水準に達し、組織を1つずつ除外して再計算する分析や、組織単位でのブートストラップ分析を行っても、この傾向は崩れなかったという。ただし興味深いことに、対象を41モデルに広げると、この負の相関は-0.16(信頼区間には0をまたぐ [-0.54, +0.22])まで弱まり、代わりにジェイルブレイク耐性との相関が+0.34まで強まる——ただしどちらの変化も統計的に有意ではない、とも報告されている。

つまり「能力の高いモデルほど危険」という単純な図式で断定するのは早計で、対象モデルの範囲や、どの種類の安全性を測っているかによって、結論が変わりうるということだ。

AgentHarmが示した「収束的妥当性」の意味

一方で明るい材料もある。AgentHarmというベンチマークは、能力の影響を統計的に取り除いた上でも、3種類のテンプレートを使ったジェイルブレイク安全性テストとρ=+0.72という強い相関を示した。

ただし論文はここでも慎重な留保をつけている。この2つの指標は、どちらも「有害な指示にどれだけ従ってしまうか」という近い性質のものを測っているため、これは「AIエージェントの安全性全般を正しく測れている」証拠というより、「似たものを測る2つの指標が、互いに整合している」という、より限定的な意味での妥当性(収束的妥当性)に過ぎない、という指摘だ。

研究者として見ておきたいこと

この論文が最後に投げかけているメッセージは、極めてシンプルだ——「安全性の主張をするなら、最低限、どのベンチマークで、どの指標で、何を測って、どのモデル群を対象にしたかを、明示しなければならない」。

これは当たり前のようでいて、実際には多くの安全性に関する発表やニュース記事が省略している情報でもある。「このモデルは安全性ベンチマークでトップスコアだった」という一文だけを見たとき、それがどのベンチマークの、どの指標での話なのかを確認する習慣は、AIの安全性評価というまだ発展途上の分野を追いかける上で、今後ますます重要になっていきそうだ。

参考:arxiv.org/arxiv.org
AIエージェントAI安全性ベンチマークAI/ML論文統計
広 告300 × 250