AIは「まだ見ぬ論文」のアイデアを再現できるか——たった3〜15%という数字が示す、科学的推論の本当の壁
8月、「Reconstruction」と名付けられた新しいベンチマークがarXivに公開された。フロンティアの大規模言語モデルに、ある研究論文の参考文献リストだけを見せて、その論文が実際にどんな仮説を提示していたかを再構築させるという、ユニークな評価手法だ。結果は、最高性能のモデルでもわずか3〜15%という、驚くほど低いスコアだった。AI研究者出身のジャーナリストとして、この結果が意味することを丁寧に見ていきたい。
「答えを覚えていない」ことを保証する、巧妙な設計
このベンチマークが技術的に優れている点は、「ベンチマーク汚染」という、AI評価における根深い問題に、正面から向き合っている点だ。ベンチマーク汚染とは、評価に使われるはずの問題や答えが、モデルの学習データに紛れ込んでしまい、モデルが実質的に「答えを丸暗記した状態」でテストに臨んでしまう現象を指す。2026年に行われた、60種類のLLMベンチマークを対象にした飽和度調査では、実にその半数近くが、既にこの種の汚染によって「飽和」している可能性が指摘されているという。
Reconstructionは、この問題を構造的に回避する設計を採用している。評価対象の論文が、モデルの学習データのカットオフ日以降に発表されたものであれば、その論文の内容がモデルの学習データに含まれている可能性は、原理的にゼロになる。つまりモデルは、論文の中身を「思い出す」のではなく、参考文献リストという手がかりだけから、その論文が実際に何を主張していたかを、純粋に「推論」しなければならない。
「単体では3〜15%」という、厳しい現実
この巧妙な設計のもとで測定された結果が、冒頭に紹介した3〜15%というスコアだ。この数字が示しているのは、フロンティアモデルが単独で、参考文献という間接的な手がかりから、研究のアイデアそのものを正確に再構築する能力は、現時点では極めて限定的だという事実だ。
研究チームは、この結果が「プロンプトの設計が悪かった」あるいは「評価方法に何らかの欠陥がある」ことによる見かけ上の低さではなく、モデルが直面している本物の能力的な天井を反映していると主張している。汚染を排除した状態で測定しているからこそ、この数字には説得力がある。
マルチエージェントで「42%」まで改善——それでも半分に届かない
興味深いのは、この研究がここで終わっていない点だ。研究チームは、複数のAIモデルを組み合わせた「マルチエージェント方式」でも、同じタスクを評価している。具体的には、複数のモデルによる相互レビューと、上位4つの候補案を選び抜く「スイス式トーナメント」(勝敗に応じて次の対戦相手が決まる、公平性の高いトーナメント方式)を組み合わせたパイプラインだ。外部のウェブ検索は使わず、あくまで与えられた参考文献情報のみから推論させている。
この複数モデルによる協調的なアプローチによって、正解率は42%にまで引き上げられた。単体モデルの最良のスコアと比較して、大幅な改善と言える。しかし、それでもなお半分を下回る水準にとどまっている。複数のAIを組み合わせても、まだ「専門家の科学的直感」に相当する能力には、届いていないということになる。
この結果を「額面通り」に受け取ることの難しさ
一方で、この研究結果の解釈には、慎重さも必要だ。トップスコアを記録した15%という数字の中身が、哲学的な意味で本当に「推論」と呼べるものなのかどうかは、依然として議論の余地がある。単に、参考文献の組み合わせパターンから統計的に「それらしい」仮説を出力しているだけなのか、それとも何らかの意味のある推論プロセスを経ているのかは、このベンチマークのスコアだけからは判別できない。
しかし、この論文が示す「実務的な天井」——参考文献という手がかりから、真に新しい研究のアイデアを再構築する能力に、現在のモデルが明確な限界を抱えているという事実——は、汚染耐性という頑健な設計によって、経験的に裏付けられたと言える。
タイミングの皮肉:華々しい発表が相次ぐ、まさにその時期に
この論文が公開されたタイミングも、示唆に富んでいる。2026年8月には、複数のフロンティア研究所が、AIが数学の未解決問題を解いたり、暗号アルゴリズムの弱点を発見したりといった、華々しい科学的成果を相次いで発表していた。以前取り上げたOpenAIのAstraによる数学証明も、その一例だ。
Reconstructionが示す結果は、こうした個別の成功事例の裏側で、AIの科学的推論能力には、依然としてタスクの種類によって大きなばらつきがあることを、冷静に指摘している。既に確立された数学的枠組みの中で証明を組み立てる能力と、全くのゼロから新しい研究の方向性を発想する能力とは、性質の異なる課題だという可能性が、この結果から浮かび上がってくる。
研究者として見ておきたいこと
このベンチマークが投げかける最大の教訓は、AIの科学研究への貢献を評価する際、個別の華々しい成功事例だけでなく、「その能力が、どこまで一般化できるものなのか」を、汚染に頑健な設計で継続的に検証していくことの重要性だ。
今後、この種の「訓練データに含まれ得ない、真に新しい問題」を対象にしたベンチマークが、AIの科学的推論能力を評価する上での標準的な手法として、さらに普及していく可能性がある。マルチエージェント方式による42%という結果が、今後さらなる手法の改良によってどこまで伸びていくのか、そしてその成長カーブが、真の「推論能力の向上」を反映しているのか、それとも別の限界にぶつかるのか、継続的に注視していきたい。