「14倍少ないトークン」の代償——OpenAIの新モデルが招いた、思考が読めなくなるという懸念
9月2日、The Informationの報道をきっかけに、AI安全性コミュニティで激しい議論が巻き起こった。OpenAIの次期フロンティアモデル「Astra」が、「再帰的深度(recurrent depth)」、通称「ループ型トランスフォーマー」と呼ばれる新しいアーキテクチャを採用しており、これがモデルの「思考の連鎖(chain of thought)」を、人間が読めない形にしてしまう可能性がある、という内容だ。エンジニアとして、この技術的な仕組みと、それを巡る議論の落としどころを見ていきたい。
「同じブロックに何度も通す」という、新しい設計
まず、この「ループ型トランスフォーマー」という技術の仕組みを理解しておきたい。通常のトランスフォーマーモデルは、入力されたトークン(単語の断片)を、ネットワークの各層に、一度だけ順番に通していく。しかしループ型の設計では、トークンを単一のブロック(複数の層で構成されうる、ネットワークの一部分)に、複数回繰り返し通す。しかも、そのブロックの出力を、毎回「スクラッチパッド」(人間が読めるテキストとして書き出す領域)に記録することなく、そのまままた同じブロックへと送り返す。
この仕組みの利点は、同じ数学的処理を繰り返し使い、すべてのトークンをネットワークの全層に通す必要がないため、モデルサイズに対して、より高い性能を引き出せる点にある。報道によれば、Astraはこの手法により、従来モデルと比較して、最大14分の1という、少ない出力トークン数で、優れた結果を達成しているという。
「思考の連鎖」というモニタリング手法への打撃
この技術が安全性研究者の間で懸念を呼んでいる理由は、AIの安全性を確保するための、重要な手法の一つが、この変化によって弱められる可能性があるからだ。「思考の連鎖モニタリング」とは、AIモデルが最終的な答えを出す前に、その推論過程を自然言語のテキストとして書き出させ、人間がそれを読むことで、モデルが何を考え、なぜその結論に至ったのかを、外部から検証できるようにする手法だ。
ループ型トランスフォーマーでは、この推論の一部が、自然言語のテキストとしてではなく、ブロックの内部で処理される、数値表現(「ニューラリーズ」と呼ばれることもある)として進行する。この数値表現は、人間の言語よりもはるかに情報密度が高い一方で、人間には全く理解できない形式だ。AI安全性研究者のライアン・グリーンブラット氏は、もしこの報道が事実であれば、「これまでのAI安全性における、最悪の展開の一つになるかもしれない」と、強い懸念を表明していた。
OpenAIチーフサイエンティストによる、迅速な火消し
この報道からわずか4時間後、OpenAIのチーフサイエンティスト、ヤクブ・パホツキ氏が、X(旧Twitter)で反論を投稿している。同氏は「Astraはニューラリーズを使用していない」と明言し、「現在のフロンティアモデル(Astraを含む)の計算グラフの深さは、GPT-4の2倍以内に収まっている」と、技術的な具体性を伴って説明した。
パホツキ氏はさらに、「OpenAIは、最初の推論モデル以来、思考の連鎖モニタリングを維持・活用するために取り組んできた。このモニタリングは脆弱で、残念ながら悪化する方向に傾きつつあるが、それはアーキテクチャの変更に起因するものではない」と述べ、この技術を強化するための取り組みが、現在の研究プログラムの中核的な目標であるとも付け加えている。
「完全に否定はしていない」という、微妙な着地点
この一連のやり取りを丁寧に追った複数の分析が指摘するのは、OpenAIの反応が「完全な否定」ではなかったという点だ。パホツキ氏は、Astraがニューラリーズを「使用していない」と述べる一方で、「モニタリング能力(monitorability)は低下している」という事実自体は、認めている。
つまり、報道された「ニューラリーズ」という、より極端な特徴づけは正確ではないものの、Astraの新しいアーキテクチャが、思考の連鎖モニタリングという安全性ツールの有効性を、何らかの形で弱めているという、より穏当な事実自体は、OpenAI自身も否定していないことになる。
「Twitterでの決着」という、ガバナンスのあり方への疑問
この一連の騒動を観察していた、AI政策の論者ディーン・ボール氏は、興味深い指摘をしている。同氏は、今回の「ニューラリーズ」を巡る誤った主張への パニックそのものが、「規制の必要性、特にフロンティアAIラボの監査と技術評価の、迅速な制度化の必要性」を、逆説的に浮き彫りにしていると論じている。
「我々は今、技術的に複雑で微妙な主張を、実際に何が起きているかについての、ほぼ地に足のついた情報がないまま、Twitterのタイムラインの速度で裁定している」というボール氏の指摘は、この分野の透明性を巡る、より根深い課題を示している。
エンジニアとして見ておきたいこと
今回の一件が示しているのは、AIモデルの効率性向上と、その透明性・監視可能性の維持という、2つの目標の間に存在する、緊張関係だ。14倍という劇的なトークン削減は、計算コストの削減という点で、実務上極めて魅力的な進歩だ。しかし、その効率性が、人間による監視のしやすさを犠牲にする形で実現されるのであれば、その代償を正確に理解した上で、採用の是非を判断する必要がある。
AIモデルの内部動作を完全にブラックボックス化させないための技術的な工夫——パホツキ氏が「強化のための取り組み」と呼ぶもの——が、今後どのように具体化されていくのか。そして、この種の技術的な論争が、Twitter上での応酬ではなく、より体系立った検証プロセスを通じて解決されるようになるのか。今後の展開を、注視していきたい。