Xで見かける、ある種の「安心材料」
「最近ハルシネーションの話題をあまり見なくなったのは、課金してフラッグシップモデルを使っている人が増えたからで、まだ騒いでいるのは無料版を使っている人たちだ」——こうした趣旨の投稿が、ここ最近Xで話題になっている。直感的には筋が通った話に聞こえる。実際、OpenAIが7月に発表したChatGPTの無料版向けモデル「GPT-5.6 Luna」と、有料版向けの「GPT-5.6 Sol」を比べると、Solはハルシネーション率を68%削減したと同社自身が説明している。無料版と課金版の間に、確かに実在する性能差があるのは事実だ。ただし、この一つの数字だけを根拠に「ハルシネーションはもう無料版だけの問題だ」と結論づけるのは、ベンチマークの中身を見ていくと、かなり危うい単純化だということが分かってくる。
ベンチマークによって「答え」が正反対になる
ここが今回一番書いておきたい点だ。ハルシネーション率という一つの指標のように見えて、実際には測定方法によって評価がまるで変わる。Vectaraが運営する要約タスクのベンチマーク(与えられた文章を要約させ、その正確性を測る)では、2026年時点でAnthropic・OpenAI・Googleのフロンティアモデルはおおむね7〜15%程度のハルシネーション率に収まっている。文脈(ソース文書)が与えられたうえでの要約というタスクでは、フラッグシップモデルは総じて優秀だ。ところが、Artificial Analysis社が開発した「AA-Omniscience」という、文脈なしで難しい事実確認問題に答えさせるベンチマークでは、様相が一変する。GPT-5.6 Solのハルシネーション率は92.2%、Claude Fable 5は63.6%と、むしろ無名の小型モデルよりも高い数値を記録している。
「答えない」という選択肢の値段
なぜこれほど結果が変わるのか。AA-Omniscienceの採点方式に、その理由がある。このベンチマークは、モデルが「正解」「不正解」「わからないと答えて棄権」の3択のどれを選んだかを見ており、ハルシネーション率は「不正解だった回答」を「不正解+棄権の合計」で割って算出される。つまり、分からない問題に対して「分かりません」と正直に答える(棄権する)モデルは、この指標上のハルシネーション率が下がる。一方、知らない問題にも自信満々で答えようとするモデルは、その多くが外れて、ハルシネーション率が跳ね上がる。Artificial Analysis自身の分析は、この点を率直に認めている——「モデルサイズと正答率には相関があるが、ハルシネーション率には相関がない」。つまり、より賢く、より高価なモデルほど、分からない問題にも答えようとする傾向が強く、結果としてこの種のベンチマークでのハルシネーション率が高く出やすいという、直感に反する構造があるのだ。
KimiK3が示す「正答率は上がったのに、ハルシネーション率も上がった」現象
この構造を端的に示す例が、Moonshot AIのKimi K3だ。前モデルのK2.6からK3への刷新で、AA-Omniscience上の正答率は33%から46%へと大きく向上した。ところが同時に、ハルシネーション率も39%から51%へと悪化している。総合スコア(Omniscience Index)自体はこの間+6から+18へ改善しているが、これはスコアリング方式が正答率の向上をハルシネーション率の悪化よりも重く評価する設計になっているためだ。「賢くなった」と「ハルシネーションが減った」は、必ずしも同じ方向を向いた変化ではない、という事実を、この数字は端的に示している。
「課金すれば安心」の部分的な正しさ
ここまでの整理を踏まえたうえで、冒頭のXの主張のどこが正しく、どこが危ういのかを切り分けておきたい。文脈が与えられた要約・情報整理・コーディング支援といった、日常的な利用シーンの多くでは、フラッグシップモデルが無料・軽量モデルより確実に安定した出力を返す傾向にあり、この意味で「課金すれば安心」という直感は的外れではない。一方で、「モデルが自分の知識の限界を正直に認め、知らないことを知らないと言えるか」という、より根源的な信頼性の軸においては、フラッグシップモデルが必ずしも優れているとは限らず、むしろ悪化しているケースすらある。この二つの軸を区別せずに「フラッグシップなら安心」と一括りにしてしまうことが、今回のXでの議論に潜む単純化の落とし穴だと言える。
研究者として見ておきたいこと
「ハルシネーション率」という一つの数字の裏には、測定タスクの設計、採点方式、そしてモデルの「答える/答えない」という戦略的な選択が複雑に絡み合っている。単一のベンチマークスコアだけを見て「このモデルは信頼できる」「あのモデルは信頼できない」と判断するのは早計であり、少なくとも「文脈ありの要約タスク」と「文脈なしの知識想起タスク」という、性質の異なる2種類の評価軸を意識的に使い分ける必要がある。今後、モデル開発企業が「賢さ」と「誠実な棄権」のどちらを最適化のターゲットに据えるかという設計判断が、この種のベンチマーク間の乖離をどう縮めていくのか、引き続き注視していきたい。