広 告

AIトレンド速報

The Trend Tribune

広 告
2026年10月1日木曜日 朝刊 定価 無料
◆ 本日の主要記事

「ハルシネーションは無料版のせい」説をベンチマークで検証する——測定方法次第で答えが逆転する理由

▶ 「ハルシネーションが話題にならなくなったのは無料版ユーザーだけの問題だからだ」というX上の主張を、Vectara HHEMとAA-Omniscienceという2つのベンチマークのデータで検証する。文脈ありの要約タスクとは対照的に、文脈なしの知識想起タスクではフラッグシップモデルほどハルシネーション率が高く出る「棄権しない」構造を、Kimi K3の事例とともに読み解く。

「ハルシネーションは無料版のせい」説をベンチマークで検証する——測定方法次第で答えが逆転する理由
(写真はイメージ)

Xで見かける、ある種の「安心材料」

「最近ハルシネーションの話題をあまり見なくなったのは、課金してフラッグシップモデルを使っている人が増えたからで、まだ騒いでいるのは無料版を使っている人たちだ」——こうした趣旨の投稿が、ここ最近Xで話題になっている。直感的には筋が通った話に聞こえる。実際、OpenAIが7月に発表したChatGPTの無料版向けモデル「GPT-5.6 Luna」と、有料版向けの「GPT-5.6 Sol」を比べると、Solはハルシネーション率を68%削減したと同社自身が説明している。無料版と課金版の間に、確かに実在する性能差があるのは事実だ。ただし、この一つの数字だけを根拠に「ハルシネーションはもう無料版だけの問題だ」と結論づけるのは、ベンチマークの中身を見ていくと、かなり危うい単純化だということが分かってくる。

ベンチマークによって「答え」が正反対になる

ここが今回一番書いておきたい点だ。ハルシネーション率という一つの指標のように見えて、実際には測定方法によって評価がまるで変わる。Vectaraが運営する要約タスクのベンチマーク(与えられた文章を要約させ、その正確性を測る)では、2026年時点でAnthropic・OpenAI・Googleのフロンティアモデルはおおむね7〜15%程度のハルシネーション率に収まっている。文脈(ソース文書)が与えられたうえでの要約というタスクでは、フラッグシップモデルは総じて優秀だ。ところが、Artificial Analysis社が開発した「AA-Omniscience」という、文脈なしで難しい事実確認問題に答えさせるベンチマークでは、様相が一変する。GPT-5.6 Solのハルシネーション率は92.2%、Claude Fable 5は63.6%と、むしろ無名の小型モデルよりも高い数値を記録している。

「答えない」という選択肢の値段

なぜこれほど結果が変わるのか。AA-Omniscienceの採点方式に、その理由がある。このベンチマークは、モデルが「正解」「不正解」「わからないと答えて棄権」の3択のどれを選んだかを見ており、ハルシネーション率は「不正解だった回答」を「不正解+棄権の合計」で割って算出される。つまり、分からない問題に対して「分かりません」と正直に答える(棄権する)モデルは、この指標上のハルシネーション率が下がる。一方、知らない問題にも自信満々で答えようとするモデルは、その多くが外れて、ハルシネーション率が跳ね上がる。Artificial Analysis自身の分析は、この点を率直に認めている——「モデルサイズと正答率には相関があるが、ハルシネーション率には相関がない」。つまり、より賢く、より高価なモデルほど、分からない問題にも答えようとする傾向が強く、結果としてこの種のベンチマークでのハルシネーション率が高く出やすいという、直感に反する構造があるのだ。

KimiK3が示す「正答率は上がったのに、ハルシネーション率も上がった」現象

この構造を端的に示す例が、Moonshot AIのKimi K3だ。前モデルのK2.6からK3への刷新で、AA-Omniscience上の正答率は33%から46%へと大きく向上した。ところが同時に、ハルシネーション率も39%から51%へと悪化している。総合スコア(Omniscience Index)自体はこの間+6から+18へ改善しているが、これはスコアリング方式が正答率の向上をハルシネーション率の悪化よりも重く評価する設計になっているためだ。「賢くなった」と「ハルシネーションが減った」は、必ずしも同じ方向を向いた変化ではない、という事実を、この数字は端的に示している。

「課金すれば安心」の部分的な正しさ

ここまでの整理を踏まえたうえで、冒頭のXの主張のどこが正しく、どこが危ういのかを切り分けておきたい。文脈が与えられた要約・情報整理・コーディング支援といった、日常的な利用シーンの多くでは、フラッグシップモデルが無料・軽量モデルより確実に安定した出力を返す傾向にあり、この意味で「課金すれば安心」という直感は的外れではない。一方で、「モデルが自分の知識の限界を正直に認め、知らないことを知らないと言えるか」という、より根源的な信頼性の軸においては、フラッグシップモデルが必ずしも優れているとは限らず、むしろ悪化しているケースすらある。この二つの軸を区別せずに「フラッグシップなら安心」と一括りにしてしまうことが、今回のXでの議論に潜む単純化の落とし穴だと言える。

研究者として見ておきたいこと

「ハルシネーション率」という一つの数字の裏には、測定タスクの設計、採点方式、そしてモデルの「答える/答えない」という戦略的な選択が複雑に絡み合っている。単一のベンチマークスコアだけを見て「このモデルは信頼できる」「あのモデルは信頼できない」と判断するのは早計であり、少なくとも「文脈ありの要約タスク」と「文脈なしの知識想起タスク」という、性質の異なる2種類の評価軸を意識的に使い分ける必要がある。今後、モデル開発企業が「賢さ」と「誠実な棄権」のどちらを最適化のターゲットに据えるかという設計判断が、この種のベンチマーク間の乖離をどう縮めていくのか、引き続き注視していきたい。

ハルシネーションAA-OmniscienceベンチマークLLM評価GPT-5.6

「会話が終わっても働き続ける」エージェント——OpenAI DevDay 2026が示した「Dots」の中身

▶ OpenAIが9月29日のDevDay 2026で、会話と独立して常時稼働する新エージェント「Dots」を発表した。GPT-6 Astraを土台に、5分の1のコストで動くGPT-6.1 Sol、4000アプリ連携、承認ゲートとプライベート・セーフティ・プロセッシングによる安全設計、MetaのMuseとの競争構図までを読み解く。

「会話が終わっても働き続ける」エージェント

9月29日、サンフランシスコで開催されたOpenAI DevDay 2026で、サム・アルトマンCEOが「Dots」という新しいエージェントを発表した。これまでのChatGPTは、ユーザーが質問を投げかけ、答えが返ってきたらそこで会話が終わる、という一問一答の構造が基本だった。Dotsはこの前提を覆す。会話とは独立して常時稼働し、自分専用のクラウドコンピュータとブラウザを持ち、4000種類のアプリケーション連携を通じて、ソフトウェア開発からデータ調査、社内業務まで、継続的なワークフローをこなし続けるという。

モデルの土台とコストの両面から見る設計

Dotsを動かしているのは、OpenAIの最上位モデルGPT-6 Astraだ。同時に発表されたGPT-6.1 Solは、エージェント型コーディング向けに最適化された高効率モデルで、Astraの5分の1という計算コストで提供されるという。DevDayでは新しいAgents API経由で「ホスト型ブラウザ・デスクトップ」も提供されており、開発者はエージェントにクリックやタイピングをさせられる仮想デスクトップ環境を、自前で構築せずに使えるようになった。派手な機能追加の裏で、コスト効率という地味だが重要な軸にもきちんと手が入っている点は評価したい。

「特化型Dots」とMicrosoftとの連携

個人向けのDotsに加えて、企業向けの「Specialist Dots」も発表されている。これは特定の業務役割向けに権限と機能を絞り込んだエージェントで、Microsoft Agent 365と連携し、既存の管理ツールを通じてガバナンスできる設計になっているという。企業がAIエージェントを導入する際に最も懸念するのが、権限管理と監査可能性だ。既存のエンタープライズ管理基盤に統合するという判断は、実運用を見据えた現実的なアプローチだと言える。

「もっと自律的に」と「安全に」の両立をどう図るか

Dotsのような常時稼働型エージェントは、自律性が高まるほどリスクも増す。OpenAIはこれに対し、承認ゲート(エージェントが一定の行動を取る前にユーザーの承認を求める仕組み)と、「プライベート・セーフティ・プロセッシング」という機能を組み合わせている。後者は、OpenAIの担当者が保護対象の顧客コンテンツを直接閲覧する新たな経路を作ることなく、自動化された安全性レビューを行えるようにする仕組みだという。Dotsはユーザーが接続した読み取り専用のツールを通じて、タスクに取り組んでいない時間帯にも「プロアクティブ・リサーチ」を行うとされており、この種の機能拡張のたびに、権限の範囲とプライバシー保護の設計がどう両立されているかを確認する必要がある。

MetaのMuseとの競争という文脈

今回のDots発表のタイミングは、Metaの個人向けAIエージェント「Muse」が話題を集めている直後だった。Museが一般消費者向けの「エージェント型コンパニオン」というポジショニングを取るのに対し、OpenAIはDotsをより業務寄りの「常時稼働の実行役」として位置づけている。同じ「パーソナルエージェント」という概念を、消費者向けと業務向けという異なる軸で各社が模索している構図が、この秋の大きな流れとして浮かび上がってきている。

エンジニアとして見ておきたいこと

「会話の合間も働き続けるエージェント」という発想自体は、これまでのAIコーディングエージェントで培われてきた「バックグラウンドで継続的にタスクを進める」という設計思想の延長線上にある。ただしDotsは、コーディングという限定領域を超えて、スケジュール管理や社内調査など、より広範な業務領域にこの設計を適用しようとしている点が新しい。Pro・Business Premiumユーザーへの提供から始まり、Enterprise・Education・Healthcare向けのオプトインベータへと段階的に広がっていく計画だという。実際にどれだけのユーザーが、この種のエージェントに「意味のある仕事」を任せて手放せるかどうかが、Dotsの成否を左右する試金石になりそうだ。

OpenAIDotsAIエージェントDevDayGPT-6

「50兆ドル市場」と「32.4兆ドル市場」、どちらが正しいのか——SiMa.aiの14.5億ドル評価を会計士が読む

▶ フィジカルAI向け半導体企業SiMa.aiが9月28日、シリーズCで1億5000万ドルを調達し評価額14億5000万ドルに達したと発表した。企業自身が語る市場規模の数字の不一致、2028年投入予定の次世代チップがNVIDIA現行製品の半分の性能にとどまる事実、「性能ではなく電力とコスト」という差別化戦略を会計士の視点で検証する。

「50兆ドル市場」と「32.4兆ドル市場」、どちらが正しいのか

9月28日、フィジカルAI向けの半導体を手がけるSiMa.aiが、シリーズCで1億5000万ドルを調達し、評価額14億5000万ドルに達したと発表した。Fidelity Management & Research CompanyとAmplifyが共同主導し、Dell Technologies CapitalやPoint72など複数の投資家が参加している。累計調達額は5億ドルに達し、2025年7月のシリーズB時点での評価額9億6000万ドルから、1年強でおよそ51%の上昇となった。会計士として目を引かれたのは、評価額の推移そのものよりも、同社が掲げる「市場規模」の表現に見られる、ちょっとした不整合だった。

CEOが語る市場規模、報道によって数字が違う

創業者兼CEOのクリシュナ・ランガサイー氏は、ヒューマノイド・自動車・ドローンにおけるフィジカルAIを「これまで現代のイノベーションにほとんど手つかずのまま残されてきた50兆ドル市場への入り口だ」と表現している。ところが、別の報道では同じ文脈で「32兆4000億ドル市場」という数字が使われている。どちらも第三者機関による独立した市場調査の裏付けが明示されているわけではなく、企業側が自ら掲げる将来市場の規模感だという点は踏まえておきたい。この種の「兆ドル単位」の市場規模予測は、スタートアップの資金調達において投資家の期待値を高める効果を持つ一方、その算出根拠が曖昧なまま一人歩きしやすいという特徴がある。数字の桁が違う2つの表現が併存していること自体が、この種の市場規模予測の性質をよく表している。

技術的な立ち位置——「性能」ではなく「電力とコスト」で勝負

SiMa.aiが提供するのは、ロボットや自動運転車、ドローンといった物理デバイス上でAIモデルを直接動かすための、専用シリコンとソフトウェアを組み合わせたフルスタック・プラットフォームだ。今回調達した資金は、開発環境「Palette Neat」の拡張と、次世代のシステムオンチップ「Modalix」の開発に充てられるという。会計的な観点で興味深いのが、この次世代チップの性能目標だ。SiMa.aiは2028年前半の投入を目指す新チップで、1000TOPS(テラ演算毎秒)という性能を掲げている。一方、NVIDIAのJetson AGX Thorは、現時点ですでに2000FP4TOPSを実現しているとされる。つまりSiMa.aiが2年後に投入を目指す次世代チップでも、NVIDIAの現行製品の半分の演算性能にとどまる計算になる。同社はこの点を認識したうえで、「生の演算性能」ではなく「低消費電力・低コスト」という別の軸での差別化を明確に打ち出している。

上位5%という調達規模の意味

今回の1億5000万ドルという調達規模自体も、文脈を踏まえて評価する必要がある。ある分析は、この金額が「米国のエンタープライズソフトウェア分野のシリーズC調達の上位5%に位置する」と指摘している。ハードウェアとソフトウェアを組み合わせたフィジカルAI企業が、純粋なソフトウェア企業と並べて評価されるほどの資金調達規模に達している、という事実は、投資家のこの分野への期待の高さを示す一つの指標だ。Counterpoint Researchの予測として、ロボティクス・自動車・ドローンを合わせたフィジカルAIデバイスの累計出荷台数が2035年までに1億4500万台に達するという数字も紹介されており、この予測が今回の資金調達の裏付け材料の一つになっている。

NVIDIA依存からの脱却という賭け

今回の調達が示すもう一つの意味は、「すべてのAIワークロードがNVIDIAのGPU上で動くわけではない」という賭けに、投資家が資金を投じ続けているという事実だ。データセンター向けの学習・推論とは異なり、ロボットやドローンといったエッジデバイス上でのAI実行には、消費電力や熱設計、コストといった制約が強く効いてくる。この領域では、NVIDIAの汎用GPUアーキテクチャが必ずしも最適解とは限らない、という見立てのもとで、SiMa.aiのような専用チップ企業への投資が続いている。

会計士として見ておきたいこと

「50兆ドル」対「32兆4000億ドル」という市場規模表現の不一致は些細に見えるかもしれないが、この種のスタートアップの資金調達story(ストーリー)が、しばしば検証困難な将来予測の上に組み立てられていることを象徴している。2028年投入予定の次世代チップが、投入時点でもNVIDIAの現行製品の性能に届かないという事実は、この会社が「性能で勝つ」のではなく「ニッチな電力・コスト要件で勝つ」という、より地味だが堅実な戦略を取っていることの裏返しでもある。今後、Modalixの開発が計画通り進むか、そして実際の受注実績がどこまで積み上がるかを、次の資金調達ラウンドまでに注視しておきたい。

SiMa.aiフィジカルAI半導体資金調達NVIDIA
広 告300 × 250