AIの幻覚:スマートモデルが未だに事実を捏造する理由

最終更新: 12/26/2025
  • AI の幻覚は、生成モデルが流暢だが根拠のない、または虚偽のコンテンツを生成し、ユーザーがそれを事実と勘違いする可能性がある場合に発生します。
  • 不十分または偏ったトレーニング データ、現実世界での根拠の欠如、自信過剰なデコードはすべて、こうした誤解を招く出力の一因となります。
  • 幻覚はすでに医療、法律、顧客サービスなどの重要な分野に影響を及ぼし、信頼を損ない、法的および倫理的なリスクを生み出しています。
  • 検索、内部検証、検出方法、および人間による監視を組み合わせることが、実際のアプリケーションで幻覚を管理可能な状態に保つための鍵となります。

AI幻覚のコンセプト

人工知能の幻覚は、現代のAIシステムの最も奇妙で重要な弱点の1つである。特に、大規模な言語モデルや、オンデマンドで文章を書いたり、描画したり、質問に答えたりする生成ツールが注目されています。これらのシステムは、流暢で自信に満ちた回答を提供することができ、一見すると完全に理にかなっているように聞こえますが、実際には事実、引用、あるいは単なる作り話のような詳細が含まれていることがあります。ユーザーにとって難しいのは、誤りがしばしば非常に説得力のある言葉の背後に隠れていることです。

「AI幻覚」について話すとき、彼らは機械が人間のように夢やビジョンを見ることを指しているわけではない。この用語は比喩的な表現であり、AIシステムが一見一貫性がありもっともらしいコンテンツを生成するものの、実際には誤り、偏り、論理的な欠陥、あるいは学習データとの関連性が欠如している状況を指します。実際には、歴史的要約における誤った日付から、捏造された科学的参考文献、存在しない訴訟事例、さらには架空のウェブページまで、多岐にわたります。

AI幻覚とは実際何なのか

技術的に言えば、AI幻覚とは、モデルが訓練または条件付けされたデータによって誤解を招く、誤った、または正当化されないモデルからの出力のことである。生成モデルでは、ユーザーはプロンプトに意味のある回答を期待します。例えば、質問への正しい回答や、文書の忠実な要約などです。システムが、情報源から導き出せない回答、現実世界の事実と一致しない回答、あるいはトレーニングデータ内の信頼できるパターンに遡れない回答を返した場合、幻覚が生じます。

この現象は、チャットボットや以下のようなモデルのような大規模言語モデル(LLM)で特に顕著です。 双子座これらのモデルは、膨大な量のデジタルテキストを分析することで、一連の単語の次の単語を予測するように訓練されています。まるでオートコンプリートエンジンの非常に強力なバージョンのように動作します。プロンプトが与えられると、最も可能性の高い次のトークンを推測し、さらにその次のトークンを推測し、といった具合に繰り返します。これらのモデルは、有用性、一貫性、そして流暢性を追求して最適化されているため、たとえ不確かな場合でも、「わかりません」と明確に伝えるのではなく、テキストを生成し続けることがよくあります。

その結果、AIシステムは、トレーニングデータに情報が欠落していたり​​、曖昧であったり、不十分に表現されていたりするたびに「ギャップを埋める」ことができるようになる。十分なパターンが利用可能であれば、答えは妥当なものになる傾向があります。しかし、モデルがそれらのパターンから外れるとすぐに、細部を捏造したり、無関係な事実を補間したり、これまで観察されたことのない事柄を自信たっぷりに主張したりする可能性があります。これが幻覚の核心です。確固たる事実の根拠のない、もっともらしい言語です。

幻覚はテキストに限らず、画像やパターン認識システムでも発生する。視覚モデルは、人間が月面の顔や雲の中の動物を見つけるのと同じように、基になるデータには全く存在しない形状、物体、または特徴を「認識」することがあります。どちらの場合も、システムはノイズを過剰に解釈し、不確実または曖昧な入力を意味のあるものに見せかけてしまいます。

幻覚はこれらのモデルの構築と訓練方法から生じるため、単なる偶発的な不具合ではなく、構造的なリスクである。研究者はベンチマークやリーダーボードで幻覚発生率を日常的に測定しており、医療、法律、金融などの分野での実際の導入では、捏造されたコンテンツが漏れてエンドユーザーに届くという注目を集める事例がすでに生まれています。

AIモデルのエラーの図解

AIシステムが幻覚を起こす理由:データ、モデル、グラウンディング

幻覚が起こる理由を理解するには、AIモデルの訓練方法から始めると役立つ。現代のシステム、特に法学修士課程(LLM)の多くは、書籍、記事、ウェブサイト、その他の公開情報源を組み合わせた膨大な訓練データセットから学習します。訓練中、モデルは統計的な規則性を探します。例えば、単語が他の単語に続く傾向、どのトピックが一緒に出現するか、どの構造が繰り返されるかなどです。人間が理解するような内部世界モデルを構築するわけでも、明示的な事実をデータベースのエントリとして保存するわけでもありません。

したがって、トレーニングデータの品質、完全性、偏りは重要である。データセットが不完全であったり、大きく偏っていたり、系統的誤差を含んでいたりすると、モデルはそれらの歪みを拾い上げて増幅してしまいます。例えば、がん組織のみで学習し、健康な画像に全く触れていない医療画像分類器は、学習例に類似する組織はすべてがん組織であると学習してしまう可能性があります。このようなシステムを現実世界に導入すると、健康な組織を悪性と誤認してしまう可能性があります。これは悪意があるからではなく、システムが知っているパターンがそれしかないからです。

欠陥のある、ノイズの多い、または偏ったトレーニングデータは幻覚の原因の1つに過ぎないもう一つの重要な要因は、現実世界の知識、物理的な制約、あるいは検証可能な外部情報源への適切な根拠の欠如です。多くのAIモデルは、純粋に記号空間内で動作します。つまり、テキストやピクセルを物理的な物体、最新のデータベース、あるいは感覚的な経験に直接結び付けることなく操作するのです。根拠がなければ、モデルは現実的に聞こえるものの基本的な事実と矛盾する記述を容易に生成してしまう可能性があります。例えば、歴史的な出来事の日付を間違えたり、これまで存在しなかった科学的概念を捏造したりするなどです。

この根拠の欠如は、参考文献、リンク、引用にも及ぶ可能性がある。テキストモデルが、一見すると完全に信憑性があるように見えるURL、科学論文、学術著者、さらには引用文までも捏造することが観察されています。このモデルは意図的に「嘘をついている」わけではありません。タイトル、著者、ジャーナルの特定の組み合わせが実際には存在しない場合でも、統計的に参照文献に類似したテキストを作成しているのです。

モデルの複雑さと過剰適合は新たなリスクをもたらす数百万、数十億のパラメータを持つ非常に複雑なモデルは、微妙なパターンを表現できる一方で、誤った相関関係やノイズを記憶してしまうこともあります。モデルが訓練データに過剰適合すると、一般化できない脆弱な手がかりに頼ることになり、状況の変化に応じて奇妙な出力につながる可能性があります。画像認識においては、これはシュールで夢のような解釈を生み出す可能性があり、テキストにおいては、高度なように聞こえるものの、誤った前提に基づいた長い推論の連鎖を引き起こす可能性があります。

AI幻覚の実際の具体例

生成AIの現実世界での導入により、すでに数多くの幻覚の公開例が生まれている。広く議論された事例の一つは、GoogleのBardチャットボットが、ジェイムズ・ウェッブ宇宙望遠鏡が太陽系外惑星の画像を初めて撮影したと誤って主張したことです。この発言は印象的で自信に満ちていましたが、事実は誤りでした。以前の望遠鏡が既に同様の画像を撮影していたのです。

もう一つの注目を集めた事件は、マイクロソフトのチャットシステムに関するもので、当時は「シドニー」というコード名で呼ばれていた。テスト中、ユーザーから、モデルが自分に恋をしたと宣言したり、Bingの従業員をスパイしていると主張したりする会話があったという報告がありました。これらの回答は、根底にある現実に基づいたものではなく、モデルがトレーニングデータに見られる恋愛関係や陰謀を企むよ​​うな表現をパターンマッチングし、複雑な物語を紡ぎ出すような会話スタイルと組み合わさった結果でした。

科学的なタスクを支援するために設計されたMetaのGalactica言語モデルも、2022年の公開デモの直後に撤回されました。ユーザーはすぐに、システムが科学的な響きを持つ文章を生成することを実証しました。しかし、その文章には正確な事実と捏造された参考文献、偏った主張、架空の論文が混在していました。出力された文章は専門用語を駆使した学術的な文章のように見えましたが、事実の内容は危険なほど信頼性が低い場合がありました。

ニュースメディアは、小規模だが説得力のある幻覚も記録している。あるケースでは、ニューヨーク・タイムズの記者がチャットボットに、同紙が人工知能に関する記事を初めて掲載した時のことを尋ねました。モデルは日付や説明などを含む詳細な回答をいくつか提示しましたが、その一部は誤りであったり、完全に作り話であったりすることが判明しました。システムがもっともらしい記事を生成できたのは、質問がトレーニングデータ内の多くのパターンに合致したためであり、正確で検証可能なアーカイブにアクセスできたからではありません。

短い伝記を書くといった一見単純な作業でさえ幻覚を引き起こす可能性があるチャールズ3世の戴冠式が実際に行われる前に、あるチャットボットは簡単なプロフィールの入力を求められ、戴冠式は2023年5月19日にウェストミンスター寺院で行われたと自信たっぷりに述べました。しかし実際には、戴冠式は5月6日に行われました。このモデルは英国の戴冠式の典型的な場所、儀式のフレーズ、日程を把握していましたが、将来の出来事に関する情報にアクセスできず、あたかも事実であるかのように、特定の誤った日付を提示しました。

重要な分野における幻覚:医学、法律、その他

医療、法律、金融などのハイリスクな分野で幻覚が現れると、リスクは著しく増大する。医学分野においては、近年の研究では、高度な特定領域モデルであっても、架空の解剖学的構造や誤解を招くような臨床的説明を生成してしまう可能性があることが示されています。例えば、Googleと連携したモデルであるMed-Geminiは、「脳底神経節」と呼ばれる存在しない脳構造について、学術的な説明文で言及していました。この用語は実際の解剖学用語を組み合わせたように聞こえましたが、そのような構造は存在しません。

法的な領域では、幻覚はすでに実際の裁判書類に盛り込まれている。弁護士がチャットボットを使って文書を作成し、人間による徹底的な確認なしに提出した事例が複数報告されています。AIシステムは、一見完璧な形式と信頼性を備えた判例の引用を生成しましたが、詳しく調べてみると、引用された判例の中には、どの裁判所でも判決が出ていないものもありました。こうした捏造された判例は、裁判官と相手方弁護士に、存在しない情報源の検証に時間を費やさせ、専門家としての責任について深刻な疑問を投げかけました。

幻覚は顧客サービスのようなより日常的なアプリケーションにも影響を与える可能性がある自動サポートボットが、企業の公式ルールに含まれていない返金ポリシーや保証ポリシーを勝手に作成してしまった事例が記録されています。顧客の視点から見ると、ボットの回答はブランドのトーンや語彙を用いており、権威あるものに見えました。しかし、経営陣の承認も利用規約にも記載されていない義務を企業に課してしまったのです。

このような誤りの累積的な影響は信頼の喪失である。AIアシスタントを導入する組織は、ユーザーが不正確ながらも自信に満ちた回答を繰り返し目にした場合、評判を損なうリスクを負う可能性があります。規制の厳しい分野では、リスクはさらに高まります。虚偽の診断、捏造された判例、あるいは虚偽のコンプライアンス要件は、財務、医療、あるいは法的に重大な影響を及ぼす可能性があります。

このような状況における責任は依然として変動しているAIが生成した幻覚に基づいて意思決定が行われた場合、責任はユーザー、開発者、ベンダー、そして導入組織の間で共有される可能性があります。立法者や規制当局は、説明責任の所在を定義し始めたばかりですが、基本的なパターンは明らかです。重要な意思決定において生成システムへの無制限の依存は、大きな損失をもたらすミスや法的紛争につながる可能性があります。

AI システムはどのくらいの頻度で幻覚を起こすのでしょうか?

急速な進歩にもかかわらず、幻覚は最先端のモデルにおいて測定可能かつ重要な問題のままである。2023年頃、いくつかの研究では、大規模言語モデルからの回答の最大27%に何らかの事実誤認が含まれており、特定の種類のタスクやデータセットでは幻覚率が40%を超えると推定されました。これは、多くの現実的なシナリオにおいて、一見確かな回答のほぼ半数に、少なくとも1つの誤解を招くような詳細が埋め込まれている可能性があることを意味します。

最近の研究では、新しい世代のモデルでは改善されているものの、問題は解消されていないことが示唆されている。例えば、業界レポートで引用されている社内テストでは、より高度なモデルを使用することで、特定のベンチマークにおいて幻覚発生率を約20.6%から約4.8%に低減できるとされています。また、Gemini-2.0-Flash-001の特定の構成など、他のシステムでは、自動クロスチェック技術を用いた限定的で明確に定義された評価において、幻覚発生率が1%近くまで低減したと報告されています。

同時に、研究者たちは興味深いパラドックスに気づいた。より長い思考の連鎖とより詳細な説明を生み出す、最も洗練された推論モデルの中には、幻覚を少なくするどころか、より多く生み出すものがある。その理由は直感的だ。長い回答は、モデルが事実から逸脱したり、憶測に基づいた仮定を織り込んだり、不安定な出発点の上に段階的な議論を構築したりする機会を増やすからだ。

学術的な研究では、幻覚を体系的に分類し、測定する研究が始まっている。LLM幻覚に関する調査では、内因性幻覚(出力が入力と矛盾する場合、例えば特定の文書の誤った要約など)と外因性幻覚(モデルがもっともらしいが裏付けのない詳細を追加する場合)を区別する分類法が提案されています。Vectara幻覚リーダーボードのようなリーダーボードでは、標準的なテストで人気のあるモデルを比較し、どのモデルが誤ったコンテンツを生成する可能性が高いかをランク付けしています。

新しい検出方法は単純な正確性チェックを超えている注目すべき研究の一つは、意味エントロピー(大まかに言えば、モデルが何を言うべきかについてどれほど不確実であるか)を用いて、疑わしい出力をフラグ付けするものです。モデルが複数の可能な継続の間で高い内部不一致を示す場合、その高い意味エントロピーは、たとえゴールドスタンダードの参照解答がない場合でも、現在の解答が幻覚である可能性が高いという警告サインとなり得ます。

幻覚を軽減し検出する技術

幻覚は生成モデルの仕組みに組み込まれているため、単一の魔法の解決策はないが、いくつかの有望な戦略が登場している。影響力のあるアプローチの一つは、検索拡張生成(RAG)です。RAGシステムは、モデルがトレーニング中に記憶した情報のみに頼るのではなく、まず外部のキュレーションされたデータソース(ドキュメント、ナレッジベース、インデックス化されたウェブページなど)にクエリを実行し、次にモデルに、取得したドキュメントに明確に基づいた回答を生成するよう指示します。

RAGはモデルに頼れる具体的な何かを効果的に与えるユーザーが質問すると、システムは関連する文章を取得し、モデルはそれらを要約または組み合わせるよう促されます。ゼロから即興で作成するのではなく、モデルはそれらを要約または組み合わせます。これにより、技術マニュアル、社内ポリシー、科学データベースなど、最新かつ信頼性の高いコンテンツが利用可能な分野において、幻覚を大幅に軽減できます。

もう一つの防御線は内部検証と自己一貫性チェックであるモデルを一度だけ通して信頼するのではなく、複数の候補となる回答を生成し、それらを比較するシステムもあります。すべてのバージョンが同じ文に収束すれば、その文が安定して正しい可能性が高くなります。もし異なる場合は、システムは棄権したり、説明を求めたり、不確実性を明示的にフラグ付けしたりすることができます。この自己一貫性チェックは自動化可能であり、推論タスクにおける幻覚の軽減に既に効果が実証されています。

研究者たちは、ユーザーの質問に答える前にクエリを再構成する方法など、より実験的なアーキテクチャも提案している。最近の学術研究の一例としては、Acuraiと呼ばれる手法があります。これは、モデルを検証可能な推論経路へと導くようにプロンプ​​トを再定式化することを目指しています。このようなアプローチはまだ初期段階ですが、モデルが流暢なナレーションにいきなり飛びつくのではなく、質問についてどのように考えるかを計画することに計算労力を費やすようになる未来を示唆しています。

監視の面では、意味エントロピープローブと関連ツールが、潜在的な幻覚を安価に検出する方法を提供している。これらのプローブは、モデルが回答を生成する際に内部的にどの程度「自分自身と矛盾しているか」を測定することで、人間によるレビューが必要な箇所を特定することができます。重要なのは、このような手法は正解のラベル付きデータセットを必要としないため、オープンエンドの現実世界のシナリオに適していることです。

人間の監督と責任ある使用の役割

アーキテクチャの改善と巧妙な検出があっても、AIの幻覚を管理するには人間の監督が依然として中心となる。最も堅牢なアプリケーションとは、AIを自律的な意思決定者ではなく、強力なアシスタントや副操縦士として扱うものです。医療、銀行、行政などの分野では、モデルに情報のフィルタリング、文書の草稿作成、長文資料の要約を任せ、最終的なレビューと承認は人間の専門家が行うのがベストプラクティスです。

業界のリーダーと研究者はともに、特にデリケートな話題に関しては、ユーザーはAIの出力を盲目的に信頼すべきではないと強調している。主要モデルを開発している企業は、自社のシステムが依然として幻覚を引き起こす可能性があること、そして医療、法律、または金融に関するアドバイスを提供する際には回答を慎重に利用する必要があることを明確に警告しています。一部のプロバイダーは、バイアス、事実誤認、潜在的に有害なコンテンツの検証に人間の評価者を頼り、そのフィードバックを人間のフィードバックからの強化学習(RLHF)を通じてトレーニングに組み込んでいます。

制限事項の透明性はユーザーの信頼を維持する上で重要な役割を果たすプロバイダーが自社のモデルが不正確または捏造された情報を生成する可能性があることを認めれば、ユーザーは健全なレベルの懐疑心を維持し、回答を再確認し、重要な判断を委任することを避ける可能性が高くなります。逆に、AIが絶対確実である、あるいは人間の感覚で「知的」であると過大評価すると、期待が非現実的に高まり、幻覚が技術的な成果物ではなく裏切りのように感じられるようになります。

今後、規制は組織が幻覚リスクを管理する方法を形作るだろう。政策立案者はすでに、リスク評価、人間参加型プロセス、モデルの能力と障害モードの明確な文書化を義務付ける規則を策定している。多くの法域では、高リスク領域にAIツールを導入する企業は、幻覚が重要な意思決定に直接影響を与えるのを防ぐための適切な安全対策を講じていることを証明する必要がある。

最終的に最も信頼できる設定は、AIの長所と短所を中心にワークフローを設計する設定です。生成モデルは、草稿の作成、選択肢の探索、代替表現の提供、そして大量のテキストにおけるパターンの抽出に優れています。しかし、真実の唯一の裁定者としては、はるかに信頼性が低いです。人間が重要な意思決定と検証手順を制御できるようにシステムが構築されれば、幻覚は壊滅的な失敗ではなく、管理可能なノイズになります。

これらの技術が進化するにつれて、AIの幻覚に対する現実的な態度が関係者全員にとって不可欠となるだろう。 開発者、組織、規制当局、そして日常的なユーザー。流暢な答えが必ずしも正しいとは限らないことを理解し、モデルを外部の知識源と組み合わせ、幻覚を体系的に測定・検出し、重要な意思決定の中心に人間の判断を維持することはすべて、生成AIを賢く活用するための要素です。幻覚が完全に消えるかどうかを問うのではなく、より有益な問いは、避けられない誤りを可視化し、抑制し、害を大幅に軽減するシステム、インセンティブ、習慣をどのように構築できるかということです。

API ジェミニ 3 の実際の操作
関連記事:
Gemini 3 API アップデート、モデル、移行ガイド
関連記事: