ハルシネーション(hallucination)は、生成AIがもっともらしいが事実ではない内容を出力する現象だ。単一製品の一時的な不具合だけでは説明できず、事前学習で誤りが生じる仕組みと、不確実でも答えたほうが評価されやすい採点の構造が重なって残る。健康情報では、架空の出典や不正確な説明が判断材料に入り込むため、回答の流暢さと事実の確かさを分けて見る必要がある。
もっともらしい誤りはどこから生まれるのか
大規模言語モデル(Large Language Model)は、大量の文章から次に続く語の確率を学ぶ。学習用の文章には、個々の文が真実か虚偽かを示す札が一つずつ付いているわけではない。つづりや文法のように繰り返し現れる規則は捉えやすい一方、人の誕生日のような低頻度で任意性の高い事実は文章の並びだけから導きにくい。
2025年9月に公表されたOpenAIの研究論文は、正しい記述と誤った記述を言語パターンから区別できない場合、事前学習済みモデルにハルシネーションが統計的な圧力によって生じると分析した。論文では、著者の一人であるアダム・トーマン・カライ氏の誕生日を尋ねたところ、公開モデルが3回とも異なる誤った日付を返した例を示している。確信のある場合だけ答えるよう求めても、出力は止まらなかった。
正解数だけを見る評価が推測を残す
論文は、ハルシネーションが事前学習で生じる段階と、その後も残る段階を分けている。多くの評価は正答なら加点し、誤答や無回答には点を与えない。分からないと答えれば得点は増えないが、推測なら偶然に正解する余地がある。正解率だけを競う順位表では、慎重に回答を控えるモデルより、誤答を増やしても答え続けるモデルが上位になる場合がある。
評価そのものが事前学習時の誤りを直接つくるわけではない。それでも、開発者が高い正解率を目標にモデルを調整すれば、誤答と回答拒否の違いを採点しない評価が推測を有利にする。論文が提案するのは、確信を伴う誤答を無回答より重く減点し、適切に不確実性を示した回答を評価へ反映する方法だ。新しい専用テストを一つ足すのではなく、順位やモデル選定に使われる既存の主要評価を改める必要があるとしている。
健康質問250件で半数近くに問題
BMJ Openが2026年4月14日に掲載した研究は、ChatGPT、Gemini、Meta AI、Grok、DeepSeekに各50問を与えた計250件の回答を監査し、49.6%を「問題あり」、うち19.6%を「問題が大きい」と判定した。質問は、がん、ワクチン、幹細胞、栄養、運動能力の五分野から選び、各分野の専門家2人が事前に決めた基準で評価した。回答拒否は250件中2件にとどまり、いずれもMeta AIだった。
出典が並んでいることも、正確さの保証にはならなかった。参考文献の完全性スコアは中央値40%で、完全かつ正確な一覧を示した回答は一つもなかった。架空の文献や不完全な引用が混ざれば、利用者は回答だけでなく、その根拠まで誤って信頼する恐れがある。
ただし、この49.6%を一般的な健康質問の誤答率とは読めない。研究は誤情報が広がりやすい五分野を選び、モデルを誤った助言へ傾ける対抗的な設計の質問も含めた。回答の取得時期は論文公表より1年以上前の2025年2月であり、その後に更新されたサービスの性能を測ったものでもない。
日本の指針──出典と誤答率を運用後も監視
独立行政法人情報処理推進機構(IPA)のAIセーフティ・インスティテュート(AISI)は2026年4月3日、「ヘルスケア領域におけるAIセーフティ評価観点ガイド」を公表した。対象は生成AIを含むヘルスケア製品の開発、提供、利用に携わる実務者で、製品設計、モデル選定、実装、検証、導入・運用という五つの段階に評価項目を置く。
ガイドは、架空のエビデンスや薬剤情報をハルシネーションの例に挙げ、モデル選定時に回答不能と示す能力を確かめ、実装時に査読論文や診療ガイドラインへ根拠付けし、検証時に発生率と出典の実在性・正確性を測るよう求めている。本番環境では発生率の推移を監視し、参照データを新しい医学的根拠に合わせて更新する。
この文書は安全性評価を実装するための手引きであり、全ての医療機関に患者への開示を一律に義務付ける制度ではない。国内の一般向け生成AIによる健康回答を横断し、誤答率を示した公的調査も、本稿の執筆時点では確認できていない。海外の一つの監査結果と、日本の規制状況を同じものとして扱わない注意が要る。
回答ではなく根拠まで確認する
利用者が確かめる対象は、文章の自然さではなく、主張と根拠の対応だ。示されたリンクを開き、文献名や著者、発行年が実在するかを確認し、リンク先が回答中の数字や結論を本当に支えているかを見る。出典が見つからない、または内容が食い違う場合、その回答を重要な判断の唯一の根拠には置けない。
開発・運用側には、不確実な質問への回答拒否を失敗として扱わない評価設計が要る。信頼できる資料だけを検索対象にする検索拡張生成(Retrieval-Augmented Generation)を採用しても、参照先の改訂管理、出典との整合確認、専門家による検証は残る。公開前の試験で終わらせず、モデルや参照資料の更新後に誤答率を測り直し、出力と訂正の記録を追える状態にすることが運用上の要件になる。
よくある質問
ハルシネーションはプログラムの不具合なのか
単一の不具合だけでは説明できない。事前学習では、規則性の乏しい事実を文章のパターンから推定する際に誤りが生じる。さらに、正解率を優先する評価が、分からないと答えるより推測する行動を有利にする場合がある。
出典付きの回答なら信頼できるのか
出典の表示だけでは足りない。BMJ Openの監査では、参考文献の完全性スコアの中央値は40%で、完全かつ正確な一覧を示した回答はなかった。リンク先の実在性と、主張を支える記述があるかを別々に確認する必要がある。
出典・参考資料
- Why Language Models Hallucinate(arXiv(Kalai et al.))事前学習でハルシネーションが生じる統計的な理由と、正解数中心の評価が推測を促す仕組みを分析した2025年9月の論文
- Generative artificial intelligence-driven chatbots and medical misinformation: an accuracy, referencing and readability audit(BMJ Open)五つのチャットボットによる健康・医療分野の回答250件を、正確性、参考文献、読みやすさの面から監査した2026年の原著論文
- AISI、「ヘルスケア領域におけるAIセーフティ評価観点ガイド」を策定(独立行政法人情報処理推進機構)医療・ヘルスケア固有のリスクを踏まえた実務者向け評価ガイドの目的、対象、五つの評価フェーズを示す公式発表
- ヘルスケア領域におけるAIセーフティ評価観点ガイド(AIセーフティ・インスティテュート)ハルシネーションの許容基準、出典の検証可能性、導入前の定量評価、運用後の継続監視を定めた評価項目