是什麼
AI 幻覺指大模型生成了看似合理、表述篤定,實際卻與事實不符的內容。它的典型形態不是胡言亂語,恰恰相反——是格式完美的假東西:一篇作者、期刊、年份、頁碼俱全卻不存在的論文;一條編號規整卻查無此文的法規;一段流暢自然卻被張冠李戴的人物經歷。正因為它長得像真的,才比明顯的錯誤更危險。
成因要從生成機制說起。大模型本質上是在給定上下文後預測下一個 token 的機率分佈,再按分佈取樣。它不維護一張「已知事實表」,也沒有內建的「這題我不會」開關。當訓練語料裡關於某個問題的資訊稀疏或缺失時,模型並不會因此停下,它依然會挑出最流暢的續寫——而最流暢的續寫,常常就是一個符合模式的虛構答案。
為什麼重要
OpenAI 在 2025 年 9 月發表的研究《Why language models hallucinate》給出了一個容易被忽略的解釋角度:幻覺之所以頑固,很大程度上是評測方式造成的。該文由 Adam Kalai、Ofir Nachum、Santosh Vempala 和 Edwin Zhang 撰寫,論點是主流基準幾乎都按答對率計分——模型蒙一個還有機會得分,回答「不確定」則一定是零分。於是整個訓練與評測鏈條長期在獎勵猜測、懲罰承認無知。作者據此提出,單獨再加幾個「幻覺專項評測」作用有限,真正需要改的是那些主導排行榜的準確率型基準的計分方式。
文中還有一個技術性判斷值得記住:生成比分類更難。一個模型也許能正確判斷某句陳述是真是假,但讓它直接生成答案時,仍不可避免地產生錯誤——判斷題和填空題不是同一個難度。
對使用者來說,實際含義很直接:幻覺不是某個廠商的質量缺陷,而是當前技術路線的結構性副產品。在法律、醫療、財務、學術引用這些「錯一處就廢掉整篇」的場景裡,把模型輸出當初稿、把核驗當必需步驟,是目前唯一穩妥的用法。
在 AI 產業鏈中的位置
幻覺位於模型層,但它的後果和緩解方案分佈在整條鏈上。模型層通過訓練資料清洗、對齊目標調整、置信度校準來降低發生率;基礎設施層通過檢索增強生成把外部知識接進上下文,讓模型「看著資料答」;應用層則用引用溯源、多模型交叉驗證、人工稽核環節兜底。圍繞這一問題還長出了一批獨立供給:事實核驗服務、企業知識庫治理、Agent 輸出審計工具。
RAG 與推理模型能做到什麼
RAG 的作用是把問題從「你記得嗎」換成「照這份材料回答」。它確實顯著降低了編造率,尤其在企業內部知識、產品文件這類封閉域裡。但它引入了新的失敗點:檢索沒命中、檢索命中了錯誤文件、文件本身過時、模型在壓縮長材料時把兩條事實拼錯。所以帶連結的引用溯源比單純上 RAG 更重要——能點開核對,才是真的可控。
推理模型通過更長的思考過程來提高一致性,對需要多步計算、邏輯推演的題目幫助明顯。但它對純事實性空白幫助有限:模型不知道某人的生日,推理再久也推不出來,反而可能構造出一條看起來很有道理的推導鏈,把錯誤答案包裝得更可信。
普通使用者的核驗習慣
值得固化成肌肉記憶的有三條。第一,凡涉及具體數字、日期、人名、引文、條款,一律回一手來源點開確認,不要因為格式規整就相信。第二,優先要求模型給出可點選的連結,並真的去點——編造的連結通常打不開或指向不相關頁面。第三,把同一個問題換個問法再問一遍,前後不一致的地方就是最該核的地方。
反過來,也有幾類任務幻覺風險天然較低:改寫、翻譯、摘要、格式轉換、程式碼重構——這些任務的素材就在上下文裡,模型不需要從記憶裡取事實。把高風險問法轉成低風險問法(先自己提供材料,再讓模型加工),本身就是一種有效的降幻覺技巧。