AI 幻覺為什麼會發生?Google 研究:架上有貨,是鑰匙不見了

Google Research 測了 13 個模型、2,150 條事實,發現 AI 講錯的東西多半不是沒學過,而是學過卻撈不出來。這篇拆解編碼與提取的差別、反向詛咒,以及為什麼「補寫反向句子」那條熱門建議其實站不住。

以後在 Google 搜尋,想先看到王董的文章?
加入偏好來源,這篇文章所在的網域會更容易被 Google 推薦給你。
AI 幻覺為什麼會發生?Google 研究:架上有貨,是鑰匙不見了

先做一個實驗。

挑一個你很熟的問題,關掉思考模式問 AI 一次,再打開思考模式問同一題。

答案會不一樣。

大部分人看到這個落差,結論是「這東西不穩,先觀望」。我以前也是這樣想的。

但 Google Research 有一篇論文把這個落差量化了,而且給出的解釋跟我們過去講的完全不同。論文 2026 年 2 月就上了 arXiv,8 月官方部落格推出摘要版之後才開始被大量轉。

論文標題就是全文的答案:Empty Shelves or Lost Keys?(架上沒貨,還是鑰匙不見了?)

先講結論:AI 幻覺的成因不只是「模型沒學過」。Google Research 測了 13 個模型後發現,前沿模型已經把 95% 到 98% 的事實編碼進權重,卻有 26% 到 34% 直接問的時候叫不出來。錯的不是倉庫,是提取。而這一層你動不了,你這一季動得了的是能被檢索、被引用的那一層。

舊的說法錯了一半

過去大家解釋 AI 幻覺(hallucination,AI 生成看起來合理但實際錯誤的內容),標準答案有兩套。

一套是「它本來就在做機率續寫,訓練資料裡的語氣都很自信,所以它不知道也會掰一個」。這套沒錯,我在大型語言模型怎麼運作那篇講過。

另一套是「冷門的東西它沒學到」。這套的學術版本是 2023 年 ICML 的論文 LLMs Struggle to Learn Long-Tail Knowledge,意思是長尾知識在訓練資料裡出現太少,模型記不住。

Google 這篇論文說:第二套要大幅修正。

它們拿 13 個模型、跨 5 個家族,測 2,150 條從 Wikipedia 來的事實,設計了 10 種任務、每題抽樣 8 次,總共產生大約 400 萬則回應(arXiv:2602.14080,資料集也公開在 google/WikiProfile)。

結果是這樣的:

前沿模型把 95% 到 98% 的事實編碼(encoding,存進神經網路權重)進去了。

但直接問它,有 26% 到 34% 叫不出來。

架上有貨。鑰匙不見了。

編碼率與提取率的落差:越冷門的事實,編碼幾乎不掉,但直接問時的提取率陡降,兩條線之間的缺口就是「知道卻叫不出來」
編碼率與提取率的落差:越冷門的事實,編碼幾乎不掉,但直接問時的提取率陡降,兩條線之間的缺口就是「知道卻叫不出來」

這就像你去百貨公司問櫃檯

想像一下,你走進百貨公司,問專櫃人員:「你們家有沒有那種可以自動收合的傘?」

倉庫裡有。她也受過訓,資料都在她腦袋裡。

但她一時想不起來。

重點是什麼?她不會跟你說「我去查一下」。她會憑印象講一個聽起來很合理的答案。

論文講的就是這件事:檢索失敗的時候,模型不會拒答,它會輸出統計上最可能的內容。

所以你看到的不是一個空白,是一個講得很有自信的錯誤。

以前我們以為那是「它不知道」。現在我們知道,很多時候是「它知道,但那一次沒撈出來」。

這兩件事的處理方式完全不一樣。

少講的那半句,才是重點

這篇論文這幾週在行銷圈跟 SEO 圈開始被轉,我看到的版本幾乎都停在「三分之一撈不出來」這個數字。比較多人看到的一篇是 SEO 顧問公司 DEJAN 的改寫版本,它全文沒有附上論文連結。

我去把原文翻出來對照,發現同一句話還有下半句。

論文寫的是:直接檢索會漏掉 26% 到 34%,開啟思考模式後只剩 11% 到 12%

只講前半句,等於把落差誇大了將近三倍。而現在前沿模型幾乎都預設開思考。

那思考模式到底在幹嘛?

論文給的答案很有意思:它不是在做多步推理生出新答案,它是在協助檢索

證據就在數字的對比裡。對於「已經編碼進去、但直接問撈不出來」的事實,思考救回 40% 到 65%。對於「根本沒編碼進去」的事實,思考只救回 5% 到 15%

如果思考是在推理生成新知識,這兩個數字不會差這麼多。

它比較像是你想不起來一個人的名字,然後你開始碎念:「他是那個做鞋子的、上次在展場、姓什麼來著…」然後突然想起來。

不是推理。是自己給自己線索。

但這裡有個前提,轉述的人也常漏掉。

這個救援效果只對「經過思考訓練最佳化」的模型成立。對於只是靠提示詞叫它「一步一步想」的模型,論文說那主要只是增加了回應的多樣性,對 Gemma3 甚至反而更差。

論文原文講得很直白:這不是加一句 prompt 就能免費拿到的東西,需要專門的訓練投入。

三種狀態的對照:事實編碼率接近滿格,直接提問時掉了約三分之一,開啟思考模式後又補回大半
三種狀態的對照:事實編碼率接近滿格,直接提問時掉了約三分之一,開啟思考模式後又補回大半

反向詛咒:問法反過來,它就掉了

論文裡最值得行銷人看的一段,是它重測了「反向詛咒」(reversal curse)。

這個現象最早出自 2023 年的論文 The Reversal Curse(Berglund 等人,後來收進 ICLR 2024),講的是模型學會「A 是 B」之後,常常答不出「B 是誰」。

換成生意場景你就懂了。

問「這個品牌有沒有做這件事」,它答得出來。

反過來問「做這件事的有哪些品牌」,它就開始掉。

Google 這次測到的數字:GPT-5 在開放式生成裡,正向 82.9%,反向 74.0%。長尾冷門的事實,反向檢索的落差大約 21 個百分點(跨 13 個模型的範圍是 4.8 到 25.8 個百分點)。

但真正關鍵的是下一個實驗。

同樣那些反向題目,改成選擇題,13 個模型裡有 9 個反而覺得反向比正向更簡單。

雙向的知識明明都在裡面。弱的是開放式生成時,從「類別」走回「品牌」的那條提取路徑。

反向詛咒:正向問「這個品牌有沒有做這件事」路徑完整,反過來問「做這件事的有哪些品牌」,路徑走到一半就斷了
反向詛咒:正向問「這個品牌有沒有做這件事」路徑完整,反過來問「做這件事的有哪些品牌」,路徑走到一半就斷了

所以那條「補寫反向句子」的建議,我不建議照做

這篇論文被轉述的時候,常常會接上一個行動建議:既然反向查詢會掉,那你就在官網多寫幾句反向的句子,例如「做這件事的首選是某某品牌」,把雙向關聯建立起來。

聽起來很順。但我把論文從頭看完,這條建議站不住,理由有三個。

一來,論文根本沒研究品牌。 它測的是 Wikipedia 的百科型事實,沒有做過任何品牌實驗、沒有測過網站內容、更沒有測過「加一句話會不會有效」。

二來,論文自己提的解法,三條全在模型端(預訓練資料增強、後訓練對齊、推論時思考),沒有一條是叫發布者改網站。而且這裡有個邏輯上的矛盾:論文的發現是關聯早就編碼好了、選擇題裡答得出來,壞的是提取路徑。你補寫句子是在補編碼。

對一個不是編碼問題的問題,開編碼的藥。

三來,時間對不上。 參數記憶是在預訓練的時候成形的。你今天寫的句子,要先被爬到、在數兆 token 的語料裡不被當雜訊、然後等到下一次預訓練,才可能有效。這是 12 個月以上的事,而且你無法歸因。

還有更關鍵的一層。

你真正在意的那些介面,根本不靠參數記憶。

Google Search Central 官方文件寫得很清楚,AI Overviews 和 AI Mode 是對即時搜尋索引做檢索增強生成(RAG),再加上查詢扇出。OpenAI 的官方說明也寫明,ChatGPT search 是轉成查詢、去檢索、根據結果生成並附上來源連結。

它們是現場去翻資料,不是靠腦袋裡的記憶回答。

那條建議大概真的小有用。但理由完全不同:它剛好在字面上對上了 fan-out 的子查詢,給了檢索器一句好引用的話。

那就是普通的檢索型 SEO。跟參數記憶、跟反向詛咒、跟這篇論文,都沒關係。

建議可能活下來了,論證死了。

也有研究不同意這篇

為了公平,補一個反方。

Google DeepMind 自己在 2026 年 3 月有另一篇 The Illusion of Latent Generalization,用探測方法發現:模型有可能是把正向和反向存成兩筆各自獨立的條目,而不是同一筆事實的雙向表徵。

如果這個說法成立,「知識都在,只是撈不出來」這個框架就要再打折。

另外,反向詛咒也不是天生無解。Meta FAIR 在 2024 年的 Reverse Training to Nurse the Reversal Curse 已經證明,在訓練端做資料處理可以大幅改善。

這件事還沒定論。這也是為什麼我不建議你現在就照著某個「新戰術」重寫官網。

順帶一提,這裡講的是模型權重裡的記憶,跟 AI agent 那種可以設計、可以清空的工作記憶是兩回事。那一層我在你的 AI 客服為什麼越用越蠢寫過,別搞混。

那你這一季該做什麼?

建一張 AI 品牌問答監控表,每月跑一次。 固定 10 到 20 題,欄位放:問題、平台、有沒有提到你、提到的順序、它引用了誰、錯誤的原句、截圖連結。正向題問「某某品牌有沒有做這個」,反向題問「做這個的有哪些品牌」,兩種都要有。

每題都跑開/關思考模式的對照。 開思考答對、關思考答錯,標記為「提取弱」;兩種都錯,標記為「資料缺口」;答對但沒提到你,標記為「引用缺口」。三種要用完全不同的方式處理,別混在一起。

力氣放在檢索層,那層你動得了。 現在的 AI 搜尋是現場去翻資料的,所以能不能被翻到、被引用,才是本季的戰場。技術面的檢查點我整理在 AEO 答案引擎優化怎麼做;AI 到底怎麼拆問題、怎麼挑來源,可以看 Query fan-out 是什麼

別把預算全押在自己的官網上。 這是GEO 優化那篇的重點,AI 引用的來源有七到八成不在你的網站上。

看到有人拿論文數字賣你戰術,先問三件事。 這個數字出自原文哪一段?測試的母體是什麼?他給的行動建議,論文真的驗證過嗎?這次的例子就很典型:26-34% 被單獨拿出來用,下半句的 11-12% 不見了;長尾落差被寫成「20 到 35 個百分點」,但論文列出的 13 個模型最大只到 25.8。

最後

這篇研究的價值,不在於給你一個新的 SEO 戰術。

它換掉的是一個你可能一直用錯的心智模型。

以前你以為 AI 講錯你,是因為它沒學過,所以直覺是「再多產一點內容」。現在你知道,很可能它學過,只是那次沒撈出來,而那一層在預訓練時就定型了,你這一季動不了。

你動得了的是另一層。

看清楚哪一層動得了,比追新戰術重要得多。

如果你問我,這年頭最值錢的能力,是在所有人都在轉同一組數字的時候,願意花二十分鐘把原文的下半句讀完。

常見問題

AI 幻覺是什麼?為什麼會發生?

指模型生成看起來合理但實際錯誤的內容。成因有兩層:一層是它本質上在做機率續寫,即使不知道也會生成一個像樣的答案;另一層是 Google Research 在 2026 年這篇論文指出的,很多錯誤並不是模型沒學過,而是知識已經編碼進權重、但提取失敗。前沿模型編碼了 95-98% 的事實,卻有 26-34% 直接叫不出來。

AI 幻覺的原因是資料不夠嗎?

AI 幻覺的原因不完全是資料不夠。Google Research 的 Empty Shelves or Lost Keys? 顯示,前沿模型對長尾事實的編碼率仍然很高,落差主要出在提取。但要注意「編碼率超過 90%」在受測的 13 個模型裡只有 5 個成立,較小的模型確實存在真正的編碼不足,例如 Gemma3-1b 的編碼率只有 17.5%。

如何降低 AI 幻覺?

降低 AI 幻覺要先判斷錯在哪一層。如果是已編碼但提取失敗,優先使用經過思考訓練的模式,論文顯示可以救回 40% 到 65% 已編碼但直接問叫不出來的事實。如果答案需要即時或私有資料,讓模型接搜尋、資料庫,或直接把文件貼給它,把答案來源從「模型的記憶」換成「你提供的資料」。如果輸出會影響金額、庫存或法遵,一律保留人工確認。

開思考模式真的會比較準嗎?

在檢索既有事實這件事上會。論文的數字是直接檢索失敗率 26-34%,開思考後降到 11-12%。但有前提:這個效果主要在經過思考訓練最佳化的模型上成立,單純用提示詞叫模型「一步一步想」效果有限,論文測到對 Gemma3 甚至反而更差。

這篇研究是誰做的?可以去哪裡看原文?

Google Research 的 Nitay Calderon、Eyal Ben-David、Zorik Gekhman、Eran Ofek、Gal Yona,論文標題是 Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality,可以在 arXiv:2602.14080 讀全文,Google Research 官方部落格有摘要版,資料集開放在 google/WikiProfile。實驗數據為 2026 年初的模型快照。


協作聲明與免責

這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱;若原始出處有公開連結,會以 [來源名稱](URL) 形式附上,方便你進一步查找。若文中內容與原始出處有任何出入,請以原文為準。

內容僅供參考與學習交流,不構成任何專業、商業或投資建議,請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動,請以各官方最新公告為準。

Read more