> ## Content Index
> Fetch the complete content index at: https://growthhackers.tw/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 幻覺為什麼會發生？Google 研究：架上有貨，是鑰匙不見了
- URL: https://growthhackers.tw/blog/ai-hallucination-parametric-recall-brand/
- Published: 2026-08-22T13:00:00.000Z
- Updated: 2026-08-22T13:00:00.000Z
- Description: Google Research 測了 13 個模型、2,150 條事實，發現 AI 講錯的東西多半不是沒學過，而是學過卻撈不出來。這篇拆解編碼與提取的差別、反向詛咒，以及為什麼「補寫反向句子」那條熱門建議其實站不住。
- Author: Lewis wang
- Tags: AI幻覺, AI搜尋, LLM, 品牌行銷, AEO

先做一個實驗。

挑一個你很熟的問題，關掉思考模式問 AI 一次，再打開思考模式問同一題。

答案會不一樣。

大部分人看到這個落差，結論是「這東西不穩，先觀望」。我以前也是這樣想的。

但 Google Research 有一篇論文把這個落差量化了，而且給出的解釋跟我們過去講的完全不同。論文 2026 年 2 月就上了 arXiv，8 月官方部落格推出摘要版之後才開始被大量轉。

論文標題就是全文的答案：[Empty Shelves or Lost Keys?](https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/?ref=growthhackers.tw)（架上沒貨，還是鑰匙不見了？）

**先講結論**：AI 幻覺的成因不只是「模型沒學過」。Google Research 測了 13 個模型後發現，前沿模型已經把 95% 到 98% 的事實編碼進權重，卻有 26% 到 34% 直接問的時候叫不出來。錯的不是倉庫，是提取。而這一層你動不了，你這一季動得了的是能被檢索、被引用的那一層。

## 舊的說法錯了一半

過去大家解釋 AI 幻覺（hallucination，AI 生成看起來合理但實際錯誤的內容），標準答案有兩套。

一套是「它本來就在做機率續寫，訓練資料裡的語氣都很自信，所以它不知道也會掰一個」。這套沒錯，我在[大型語言模型怎麼運作](https://growthhackers.tw/blog/llm-how-it-works/)那篇講過。

另一套是「冷門的東西它沒學到」。這套的學術版本是 2023 年 ICML 的論文 [LLMs Struggle to Learn Long-Tail Knowledge](https://arxiv.org/abs/2211.08411?ref=growthhackers.tw)，意思是長尾知識在訓練資料裡出現太少，模型記不住。

Google 這篇論文說：第二套要大幅修正。

它們拿 13 個模型、跨 5 個家族，測 2,150 條從 Wikipedia 來的事實，設計了 10 種任務、每題抽樣 8 次，總共產生大約 400 萬則回應（[arXiv:2602.14080](https://arxiv.org/abs/2602.14080?ref=growthhackers.tw)，資料集也公開在 [google/WikiProfile](https://huggingface.co/datasets/google/WikiProfile?ref=growthhackers.tw)）。

結果是這樣的：

前沿模型把 **95% 到 98%** 的事實編碼（encoding，存進神經網路權重）進去了。

但直接問它，有 **26% 到 34%** 叫不出來。

架上有貨。鑰匙不見了。

![編碼率與提取率的落差：越冷門的事實，編碼幾乎不掉，但直接問時的提取率陡降，兩條線之間的缺口就是「知道卻叫不出來」](https://growthhackers.tw/content/images/2026/08/inline-long-tail-gap-v1.png)

編碼率與提取率的落差：越冷門的事實，編碼幾乎不掉，但直接問時的提取率陡降，兩條線之間的缺口就是「知道卻叫不出來」

## 這就像你去百貨公司問櫃檯

想像一下，你走進百貨公司，問專櫃人員：「你們家有沒有那種可以自動收合的傘？」

倉庫裡有。她也受過訓，資料都在她腦袋裡。

但她一時想不起來。

重點是什麼？她不會跟你說「我去查一下」。她會憑印象講一個聽起來很合理的答案。

論文講的就是這件事：檢索失敗的時候，模型不會拒答，它會輸出統計上最可能的內容。

所以你看到的不是一個空白，是一個講得很有自信的錯誤。

以前我們以為那是「它不知道」。現在我們知道，很多時候是「它知道，但那一次沒撈出來」。

這兩件事的處理方式完全不一樣。

## 少講的那半句，才是重點

這篇論文這幾週在行銷圈跟 SEO 圈開始被轉，我看到的版本幾乎都停在「三分之一撈不出來」這個數字。比較多人看到的一篇是 SEO 顧問公司 DEJAN 的[改寫版本](https://dejan.ai/blog/parametric-memory-impacts-brands/?ref=growthhackers.tw)，它全文沒有附上論文連結。

我去把原文翻出來對照，發現同一句話還有下半句。

論文寫的是：直接檢索會漏掉 26% 到 34%，**開啟思考模式後只剩 11% 到 12%**。

只講前半句，等於把落差誇大了將近三倍。而現在前沿模型幾乎都預設開思考。

那思考模式到底在幹嘛？

論文給的答案很有意思：它不是在做多步推理生出新答案，它是在**協助檢索**。

證據就在數字的對比裡。對於「已經編碼進去、但直接問撈不出來」的事實，思考救回 **40% 到 65%**。對於「根本沒編碼進去」的事實，思考只救回 **5% 到 15%**。

如果思考是在推理生成新知識，這兩個數字不會差這麼多。

它比較像是你想不起來一個人的名字，然後你開始碎念：「他是那個做鞋子的、上次在展場、姓什麼來著…」然後突然想起來。

不是推理。是自己給自己線索。

**但這裡有個前提，轉述的人也常漏掉。**

這個救援效果只對「經過思考訓練最佳化」的模型成立。對於只是靠提示詞叫它「一步一步想」的模型，論文說那主要只是增加了回應的多樣性，對 Gemma3 甚至反而更差。

論文原文講得很直白：這不是加一句 prompt 就能免費拿到的東西，需要專門的訓練投入。

![三種狀態的對照：事實編碼率接近滿格，直接提問時掉了約三分之一，開啟思考模式後又補回大半](https://growthhackers.tw/content/images/2026/08/inline-encoding-vs-recall-v1.png)

三種狀態的對照：事實編碼率接近滿格，直接提問時掉了約三分之一，開啟思考模式後又補回大半

## 反向詛咒：問法反過來，它就掉了

論文裡最值得行銷人看的一段，是它重測了「反向詛咒」（reversal curse）。

這個現象最早出自 2023 年的論文 [The Reversal Curse](https://arxiv.org/abs/2309.12288?ref=growthhackers.tw)（Berglund 等人，後來收進 ICLR 2024），講的是模型學會「A 是 B」之後，常常答不出「B 是誰」。

換成生意場景你就懂了。

問「這個品牌有沒有做這件事」，它答得出來。

反過來問「做這件事的有哪些品牌」，它就開始掉。

Google 這次測到的數字：GPT-5 在開放式生成裡，正向 **82.9%**，反向 **74.0%**。長尾冷門的事實，反向檢索的落差大約 **21 個百分點**（跨 13 個模型的範圍是 4.8 到 25.8 個百分點）。

但真正關鍵的是下一個實驗。

**同樣那些反向題目，改成選擇題，13 個模型裡有 9 個反而覺得反向比正向更簡單。**

雙向的知識明明都在裡面。弱的是開放式生成時，從「類別」走回「品牌」的那條提取路徑。

![反向詛咒：正向問「這個品牌有沒有做這件事」路徑完整，反過來問「做這件事的有哪些品牌」，路徑走到一半就斷了](https://growthhackers.tw/content/images/2026/08/inline-reversal-curse-v1.png)

反向詛咒：正向問「這個品牌有沒有做這件事」路徑完整，反過來問「做這件事的有哪些品牌」，路徑走到一半就斷了

## 所以那條「補寫反向句子」的建議，我不建議照做

這篇論文被轉述的時候，常常會接上一個行動建議：既然反向查詢會掉，那你就在官網多寫幾句反向的句子，例如「做這件事的首選是某某品牌」，把雙向關聯建立起來。

聽起來很順。但我把論文從頭看完，這條建議站不住，理由有三個。

**一來，論文根本沒研究品牌。** 它測的是 Wikipedia 的百科型事實，沒有做過任何品牌實驗、沒有測過網站內容、更沒有測過「加一句話會不會有效」。

**二來，論文自己提的解法，三條全在模型端**（預訓練資料增強、後訓練對齊、推論時思考），沒有一條是叫發布者改網站。而且這裡有個邏輯上的矛盾：論文的發現是關聯早就編碼好了、選擇題裡答得出來，壞的是提取路徑。你補寫句子是在補編碼。

**對一個不是編碼問題的問題，開編碼的藥。**

**三來，時間對不上。** 參數記憶是在預訓練的時候成形的。你今天寫的句子，要先被爬到、在數兆 token 的語料裡不被當雜訊、然後等到下一次預訓練，才可能有效。這是 12 個月以上的事，而且你無法歸因。

還有更關鍵的一層。

你真正在意的那些介面，根本不靠參數記憶。

Google [Search Central 官方文件](https://developers.google.com/search/docs/appearance/ai-features?ref=growthhackers.tw)寫得很清楚，AI Overviews 和 AI Mode 是對即時搜尋索引做檢索增強生成（RAG），再加上查詢扇出。OpenAI 的[官方說明](https://help.openai.com/en/articles/9237897-chatgpt-search?ref=growthhackers.tw)也寫明，ChatGPT search 是轉成查詢、去檢索、根據結果生成並附上來源連結。

它們是現場去翻資料，不是靠腦袋裡的記憶回答。

那條建議大概真的小有用。但理由完全不同：它剛好在字面上對上了 fan-out 的子查詢，給了檢索器一句好引用的話。

那就是普通的檢索型 SEO。跟參數記憶、跟反向詛咒、跟這篇論文，都沒關係。

建議可能活下來了，論證死了。

## 也有研究不同意這篇

為了公平，補一個反方。

Google DeepMind 自己在 2026 年 3 月有另一篇 [The Illusion of Latent Generalization](https://arxiv.org/abs/2604.04943?ref=growthhackers.tw)，用探測方法發現：模型有可能是把正向和反向存成兩筆各自獨立的條目，而不是同一筆事實的雙向表徵。

如果這個說法成立，「知識都在，只是撈不出來」這個框架就要再打折。

另外，反向詛咒也不是天生無解。Meta FAIR 在 2024 年的 [Reverse Training to Nurse the Reversal Curse](https://arxiv.org/abs/2403.13799?ref=growthhackers.tw) 已經證明，在訓練端做資料處理可以大幅改善。

這件事還沒定論。這也是為什麼我不建議你現在就照著某個「新戰術」重寫官網。

順帶一提，這裡講的是模型權重裡的記憶，跟 AI agent 那種可以設計、可以清空的工作記憶是兩回事。那一層我在[你的 AI 客服為什麼越用越蠢](https://growthhackers.tw/blog/ai-agent-memory-system-design/)寫過，別搞混。

## 那你這一季該做什麼？

► **建一張 AI 品牌問答監控表，每月跑一次。** 固定 10 到 20 題，欄位放：問題、平台、有沒有提到你、提到的順序、它引用了誰、錯誤的原句、截圖連結。正向題問「某某品牌有沒有做這個」，反向題問「做這個的有哪些品牌」，兩種都要有。

► **每題都跑開／關思考模式的對照。** 開思考答對、關思考答錯，標記為「提取弱」；兩種都錯，標記為「資料缺口」；答對但沒提到你，標記為「引用缺口」。三種要用完全不同的方式處理，別混在一起。

► **力氣放在檢索層，那層你動得了。** 現在的 AI 搜尋是現場去翻資料的，所以能不能被翻到、被引用，才是本季的戰場。技術面的檢查點我整理在 [AEO 答案引擎優化怎麼做](https://growthhackers.tw/blog/aeo-answer-engine-optimization-checklist/)；AI 到底怎麼拆問題、怎麼挑來源，可以看 [Query fan-out 是什麼](https://growthhackers.tw/blog/query-fan-out-ai-platform-citation/)。

► **別把預算全押在自己的官網上。** 這是[GEO 優化](https://growthhackers.tw/blog/ai-search-third-party-citations/)那篇的重點，AI 引用的來源有七到八成不在你的網站上。

► **看到有人拿論文數字賣你戰術，先問三件事。** 這個數字出自原文哪一段？測試的母體是什麼？他給的行動建議，論文真的驗證過嗎？這次的例子就很典型：26-34% 被單獨拿出來用，下半句的 11-12% 不見了；長尾落差被寫成「20 到 35 個百分點」，但論文列出的 13 個模型最大只到 25.8。

## 最後

這篇研究的價值，不在於給你一個新的 SEO 戰術。

它換掉的是一個你可能一直用錯的心智模型。

以前你以為 AI 講錯你，是因為它沒學過，所以直覺是「再多產一點內容」。現在你知道，很可能它學過，只是那次沒撈出來，而那一層在預訓練時就定型了，你這一季動不了。

你動得了的是另一層。

看清楚哪一層動得了，比追新戰術重要得多。

如果你問我，這年頭最值錢的能力，是在所有人都在轉同一組數字的時候，願意花二十分鐘把原文的下半句讀完。

## 常見問題

### AI 幻覺是什麼？為什麼會發生？

指模型生成看起來合理但實際錯誤的內容。成因有兩層：一層是它本質上在做機率續寫，即使不知道也會生成一個像樣的答案；另一層是 Google Research 在 2026 年這篇論文指出的，很多錯誤並不是模型沒學過，而是知識已經編碼進權重、但提取失敗。前沿模型編碼了 95-98% 的事實，卻有 26-34% 直接叫不出來。

### AI 幻覺的原因是資料不夠嗎？

AI 幻覺的原因不完全是資料不夠。Google Research 的 Empty Shelves or Lost Keys? 顯示，前沿模型對長尾事實的編碼率仍然很高，落差主要出在提取。但要注意「編碼率超過 90%」在受測的 13 個模型裡只有 5 個成立，較小的模型確實存在真正的編碼不足，例如 Gemma3-1b 的編碼率只有 17.5%。

### 如何降低 AI 幻覺？

降低 AI 幻覺要先判斷錯在哪一層。如果是已編碼但提取失敗，優先使用經過思考訓練的模式，論文顯示可以救回 40% 到 65% 已編碼但直接問叫不出來的事實。如果答案需要即時或私有資料，讓模型接搜尋、資料庫，或直接把文件貼給它，把答案來源從「模型的記憶」換成「你提供的資料」。如果輸出會影響金額、庫存或法遵，一律保留人工確認。

### 開思考模式真的會比較準嗎？

在檢索既有事實這件事上會。論文的數字是直接檢索失敗率 26-34%，開思考後降到 11-12%。但有前提：這個效果主要在經過思考訓練最佳化的模型上成立，單純用提示詞叫模型「一步一步想」效果有限，論文測到對 Gemma3 甚至反而更差。

### 這篇研究是誰做的？可以去哪裡看原文？

Google Research 的 Nitay Calderon、Eyal Ben-David、Zorik Gekhman、Eran Ofek、Gal Yona，論文標題是 Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality，可以在 [arXiv:2602.14080](https://arxiv.org/abs/2602.14080?ref=growthhackers.tw) 讀全文，[Google Research 官方部落格](https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/?ref=growthhackers.tw)有摘要版，資料集開放在 [google/WikiProfile](https://huggingface.co/datasets/google/WikiProfile?ref=growthhackers.tw)。實驗數據為 2026 年初的模型快照。

---

**協作聲明與免責**

這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱；若原始出處有公開連結，會以 `[來源名稱](URL)` 形式附上，方便你進一步查找。若文中內容與原始出處有任何出入，請以原文為準。

內容僅供參考與學習交流，不構成任何專業、商業或投資建議，請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動，請以各官方最新公告為準。