> ## Content Index
> Fetch the complete content index at: https://growthhackers.tw/llms.txt
> Use this file to discover other available public pages before exploring further.

# 用 AI 的高手不寫更長的 prompt，他們設計「驗收迴圈」：解碼 Anthropic 工程師 Thariq 的工作法
- URL: https://growthhackers.tw/blog/ai-agent-verification-workflow/
- Published: 2026-07-20T13:34:08.000Z
- Updated: 2026-07-20T13:34:08.000Z
- Author: Lewis wang
- Tags: AI agent, AI 工作流程, Claude Code, 電商經營, 提示工程

想像一下，你早上打開電腦，叫 ChatGPT 一次生 300 篇商品描述。三分鐘，全部出爐，爽度爆表。

然後呢？

你還是得一篇一篇點開來看。看它有沒有把「德國進口」掛在一個產地其實是中國的包上，看它有沒有把上個月就結束的「買一送一」又寫進去，看它有沒有冒出一句「本產品保證有效」，讓你直接吃上一張廣告不實的罰單。

生成，被 AI 加速了 10 倍。  
驗收，還停在人力時代。

這就是今天大多數電商老闆用 AI 的真相。你以為瓶頸是「寫得不夠快」，其實真正的瓶頸從來是「你不敢直接用」。

## 一個 Anthropic 工程師的反直覺答案：把指令砍掉 80%

最近我看了一集 Peter Yang 訪談 Anthropic Claude Code 團隊成員 Thariq Shihipar 的節目，講他怎麼用 AI 規劃、建置、跑一整套自動化工作流程。裡面有句話我聽了倒帶三次。

他說，他們團隊把 Claude Code 的系統提示（system prompt，給 AI 的底層指令）砍掉了大約 80%。

你沒看錯，是砍掉，不是加上去。

理由是：模型越來越聰明之後，那些寫死的、鉅細靡遺的指令，反而變成綁手綁腳的枷鎖，把 AI 的能力壓在很低的天花板下。與其把它當一個只會照 SOP 動作的工讀生，不如給它原則跟方向，放手讓它發揮。這個「別管太多」的道理，我在 [Code with Claude 倫敦場那篇「你的 AI 不是不夠聰明，是你管太多」](https://growthhackers.tw/blog/code-with-claude-london-2026-day2-recap/) 也談過。

如果你問我，這件事對電商圈的殺傷力，比表面上看起來大得多。這幾年我們被「提示工程」洗腦得很徹底，大家瘋狂收集 prompt 模板，比誰的咒語寫得長。但花越多時間雕 prompt，產出還是時好時壞，你還是不敢直接丟上架。

Thariq 的工作法戳破了這個迷思。重點是什麼？

真正會用 AI 的人，力氣不是花在「把話講得更漂亮」，而是花在替 AI 設計一條**驗收迴圈**：先講清楚「怎樣算做完」，再給它一個「機器自己就能判斷對錯」的訊號，最後讓另一個 AI 當驗收員，把不合格的退回去重做。

prompt 寫得再細，都只是把工作發出去。驗收迴圈，才是把成果收得回來。

這一集的完整脈絡，可以看 [Peter Yang 訪談 Thariq Shihipar 的整理頁](https://creatoreconomy.so/p/how-i-plan-build-and-run-loops-with-claude-code-thariq-shihipar?ref=growthhackers.tw)。接下來我把他這套方法，翻成電商聽得懂的三件事。

## 第一件事：完成條件比 prompt 重要，先畫一條「終點線」

Thariq 用了兩個指令，`/goal` 跟 `/loop`。`/goal` 幫 AI 定義「終點線」，讓它知道什麼時候該收工。`/loop` 讓它依回饋訊號一輪一輪自己修，直到達標。

但他講了一個關鍵前提：`/goal` 只有在「終點線可以被驗證」的時候才有用。

他舉的例子很傳神。叫 AI「渲染出這一支影片」，可行，因為影片有沒有出來一翻兩瞪眼。可是叫 AI「做一個很棒的遊戲」，它跑不動，因為什麼叫「很棒」根本沒標準，AI 永遠不知道自己做完了沒。

你發現問題在哪了嗎？我們對 AI 下的指令，九成長得像「做一個很棒的遊戲」。

「幫我把商品文案寫得吸引人一點。」  
「幫我想幾個爆款標題。」

「吸引人」「爆款」，全是沒有終點線的形容詞。AI 只能猜，猜不中，你再重下一次，來回鬼打牆。

換個做法。這就像你發包給外包寫手，一定會附一張驗收標準：字數 200 到 300、開頭 15 字內要點出主打賣點、必含三個指定關鍵字、禁用「最」「第一」「保證」這類踩廣告法的字眼、結尾要有行動呼籲。你對真人這麼要求，卻對 AI 只丟一句「寫好看一點」，然後期待它交出能直接上架的成品。哪有這種好事。

![模糊指令「寫得吸引人一點」對比一張可驗收的終點線清單：字數、賣點、禁用詞、關鍵字](https://growthhackers.tw/content/images/2026/07/aiverify-2026-07-19-inline1.png)

把「寫得吸引人一點」換成一張可勾選的驗收清單，AI 才知道怎樣算做完。

以前我覺得，需求講得越模糊，AI 越能給我驚喜。  
現在我學乖了，越是要交付的東西，終點線越要畫死。

你把「吸引人」拆成一張可勾選的清單，AI 的產出穩定度會立刻換一個檔次。因為它終於知道「怎樣算做完」了。

## 第二件事：把「驗收」也自動化，讓一個 AI 去查另一個 AI

就算你把終點線畫清楚了，還有一個更陰險的問題：你怎麼知道 AI 真的達標了？

如果你的做法是「叫同一個 AI 自己檢查一遍」，我勸你別。

Thariq 把複雜流程拆成兩種角色：一個**創作者代理**（creator，負責生東西），一個**驗證代理**（verifier，照獨立的評分準則挑毛病）。生成的那隻跟驗收的那隻，必須是分開的、有各自上下文的。

這不是他個人的偏方。Anthropic 官方那篇 [《Building Effective Agents》](https://www.anthropic.com/research/building-effective-agents?ref=growthhackers.tw) 就把「Evaluator-Optimizer」列為五大工作流程模式之一：一個生成、一個評估回饋，湊成一個迴圈跑到品質達標。

為什麼一定要拆開？因為 AI 有個要命的毛病，叫**自我偏袒**。多篇 [LLM-as-a-judge 的研究綜述](https://www.sciencedirect.com/science/article/pii/S2666675825004564?ref=growthhackers.tw) 都指出，讓 AI 評分，它會系統性地偏袒自己、或偏袒同家族模型的輸出。你叫它自己打分，它幾乎不會說自己壞話。同一批研究還有個發現：AI 做「比較跟挑錯」，通常比「從零生出正確答案」更靠譜。

換句話說，AI 當作者容易出包，當糾察隊卻意外稱職。那就別浪費它這個天賦。

落到電商，這招怎麼用？

你要量產商品文案，就別只做一個「生成器」，要做一組。一個生成 agent 負責寫，一個獨立的「合規驗收 agent」拿著明確的檢查表（rubric）逐篇查：有沒有瞎掰不存在的規格？有沒有踩《商品標示法》或廣告法的地雷字？三個指定關鍵字到齊沒？不合格，直接退回重生，退到過為止。

![生成 Agent 與驗收 Agent 的閉環：生成後交給驗收 Agent 依 rubric 檢查，通過放行、不合格退回重做](https://growthhackers.tw/content/images/2026/07/aiverify-2026-07-19-inline2.png)

生成歸生成、驗收歸驗收：不合格就退回重做，形成一條會自我修正的驗收迴圈。

廣告素材也一樣。讓一個 agent 一口氣生 20 版，再讓另一個 agent 拿評分準則（有沒有點出痛點、CTA 夠不夠明確、有沒有觸禁詞），把 20 版篩到剩最值得投的 3 版，你只看那 3 版。

這種「生成歸生成、驗收歸驗收」的分工，本質上就是一種編排（orchestration）。想更完整理解怎麼把多個 AI 角色串起來，可以看我之前寫的 [Agent Harness 是什麼](https://growthhackers.tw/blog/what-is-agent-harness/)。

講到這，分享一段我自己踩過的路。

我團隊有一陣子用 AI 跑一批重複性很高的內容產出，一開始就是最笨的做法：AI 生完，全部人工一篇一篇看。量小還撐得住，量一大，同事光校對就校到眼睛脫窗，而且越到後面越恍神，錯的反而放過去。

後來我們加了一個「驗收 agent」擋在中間，拿著一張檢查表先掃一遍，把明顯不合格的直接打回。結果人的工作整個變了：從「每一篇都要看」，變成「只看被退回的那幾篇，加上最後抽檢終審」。

同樣一批人，產能翻了好幾倍。差別不在生成端，在我們終於把驗收這件事，從人的肩膀上卸了一部分給機器。

## 第三件事：什麼該交給 AI 跑迴圈，什麼不該

看到這你可能想，那乾脆全部丟給 AI 跑迴圈就好啦。慢著。

一個任務適不適合交給 AI 自己跑迴圈，關鍵在**它有沒有一個「機器判斷得出來」的訊號**。有，就適合。沒有，硬跑就是災難。

台灣電商最愛踩的坑，就是客服自動化。

AI 生文案、生圖、做客服，在台灣電商早就不是新聞，[數位時代](https://www.bnext.com.tw/article/75004/aigc-e-commerce?ref=growthhackers.tw) 這類報導都寫過。但很多老闆的想像是「乾脆讓 AI 全包客服」，這就出事了。客服自動化真正的甜蜜點，是那些答案明確、可以秒回的問題：運費多少、有沒有現貨、幾天到貨。這些有標準答案，訊號清楚，最適合讓 AI 跑迴圈。

但客訴、退貨爭議、情緒上來的客人，這些沒有標準答案。你硬讓 AI 跑，它就把客人卡在選單裡繞不出去。你以為省了人力，其實在製造下一張一星負評。

正解不是「全包」或「全不包」，是**定義出口條件**。能秒答的那些交給 AI 跑。一旦偵測到「退款」「客訴」「投訴」「爛透了」這類觸發詞，或同一個問題來回三輪還沒解，立刻轉真人。有出口的迴圈，跟讓客人繞不出去的迴圈，差的就是這個設計。

![客服分流：客戶提問先判斷有沒有標準答案，有就 AI 秒回（運費、現貨、到貨），觸發退款、客訴等詞就轉真人](https://growthhackers.tw/content/images/2026/07/aiverify-2026-07-19-inline3.png)

客服自動化的正解不是全包，是定義出口條件：能秒答的交給 AI，觸發客訴詞就轉真人。

順帶一提，這集的講者 Thariq 之前還有一場演講在談「能力落差」，我也解碼過，收在 [別再等 GPT-6：你手上的 AI 已經比你會用的強太多了](https://growthhackers.tw/blog/ai-capability-overhang/)。那篇講「你手上的能力被低估了」，這篇講「怎麼把那份能力可靠地榨出來」，剛好一體兩面。

## 常見問題（FAQ）

### 用 AI 產內容，prompt 到底要寫多細？

別再往「更長」的方向卷。與其把 prompt 寫到 500 字，不如寫一張「怎樣算合格」的驗收清單：字數、必含賣點、禁用字、關鍵字。給對驗收訊號，比咒語漂亮有用。

### 能不能讓 AI 自己檢查自己的成果？

不建議。研究指出 AI 評分有「自我偏袒」，很難挑自己毛病。正解是讓一個獨立、有各自上下文的「驗收 agent」，拿明確準則去查，不合格退回重做。

### 哪些任務適合交給 AI 自動跑迴圈？

看它有沒有「機器判斷得出來」的訊號。有標準答案的（運費、庫存、規格檢查）適合。沒有的（客訴、爭議、創意終審）要留出口給人。

## 給電商老闆的四個行動建議

► **停止雕 prompt，開始寫驗收標準。** 下次要 AI 產東西，別再加長咒語，花時間寫一張「怎樣算合格」的清單。終點線畫清楚，比 prompt 多寫兩百字有用。

► **挑一個高風險品類，做「生成加驗收」的雙 agent。** 先別想全站。挑最容易踩法規、最容易被客訴的品類（保健、美妝、3C 規格），一個生成 agent 加一個合規驗收 agent，機器先擋一關，你只做終審。

► **把檢查表（rubric）當資產在養。** 驗收 agent 好不好用，全看那張評分準則夠不夠具體。固定每週回顧幾篇被退回或漏網的內容，補上 2 到 3 條新規則。這張表會越長越值錢，是你團隊真正的護城河。

► **畫清楚每條 AI 迴圈的出口。** 凡是要 AI 自動跑的流程，都先問一句「什麼情況要踢給人？」把觸發詞、重試上限、升級條件先定死。

## 最後一句

以前，會用工具的人贏。  
現在，會管理工具的人贏。

當寫程式、寫文案、生圖這些「生產」變得又快又便宜，稀缺的能力就從「會生產」位移到「會驗收」。矽谷這整套價值鏈的重組，我在 [Code with Claude 2026 舊金山場的筆記](https://growthhackers.tw/blog/code-with-claude-2026-sf-recap/) 裡談過。

Thariq 那句「把系統提示砍掉 80%」，翻成人話就是別再想著把 AI 管到死。你要做的，是給它一條清楚的終點線、一個誠實的驗收員、一個有出口的迴圈，然後把自己從「校稿工」升級成「驗收標準的設計者」。

這一步跨過去，你才算真的把 AI 當團隊在用，而不是當一台更快的打字機。

---

**協作聲明與免責**

這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱；若原始出處有公開連結，會以 `[來源名稱](URL)` 形式附上，方便你進一步查找。若文中內容與原始出處有任何出入，請以原文為準。

內容僅供參考與學習交流，不構成任何專業、商業或投資建議，請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動，請以各官方最新公告為準。