用 AI 的高手不寫更長的 prompt,他們設計「驗收迴圈」:解碼 Anthropic 工程師 Thariq 的工作法
想像一下,你早上打開電腦,叫 ChatGPT 一次生 300 篇商品描述。三分鐘,全部出爐,爽度爆表。
然後呢?
你還是得一篇一篇點開來看。看它有沒有把「德國進口」掛在一個產地其實是中國的包上,看它有沒有把上個月就結束的「買一送一」又寫進去,看它有沒有冒出一句「本產品保證有效」,讓你直接吃上一張廣告不實的罰單。
生成,被 AI 加速了 10 倍。
驗收,還停在人力時代。
這就是今天大多數電商老闆用 AI 的真相。你以為瓶頸是「寫得不夠快」,其實真正的瓶頸從來是「你不敢直接用」。
一個 Anthropic 工程師的反直覺答案:把指令砍掉 80%
最近我看了一集 Peter Yang 訪談 Anthropic Claude Code 團隊成員 Thariq Shihipar 的節目,講他怎麼用 AI 規劃、建置、跑一整套自動化工作流程。裡面有句話我聽了倒帶三次。
他說,他們團隊把 Claude Code 的系統提示(system prompt,給 AI 的底層指令)砍掉了大約 80%。
你沒看錯,是砍掉,不是加上去。
理由是:模型越來越聰明之後,那些寫死的、鉅細靡遺的指令,反而變成綁手綁腳的枷鎖,把 AI 的能力壓在很低的天花板下。與其把它當一個只會照 SOP 動作的工讀生,不如給它原則跟方向,放手讓它發揮。這個「別管太多」的道理,我在 Code with Claude 倫敦場那篇「你的 AI 不是不夠聰明,是你管太多」 也談過。
如果你問我,這件事對電商圈的殺傷力,比表面上看起來大得多。這幾年我們被「提示工程」洗腦得很徹底,大家瘋狂收集 prompt 模板,比誰的咒語寫得長。但花越多時間雕 prompt,產出還是時好時壞,你還是不敢直接丟上架。
Thariq 的工作法戳破了這個迷思。重點是什麼?
真正會用 AI 的人,力氣不是花在「把話講得更漂亮」,而是花在替 AI 設計一條驗收迴圈:先講清楚「怎樣算做完」,再給它一個「機器自己就能判斷對錯」的訊號,最後讓另一個 AI 當驗收員,把不合格的退回去重做。
prompt 寫得再細,都只是把工作發出去。驗收迴圈,才是把成果收得回來。
這一集的完整脈絡,可以看 Peter Yang 訪談 Thariq Shihipar 的整理頁。接下來我把他這套方法,翻成電商聽得懂的三件事。
第一件事:完成條件比 prompt 重要,先畫一條「終點線」
Thariq 用了兩個指令,/goal 跟 /loop。/goal 幫 AI 定義「終點線」,讓它知道什麼時候該收工。/loop 讓它依回饋訊號一輪一輪自己修,直到達標。
但他講了一個關鍵前提:/goal 只有在「終點線可以被驗證」的時候才有用。
他舉的例子很傳神。叫 AI「渲染出這一支影片」,可行,因為影片有沒有出來一翻兩瞪眼。可是叫 AI「做一個很棒的遊戲」,它跑不動,因為什麼叫「很棒」根本沒標準,AI 永遠不知道自己做完了沒。
你發現問題在哪了嗎?我們對 AI 下的指令,九成長得像「做一個很棒的遊戲」。
「幫我把商品文案寫得吸引人一點。」
「幫我想幾個爆款標題。」
「吸引人」「爆款」,全是沒有終點線的形容詞。AI 只能猜,猜不中,你再重下一次,來回鬼打牆。
換個做法。這就像你發包給外包寫手,一定會附一張驗收標準:字數 200 到 300、開頭 15 字內要點出主打賣點、必含三個指定關鍵字、禁用「最」「第一」「保證」這類踩廣告法的字眼、結尾要有行動呼籲。你對真人這麼要求,卻對 AI 只丟一句「寫好看一點」,然後期待它交出能直接上架的成品。哪有這種好事。

以前我覺得,需求講得越模糊,AI 越能給我驚喜。
現在我學乖了,越是要交付的東西,終點線越要畫死。
你把「吸引人」拆成一張可勾選的清單,AI 的產出穩定度會立刻換一個檔次。因為它終於知道「怎樣算做完」了。
第二件事:把「驗收」也自動化,讓一個 AI 去查另一個 AI
就算你把終點線畫清楚了,還有一個更陰險的問題:你怎麼知道 AI 真的達標了?
如果你的做法是「叫同一個 AI 自己檢查一遍」,我勸你別。
Thariq 把複雜流程拆成兩種角色:一個創作者代理(creator,負責生東西),一個驗證代理(verifier,照獨立的評分準則挑毛病)。生成的那隻跟驗收的那隻,必須是分開的、有各自上下文的。
這不是他個人的偏方。Anthropic 官方那篇 《Building Effective Agents》 就把「Evaluator-Optimizer」列為五大工作流程模式之一:一個生成、一個評估回饋,湊成一個迴圈跑到品質達標。
為什麼一定要拆開?因為 AI 有個要命的毛病,叫自我偏袒。多篇 LLM-as-a-judge 的研究綜述 都指出,讓 AI 評分,它會系統性地偏袒自己、或偏袒同家族模型的輸出。你叫它自己打分,它幾乎不會說自己壞話。同一批研究還有個發現:AI 做「比較跟挑錯」,通常比「從零生出正確答案」更靠譜。
換句話說,AI 當作者容易出包,當糾察隊卻意外稱職。那就別浪費它這個天賦。
落到電商,這招怎麼用?
你要量產商品文案,就別只做一個「生成器」,要做一組。一個生成 agent 負責寫,一個獨立的「合規驗收 agent」拿著明確的檢查表(rubric)逐篇查:有沒有瞎掰不存在的規格?有沒有踩《商品標示法》或廣告法的地雷字?三個指定關鍵字到齊沒?不合格,直接退回重生,退到過為止。

廣告素材也一樣。讓一個 agent 一口氣生 20 版,再讓另一個 agent 拿評分準則(有沒有點出痛點、CTA 夠不夠明確、有沒有觸禁詞),把 20 版篩到剩最值得投的 3 版,你只看那 3 版。
這種「生成歸生成、驗收歸驗收」的分工,本質上就是一種編排(orchestration)。想更完整理解怎麼把多個 AI 角色串起來,可以看我之前寫的 Agent Harness 是什麼。
講到這,分享一段我自己踩過的路。
我團隊有一陣子用 AI 跑一批重複性很高的內容產出,一開始就是最笨的做法:AI 生完,全部人工一篇一篇看。量小還撐得住,量一大,同事光校對就校到眼睛脫窗,而且越到後面越恍神,錯的反而放過去。
後來我們加了一個「驗收 agent」擋在中間,拿著一張檢查表先掃一遍,把明顯不合格的直接打回。結果人的工作整個變了:從「每一篇都要看」,變成「只看被退回的那幾篇,加上最後抽檢終審」。
同樣一批人,產能翻了好幾倍。差別不在生成端,在我們終於把驗收這件事,從人的肩膀上卸了一部分給機器。
第三件事:什麼該交給 AI 跑迴圈,什麼不該
看到這你可能想,那乾脆全部丟給 AI 跑迴圈就好啦。慢著。
一個任務適不適合交給 AI 自己跑迴圈,關鍵在它有沒有一個「機器判斷得出來」的訊號。有,就適合。沒有,硬跑就是災難。
台灣電商最愛踩的坑,就是客服自動化。
AI 生文案、生圖、做客服,在台灣電商早就不是新聞,數位時代 這類報導都寫過。但很多老闆的想像是「乾脆讓 AI 全包客服」,這就出事了。客服自動化真正的甜蜜點,是那些答案明確、可以秒回的問題:運費多少、有沒有現貨、幾天到貨。這些有標準答案,訊號清楚,最適合讓 AI 跑迴圈。
但客訴、退貨爭議、情緒上來的客人,這些沒有標準答案。你硬讓 AI 跑,它就把客人卡在選單裡繞不出去。你以為省了人力,其實在製造下一張一星負評。
正解不是「全包」或「全不包」,是定義出口條件。能秒答的那些交給 AI 跑。一旦偵測到「退款」「客訴」「投訴」「爛透了」這類觸發詞,或同一個問題來回三輪還沒解,立刻轉真人。有出口的迴圈,跟讓客人繞不出去的迴圈,差的就是這個設計。

順帶一提,這集的講者 Thariq 之前還有一場演講在談「能力落差」,我也解碼過,收在 別再等 GPT-6:你手上的 AI 已經比你會用的強太多了。那篇講「你手上的能力被低估了」,這篇講「怎麼把那份能力可靠地榨出來」,剛好一體兩面。
常見問題(FAQ)
用 AI 產內容,prompt 到底要寫多細?
別再往「更長」的方向卷。與其把 prompt 寫到 500 字,不如寫一張「怎樣算合格」的驗收清單:字數、必含賣點、禁用字、關鍵字。給對驗收訊號,比咒語漂亮有用。
能不能讓 AI 自己檢查自己的成果?
不建議。研究指出 AI 評分有「自我偏袒」,很難挑自己毛病。正解是讓一個獨立、有各自上下文的「驗收 agent」,拿明確準則去查,不合格退回重做。
哪些任務適合交給 AI 自動跑迴圈?
看它有沒有「機器判斷得出來」的訊號。有標準答案的(運費、庫存、規格檢查)適合。沒有的(客訴、爭議、創意終審)要留出口給人。
給電商老闆的四個行動建議
► 停止雕 prompt,開始寫驗收標準。 下次要 AI 產東西,別再加長咒語,花時間寫一張「怎樣算合格」的清單。終點線畫清楚,比 prompt 多寫兩百字有用。
► 挑一個高風險品類,做「生成加驗收」的雙 agent。 先別想全站。挑最容易踩法規、最容易被客訴的品類(保健、美妝、3C 規格),一個生成 agent 加一個合規驗收 agent,機器先擋一關,你只做終審。
► 把檢查表(rubric)當資產在養。 驗收 agent 好不好用,全看那張評分準則夠不夠具體。固定每週回顧幾篇被退回或漏網的內容,補上 2 到 3 條新規則。這張表會越長越值錢,是你團隊真正的護城河。
► 畫清楚每條 AI 迴圈的出口。 凡是要 AI 自動跑的流程,都先問一句「什麼情況要踢給人?」把觸發詞、重試上限、升級條件先定死。
最後一句
以前,會用工具的人贏。
現在,會管理工具的人贏。
當寫程式、寫文案、生圖這些「生產」變得又快又便宜,稀缺的能力就從「會生產」位移到「會驗收」。矽谷這整套價值鏈的重組,我在 Code with Claude 2026 舊金山場的筆記 裡談過。
Thariq 那句「把系統提示砍掉 80%」,翻成人話就是別再想著把 AI 管到死。你要做的,是給它一條清楚的終點線、一個誠實的驗收員、一個有出口的迴圈,然後把自己從「校稿工」升級成「驗收標準的設計者」。
這一步跨過去,你才算真的把 AI 當團隊在用,而不是當一台更快的打字機。
協作聲明與免責
這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱;若原始出處有公開連結,會以 [來源名稱](URL) 形式附上,方便你進一步查找。若文中內容與原始出處有任何出入,請以原文為準。
內容僅供參考與學習交流,不構成任何專業、商業或投資建議,請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動,請以各官方最新公告為準。