> ## Content Index
> Fetch the complete content index at: https://growthhackers.tw/llms.txt
> Use this file to discover other available public pages before exploring further.

# 你的 AI 需要一個天敵：頂尖 PM 靠「對抗式代理」打贏 30 隊工程團隊，台灣電商怎麼複製這招
- URL: https://growthhackers.tw/blog/adversarial-agents-ai-critic-loop/
- Published: 2026-07-19T14:17:39.000Z
- Updated: 2026-07-19T14:17:39.000Z
- Author: Lewis wang
- Tags: 對抗式代理, AI agent, Claude Code, AI 生產力, 電商行銷

一個在 Netflix、Meta、Amazon 都待過的資深產品經理，花一天時間做出一個 AI，然後在公司內部黑客松打贏 30 個工程團隊。

聽起來像那種「AI 好強」的老套故事對吧？

但真正有意思的地方是：她沒有寫出比別人更強的程式碼。她做的，是一個專門「找自己碴」的 AI。

這個人叫 Jyothi Nookula，故事出自成長行銷創作者 Aakash Gupta 的 podcast [《The Complete Claude Stack for PMs》](https://www.aakashg.com/jyothi-nookula-claude-stack-podcast/?ref=growthhackers.tw)。整集講的是產品經理怎麼把 Claude 這套 AI 用好，內容很紮實。但如果你問我，全集最值錢的一句話是這個：

> **「Building is easy，taste is what matters.」**  
> 做東西已經很簡單了，難的是品味。

這句話，對每天在用 ChatGPT、Claude 寫文案的台灣電商人來說，價值遠比你想的高。今天就來拆給你聽。

## 對抗式代理是什麼？為什麼能打贏 30 隊

先講她到底做了什麼。

Jyothi 讀到 Anthropic 一篇談 AI 代理架構的技術文章，裡面有個概念叫「對抗式代理」（Adversarial Agents）。她進了 Claude Code，jam 了差不多一天，做出一個評審代理，接上公司正式的產品程式碼，然後就贏了。

這個概念的根，其實是很多年前的 GAN（Generative Adversarial Networks，生成對抗網路），當年主要拿來生成圖片。它的邏輯很簡單：你養兩個 AI。

一個叫「生成器」（Generator），負責產出東西。  
一個叫「評審者」（Evaluator），也可以叫對抗者，負責想盡辦法挑毛病、攻擊、找破綻。

評審者把找到的問題丟回給生成器，逼它改。改完再打分，不過關就再改，直到分數過了設定的門檻才放行。

根據 [Anthropic Engineering 部落格](https://www.anthropic.com/engineering/harness-design-long-running-apps?ref=growthhackers.tw)自己的說明，這套設計要解決的，是一個很致命的毛病：AI 會自我感覺良好。你叫它自己評自己，它幾乎都給高分，就算成果其實很普通，它還是會大力稱讚你。

你有沒有覺得很熟悉？

這不就是你叫 ChatGPT「幫我看看這篇文案有沒有問題」，它永遠回你「這是一篇很棒的文案，以下是幾個小建議」的那個場景嗎？

Jyothi 在節目裡實際跑了一次給大家看。她設的過關標準是「每一項都要超過 8 分」，最多迭代 5 次。第一輪整體拿到 8.52，看起來不差，但在「格式衝突」這類攻擊上破防，有項目沒到標準，所以沒過。系統自動把回饋丟回生成器、改寫提示詞，第二輪衝到 9.0，第三輪 9.08，全項過關。

**重點是什麼？**

這整套厲害的地方，從來不是模型多聰明。厲害的是「她叫評審代理去測什麼」。要攻擊哪些邊界、哪些情境不能出錯、哪些是她公司最在乎的能力，這些是她這個資深 PM 的 domain knowledge（領域知識），也就是品味。

這就像從「請一個只會生成的實習生」進化到「請一個最龜毛的資深主管，站在你旁邊專門挑你毛病」。

實習生給你的第一版，你敢直接發嗎？當然不敢。可是換成 AI，很多人就直接發了。

![對抗式代理迴圈：生成器產出草稿，評審代理依 rubric 評分，未過門檻回改，8.52 未過、9.0、9.08 過關後交件](https://growthhackers.tw/content/images/2026/07/aac-inline-adversarial-loop-v1.png)

對抗式代理的核心：生成器負責產出，評審代理依評分標準（rubric）找碴打分，沒過就回改，直到過門檻才交件。

## 台灣電商的通病：只會生成，不會對抗

切入重點，講講你我每天在幹的事。

你打開 Claude，叫它寫一封母親節檔期的 EDM（電子報）。三秒後，一篇看起來「還可以」的文案出來了。你順手改兩個字，排版一下，發了。

促銷主標題、Line 群發文案、活動頁的 slogan、客服的罐頭回覆，全都是同一個流程：生成、微調、送出。

你知道為什麼你的文案總是「還可以」但就是不會爆嗎？

因為你只用了 AI 的一半。你用了「生成」，但你完全沒用「對抗」。

以前我在傳產做行銷，一張 DM、一句專櫃的促銷話術，都要過三關：企劃自己看一遍、主管改一遍，有時候老闆再嫌一遍。我還在百貨當櫃哥的那幾年感受更直接，最會賣的那句話，常常不是誰一次寫好的，是被客人當面打槍、被同櫃的姐姐吐槽，一句一句磨出來的。

就是這種互相嫌棄，把平庸的東西磨成能打的東西。現在很多人用 AI，等於把這三關全砍了，只留生成那一步，然後奇怪為什麼成效不如預期。

我自己也踩過這個坑。

早期用 AI 寫東西，我也是生成完覺得順眼就用。後來吃了幾次虧，我開始養一個我私下叫「打臉 prompt」的東西。每次 AI 給我初稿，我不會問它「這樣好不好」，我會另開一個對話，貼上初稿，然後下一句話：「你是一個很機車的資深電商主管，這篇文案至少有五個問題會讓轉換率變差，請一條一條戳破，不准客氣。」

差別大到嚇人。同一個模型，換個問法，它從「拍你馬屁」變成「往死裡嫌」，而那些被嫌出來的點，八成真的是問題。

這就是對抗式代理的精簡版，你其實不需要會寫程式。

那對電商人來說，這個「評審代理」到底該測什麼？這才是關鍵。你要把你的品味，寫成它的評分表（rubric）。我給你幾個一定要放進去的：

► **品牌紅線**：不能亂承諾折扣、不能講絕對療效、不能出現競品比較的地雷字。這些是你的品牌會被客訴甚至被檢舉的地方。

► **贈品與活動法遵**：滿額贈、抽獎、限時限量的說法，有沒有踩到公平交易或廣告不實的線。台灣這幾年這種罰單不少。

► **過去的高轉換句型**：把你自己跑出來、真的有效的標題句型餵給它，讓它拿這個當標準去嫌初稿「不夠鉤」。

► **毛利防呆**：這檔促銷會不會傷毛利、會不會跟上一檔自己打自己。這是最容易被 AI 忽略、但最痛的一條。

![電商版評審代理評分表：品牌紅線、贈品與活動法遵、高轉換句型、毛利防呆四項，AI 用紅筆逐項打分](https://growthhackers.tw/content/images/2026/07/aac-inline-ecommerce-rubric-v1.png)

電商版的評分表（rubric）：把品牌紅線、贈品法遵、高轉換句型、毛利防呆寫成明確條目，AI 才有標準去嫌你的初稿。

你把這幾條寫成一段 system prompt（系統提示詞），或者存成一個可以重複叫用的 skill（技能檔），你就有了一個專屬的找碴 AI。不用花錢買新工具，你手上的 Claude 或 ChatGPT 就能做。

## 從「評審迴圈」到「自我改進迴圈」

如果你已經跟得上，這招還能再放大。

Jyothi 在節目後段講到她看過最強的應用，是有團隊把整條產品線接成一個「自我改進迴圈」。客訴和 bug 一進來，一個 PM 代理先分類、研究、做原型，工程代理接手寫程式，分析代理建好追蹤。人類工程師 review 之後才上線，上線後再自動分析。整個閉環自己轉。

聽起來很矽谷、很遙遠，對吧？把它縮小到一間台灣電商，其實很好懂。

想像一下，你早上打開電腦，昨天的客服對話、蝦皮商品評論、退貨原因，已經被一個代理自動分類好了。它告訴你：「這週有 12 筆客訴都指向同一件事，出貨速度。對照你們的出貨 SOP，問題出在週五下午的訂單沒人接。」然後它順手把改善建議寫好了。

這就是同一個邏輯：一個代理負責做，一個代理負責挑、負責歸納，讓問題自己浮出來，而不是等你某天心血來潮才去翻客訴。我之前寫過一個把行銷報表從兩週壓到兩分鐘的[自動化實例](https://growthhackers.tw/blog/mcp-google-ads-workflow/)，就是這套邏輯的入門版。

![電商自我改進迴圈：客訴、商品評論、退貨原因輸入分類代理，對照 SOP，產出改善建議並回饋](https://growthhackers.tw/content/images/2026/07/aac-inline-self-improving-loop-v1.png)

電商版的自我改進迴圈：客訴、評論、退貨原因交給分類代理歸納，對照 SOP，產出改善建議，形成閉環。

這一層要接上更多資料源，背後靠的就是 MCP（Model Context Protocol，讓 AI 連上你 Gmail、Slack、後台資料的整合協定），還有大家最近很常聽到的 agent harness（代理鷹架）這套底層架構。這兩個名詞我不在這裡展開，之前寫過一篇[《Agent Harness 是什麼？》](https://growthhackers.tw/blog/what-is-agent-harness/)專門講，有興趣可以回頭看。

不過這裡我要很誠實地潑一盆冷水，免得你以為多養幾個 AI 就一定贏。

Anthropic 自己那篇文章就講得很白：**模型越強，外圍鷹架的重要性其實會隨時間下降。** 他們實測，用單一代理 20 分鐘、花 9 美元就能做出一個小工具，只是核心功能會壞掉；而完整的三代理對抗架構要跑 6 小時、花 200 美元，成果確實明顯更好。品質是有價的，這叫 token 稅。

所以我的判斷不是「你一定要搞多代理」。

我的判斷是：模型會越來越強，生成這件事會越來越不值錢。但「決定要測什麼、什麼叫夠好」這件事，模型再強都不會幫你決定。

那是你的品味，你的 domain knowledge，你踩過的坑。這東西外包不掉。

之前 Anthropic 那場 Code with Claude 大會我寫過一篇[《你的 AI 不是不夠聰明，是你管太多》](https://growthhackers.tw/blog/code-with-claude-london-2026-day2-recap/)，講的是同一件事的另一面：多數人不是不會用 AI，是不會「管」AI。而管的核心，就是你有沒有一套自己的標準，去逼它、去嫌它、去驗收它。

當寫東西變便宜，會用 AI 的人跟不會用的人，差的不是誰的模型比較新，是誰養了一個夠兇的天敵。

## 你今天可以做的三件事

不用等你變成工程師，這三件事今天就能開始：

► **第一，先養一個「打臉 prompt」。** 下次 AI 給你初稿，別問它好不好，另開對話叫它扮演一個很機車的資深主管，一條一條戳破。光這一步，你的產出品質就會跳一級。

► **第二，把你的品味寫成評分表。** 拿一張紙，列出你的品牌紅線、法遵地雷、高轉換句型、毛利防呆。這張表就是你的護城河，把它存成一個可以重複用的提示詞或 skill。

► **第三，挑一個最煩的重複工作，做成迴圈。** 客訴分類、評論歸納、退貨原因統計，先挑一個。你甚至不用一步到位，先撈最近 20 筆客服對話丟給 AI 做初步歸類，你只負責最後判斷。從這裡開始感受「生成 + 對抗」的威力。

AI 幫你把「生成」變成免費，這是好消息。  
但真正拉開你跟同業距離的，是你敢不敢養一個專門打自己臉的 AI，還有你有沒有那個品味，知道該打哪裡。

從下一篇文案開始，別只按下「生成」，記得再按一次「驗收」。

這年頭就是品味、品味、品味。

*（想更系統地理解「當寫程式和寫東西都變便宜之後，該把力氣花在哪」，可以搭配我之前寫的*[*《王董週刊 #2｜Coding is Solved 之後，Growth Hacker 該蓋什麼？》*](https://growthhackers.tw/blog/weekly-2-coding-is-solved/)*一起看。）*

---

## 常見問題 FAQ

**Q1：對抗式代理（Adversarial Agents）是什麼？跟一般 AI 評分有什麼不同？**

對抗式代理是讓兩個 AI 互相對抗：一個「生成器」負責產出內容，一個「評審者」專門找破綻、攻擊、打分，把問題丟回去逼生成器修改，直到通過門檻才放行。它的根源是 GAN（生成對抗網路）。跟你直接叫 AI「幫我評分」最大的不同是：AI 自評自己時幾乎都會給高分、自我感覺良好；而對抗式代理刻意把「生成」和「找碴」拆成兩個角色、給對抗者明確的攻擊任務，才逼得出真正的問題。

**Q2：沒有工程背景的電商小編，怎麼用一個 prompt 或 skill 養出評審代理？**

不用寫程式。最簡單的做法：AI 給你初稿後，另開一個對話，貼上初稿，下指令「你是一個很嚴格的資深電商主管，請找出這篇至少五個會傷害轉換率或違反品牌規範的問題，一條一條講，不准客氣」。想更省事，就把這段指令加上你的品牌紅線、法遵地雷，存成一個可重複叫用的 skill（技能檔），每次要驗收就叫它出來。

**Q3：這樣一來一往不是很花錢、很慢嗎？成本要怎麼權衡？**

會多花一點 token（可以理解成品質稅）。Anthropic 的實測顯示，單一代理快又便宜但品質不穩，完整的多代理對抗架構慢很多、貴很多，但成果明顯更好。對電商來說不用每件事都上對抗迴圈，把它用在「高風險、高曝光」的產出就好，例如主打檔期文案、要投大錢的廣告素材、會被大量客戶看到的客服話術，這些地方多花一點很值得。

**Q4：評審代理該「測什麼」？評分表（rubric）怎麼設才有用？**

測什麼比模型強不強更重要，這是整套的靈魂。電商建議至少放四類：品牌紅線（不能亂承諾、不踩地雷字）、活動與贈品法遵、你過去驗證有效的高轉換句型、毛利防呆（會不會傷毛利或自己打自己）。把這些寫成明確、可打分的條目，AI 才有標準去嫌你的初稿。

**Q5：這跟 agent harness、MCP 有什麼關係？**

對抗式代理是一種「代理架構」的設計手法；agent harness（代理鷹架）是更底層的那套骨架，管的是 AI 的記憶、工具存取、評審系統等等；MCP（Model Context Protocol）則是讓 AI 連上你 Gmail、後台、資料庫的整合協定。簡單說，MCP 負責接資料，harness 負責搭骨架，對抗式代理是你在骨架上蓋出來的那套「找碴機制」。

---

**協作聲明與免責**

這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱；若原始出處有公開連結，會以 `[來源名稱](URL)` 形式附上，方便你進一步查找。若文中內容與原始出處有任何出入，請以原文為準。

內容僅供參考與學習交流，不構成任何專業、商業或投資建議，請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動，請以各官方最新公告為準。