你的 AI 品質分數,可能比丟銅板還不準:解碼巴西 Nova Escola 怎麼把「好壞」校準到能信

AI 生的文案、客服回覆到底好不好?多數電商靠人眼抽查或叫 AI 打分,但你衡量品質的那把尺,在校準前根本不可信。解碼巴西 Nova Escola 的 AI 評測(Evals)方法,教你先校準、再相信任何 AI 品質分數。

你的 AI 品質分數,可能比丟銅板還不準:解碼巴西 Nova Escola 怎麼把「好壞」校準到能信

想像一下,你早上打開電腦,叫 AI 一次生 300 篇商品描述。三分鐘,全出爐。你點開來掃了幾篇,嗯,還不錯,就整批排程上架了。

停一下。

「還不錯」,是誰說了算?

你有沒有想過,你腦子裡那把「好不好」的尺,跟你隔壁小編那把,量出來的結果可能差到像在丟銅板?你覺得這篇文案「有打中賣點」,他覺得「太浮誇」;你覺得那句客服回覆「很有溫度」,他覺得「太油」。同一批東西,兩個人給的分數對不起來。

這件事聽起來像小問題,其實是這幾年電商用 AI 最大的地雷。我們拚命想「用 AI 把東西做出來」,卻很少停下來問一句:

我拿來判斷 AI 做得好不好的那把尺,本身準嗎?

一支影片,戳破了「我有在檢查品質」的幻覺

最近我看了 AI 評測課程講師 Hamel Husain 的一支影片《How To Build AI Evals》(如何打造 AI 評測系統)。Hamel 跟 Shreya Shankar 在 Maven 上開的「AI Evals For Engineers & PMs」課,是平台上最賣座的課程之一,上過的工程師和產品經理來自數百家公司。

先解釋一個詞。Evals(AI 評測),指的是一套用來衡量「AI 產出的品質到底好不好」的機制。不是測程式會不會當機,是測它生出來的東西夠不夠格。

這集他找了學員 Lucas 來分享。Lucas 在巴西一家叫 Nova Escola 的教育公司做事,這家公司在巴西的地位,大概等於老師們最信任的教學品牌,用 AI 生教案的服務,用戶是以百萬計的老師。Lucas 把 AI 評測從零推廣到整家公司。

重點是什麼?

他整場沒有在講「怎麼把 AI 生成的東西做得更漂亮」。他從頭到尾在講一件更底層的事:他們怎麼一步步搞清楚「什麼叫好」,又怎麼確認「我打的這個品質分數,值得信」。

而他們第一個踩的坑,每個台灣電商老闆都會踩。

第一件事:兩個人打分打到比丟銅板還不一致,問題不在人,在你那把尺

Lucas 團隊最早做評測,是拉一張巨大又混亂的試算表,把 AI 生出來的一堆教案攤開,找人來打分。

他們犯了一個錯:找了兩位專家來標註(annotate,替每一筆資料標上好壞)。

聽起來很嚴謹對吧?兩個專家總比一個保險。結果呢?

這兩個人對同一批教案的判斷,一致的程度,比丟銅板還低。有些項目甚至是負相關,一個說好,另一個幾乎穩定地說壞。Lucas 講得很白:如果我丟銅板,銅板跟自己的一致性都比這兩位高。

兩位專家對同一份 AI 產出給出相反判斷,一致性比丟銅板還低,代表評分標準沒定義清楚

你以為這代表「要再找更多人來投票」嗎?

剛好相反。

Hamel 課程裡教的觀念是:與其湊一堆標註員,不如找一個「開明的獨裁者」(benevolent dictator),也就是一個真正懂什麼叫好、有能力當唯一標準的人。兩個人打不攏,不是人不夠多,是你的評分標準(rubric)根本沒寫清楚。標準模糊,連兩個專家都各自解讀,那你怎麼可能教會一台機器?

這一點,其實學界早就有數據。多項 LLM-as-a-judge(讓 AI 當評審)的研究整理 都指出,人類標註員在偏主觀的任務上,彼此一致性本來就不高,用 kappa 值(衡量不同人標註結果一致程度的統計指標)來看,常常只落在 0.3 到 0.6 之間。換句話說,「兩個人對品質看法不一」是常態,不是意外。所以你要做的,不是假裝這個分歧不存在,而是把「好」定義到具體得不能再具體。

講到這,我想起以前在百貨當專櫃櫃哥的日子。

那時候我們有兩個主管,一個看「服務好不好」看的是話術有沒有到位,另一個看的是有沒有主動幫客人拎袋子送到門口。同一個櫃姐同一天的表現,甲主管給 A,乙主管給 C。我們這些櫃哥完全不知道該討好誰,因為「服務好」這三個字,公司從來沒寫成一張大家都照著看的清單。

後來換了一個店長,做的第一件事就是把「好服務」拆成七條可勾選的動作:進店三十秒內打招呼、主動報今日優惠、結帳時複誦金額、送客到電梯口。從那天起,兩個主管給的分數才終於對得上。

同一件事,落到 AI 也一樣。

你叫 AI「把文案寫得吸引人」,「吸引人」就是那個沒人寫清楚的模糊標準。你要先自己說得出來:合格的文案,開頭 15 字要點出主打賣點、必含三個指定關鍵字、禁用「最」「第一」「保證」這類踩廣告法的字、結尾要有行動呼籲。你把「吸引人」拆成一張連機器都能照著判的清單,你的品質判斷才有可能穩定。

以前我以為,品質這種東西「看久了自然有感覺」。
現在我知道,感覺不能規模化,寫成清單才能。

第二件事:別叫 AI 打完分就收工,那個分數在校準前是騙你的

好,假設你已經有一張還算清楚的標準了。下一步很多人會這樣做:叫 AI 當評審,一次幫你把 300 篇文案打完分,看哪幾篇分數高就上架。

省時、省力、爽度爆表。也最危險。

Hamel 在影片簡介裡有一句話,我看了倒帶三次:一個跟你的專家意見一致度比丟銅板還低的評審,它不是在衡量品質,它是在「製造假的信心」(manufacturing false confidence)。

你知道這句話最恐怖的地方在哪嗎?

假信心比沒信心更危險。沒有分數,你至少還會小心地一篇篇看。有了一個看起來很專業的分數,你就大膽整批放行了。結果那個分數根本沒被驗證過,等於你閉著眼睛開快車,還以為自己裝了導航。

所以 Lucas 團隊怎麼做?

他們不會拿到一個 AI 評審就直接信它。他們會先「校準」(calibration)。做法是:拿一批已經由人工標好答案的資料,去對照 AI 評審打的分,算出它抓對的比率跟抓錯的比率,確認這個 AI 評審跟人類專家的判斷夠接近,才敢真的拿它去打分。校準過不了,這個評審就退回重做。

校準流程:人工標註 → 對照 AI 評審 → 校準 → 才敢信任分數

研究也早就在敲警鐘。前面那份 LLM-as-a-judge 的整理提到,AI 評審有個毛病:它會「過度自信」,高估自己跟人類的一致程度。它打分時一臉篤定,但那份篤定沒經過校準,就不值錢。

落到台灣電商,這招怎麼用?

想像你要投廣告素材,讓一個 AI 一口氣生 20 版,再叫另一個 AI 拿評分準則把 20 版篩到剩 3 版,你只投那 3 版。這流程很聰明,我很推。但關鍵在於:

你有沒有驗證過,AI 挑出來的那 3 版,跟你自己真的會挑的那 3 版,是同一批?

做法不難。你自己先認真挑一次,標出你心中的前 3 名,再讓 AI 挑一次,兩邊對一下。對得上,這個 AI 評審你可以放心用;對不上,回頭去問:是我的標準沒講清楚,還是這個評審抓錯了重點。校準過的評審,才是你的分身;沒校準的,是隨機亂數穿了一件專業的外套。

這裡我想接一篇我之前寫的文章。我寫過《用 AI 的高手不寫更長的 prompt,他們設計「驗收迴圈」》,講的是怎麼設計一條「生成歸生成、驗收歸驗收」的迴圈,把 AI 的成果可靠地收回來。那篇教你「怎麼設計一個驗收員」。

這篇是它的另一半:你那個驗收員本身,準不準?

驗收迴圈設計得再漂亮,如果裡面那個評審是歪的,你只是更有效率地在生產你信以為真的爛東西。想更完整理解怎麼把「生成 agent」跟「驗收 agent」串成一套流程,可以再看我寫的《Agent Harness 是什麼》。

第三件事:資源有限,別什麼都評,先做「錯誤分析」

看到這你可能想:那我乾脆把每個環節、每種文案、每句客服回覆,全都建一套評測,最保險。

慢著。這是第三個坑,也是最花錢的坑。

Hamel 課程裡反覆強調一句話:評測不是免費的。你要標資料、要校準評審、要養標準,每一樣都吃人力吃時間。什麼都想評,最後就是什麼都評不好。

正確的順序,是先做「錯誤分析」(error analysis),把 AI 實際出的包一筆筆攤開來看,歸類出哪些是「反覆出現、又不知道怎麼修」的失敗模式(failure mode),只有這種才值得花力氣建評測。至於那些一眼就能修掉的小問題,直接修就好,別浪費資源去替它建一套評測。

錯誤分析漏斗:能秒修的直接修,只有反覆出現又難修的失敗模式才升級成評測

Lucas 舉了自己的例子。他們一開始傻傻地標了一堆資料,後來發現有些問題根本是小事,比如教案標題太籠統,看到就順手改掉了,不需要評測。真正值得建評測的,是那些一直陰魂不散、又難搞的毛病,例如 AI 生的教案跟老師實際要的課綱對不上。

這件事我太有感了。

以前在雨傘工廠跑品管,沒有一家工廠是 100% 全檢的,那樣成本會爆掉。老師傅的做法是抽檢,而且抽檢的重點會集中在「最常出問題的那幾道工序」,比如傘骨的鉚接點、開關的彈簧。你把力氣壓在最容易出包又最傷客訴的地方,才是聰明的品管。

AI 評測就是這個道理。這就像從「每一件都拆開來檢查」進化到「盯著最容易爆的那幾個點抽檢」。

而且別忘了 Lucas 在影片裡提到的公司規模:整家 Nova Escola 大約 290 人,技術團隊只有 6 個人。一個服務數以百萬計老師的品牌,技術人力也就這樣。他們憑什麼撐住品質?

靠的就是「不什麼都評」,把有限的力氣導到最痛的失敗模式上,再讓真正懂教學的人,也就是領域專家,把時間花在判斷品質本身,而不是耗在拉資料、寫腳本這些雜事上。

台灣多的是 6 個人、甚至 3 個人的小電商團隊。你的資源比 Nova Escola 還緊,更沒有本錢「什麼都想評」。先抓出你最常被客訴、最容易踩法規的那一兩個品類,力氣先押在那裡。

還有一件事你會慢慢發現:那張越養越細的評分標準,本身就是你團隊真正的資產。工具人人買得到,但「你比別人更清楚什麼叫好、還能把它寫成標準」這件事,別人抄不走。這跟我在《AI Agent 時代新護城河:為什麼第一方資料比模型更關鍵》裡談的是同一套邏輯:模型是共用的,你獨有的判斷力才是護城河。

常見問題(FAQ)

Q:AI Evals(AI 評測)到底是什麼?跟一般軟體測試差在哪?
一般軟體測試看的是「會不會出錯、會不會當機」,答案是明確的對或錯。AI 評測看的是「生出來的東西夠不夠好」,這是有程度、有主觀的品質判斷。所以評測的難點不在跑測試,而在「先把好壞的標準定義清楚,再證明你的評分是準的」。

Q:可以叫 AI 幫另一個 AI 打分嗎?那個分數可信嗎?
可以,但不能直接信。你要先「校準」:拿一批人工標好答案的資料,對照 AI 評審打的分,確認它跟人類專家的判斷夠接近,才拿它去大規模打分。沒校準過的 AI 分數,很可能在製造假的信心。

Q:兩個人給同一批內容打分很不一致,怎麼辦?
這通常不是人的問題,是你的評分標準(rubric)不夠清楚。先別急著找更多人投票,回頭把「好」拆成一張具體、可勾選的清單,清楚到兩個不同的人看了會給出接近的判斷。找一個真懂的人當唯一標準(開明的獨裁者),往往比湊一堆意見有效。

Q:小團隊資源有限,要不要每個環節都建評測?
不要。評測很吃資源,什麼都評等於什麼都評不好。先做錯誤分析,找出「反覆出現又難修」的失敗模式,只對這種建評測。一眼能修的小問題直接修,別為它建一套評測。

給電商老闆的四個行動建議

先把一個品類的「合格標準」寫成清單。 別再用「感覺不錯」當驗收依據。挑一個高風險品類(保健、美妝、3C 規格),把「合格文案」拆成 5 到 8 條可勾選的規則。標準寫得夠死,AI 產出跟人工判斷才會穩定。

信任任何 AI 分數之前,先做一次校準。 你自己認真挑一批「心中的正解」,再讓 AI 評審挑一次,兩邊對比。對得上才放行用它打分;對不上,先修標準或換評審。這一步花不了你多少時間,卻能擋掉整批錯誤放行。

先做錯誤分析,別急著建評測。 把 AI 最近出的包一筆筆列出來,分成「一眼能修的小問題」跟「反覆出現又難修的失敗模式」。前者直接修,後者才值得你花力氣建評測。

把評分標準當資產在養。 固定每週回顧幾篇被退回或漏網的內容,替標準補上 2 到 3 條新規則。工具會過時,這張越長越細的標準,是你團隊抄不走的護城河。

最後一句

以前,會用 AI 把東西做出來的人,領先。
現在,能證明「我判斷得準」的人,才真正領先。

當生成變得又快又便宜,稀缺的能力就從「會生產」位移到「會判斷品質,而且判斷得可靠」。一個巴西 6 人技術團隊撐起數以百萬計老師的信任,靠的不是更強的模型,是他們願意回頭把那把尺校準到能信。

下次 AI 給你一個漂亮的品質分數,先別急著開心。

先問一句:這把尺,我校準過了嗎?


協作聲明與免責

這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱;若原始出處有公開連結,會以 [來源名稱](URL) 形式附上,方便你進一步查找。若文中內容與原始出處有任何出入,請以原文為準。

內容僅供參考與學習交流,不構成任何專業、商業或投資建議,請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動,請以各官方最新公告為準。

Read more