AI 自我改進迴圈的真相:別再燒 token,第一輪就拿走大半價值,剩下都是空轉(解碼 Langfuse 實驗)

AI 自我改進迴圈真能讓 AI 越跑越好?解碼 Langfuse 實驗:自動優化的價值大半在第一輪就給你,之後是報酬遞減、空轉燒 token。台灣電商導入 AI 自動優化前,先問三個關於目標函數與停損點的問題。

AI 自我改進迴圈的真相:別再燒 token,第一輪就拿走大半價值,剩下都是空轉(解碼 Langfuse 實驗)

2026 年 6 月,整個 AI 圈被兩句話點燃。

Claude Code 的負責人 Boris Cherny 在台上說:「我已經不 prompt Claude 了,我寫的是 loop(迴圈),讓 loop 去 prompt Claude。」幾天後,OpenClaw 的作者、現在在 OpenAI 的 Peter Steinberger 在 X 上補了一刀:「你不該再去 prompt 你的 coding agent,你該設計會 prompt agent 的 loop。」這則貼文 24 小時衝破 500 萬觀看(來源:Peter Steinberger @steipete)。

一時之間,「設計迴圈,別寫提示詞」變成新的政治正確,講的其實就是把 AI 當成一個會自己跑的代理框架(agent harness)在編排,而不是一句一句下指令。

然後每個老闆的腦袋裡都冒出同一個畫面:買一套 AI,設一個會自我改進的迴圈,它就會自己越跑越聰明,自己修正、自己進步,我躺著收成果就好。

聽起來很美。

問題是,這個美夢有一個沒人跟你講的前提。而一位 Langfuse 的工程師,真的把這件事拿去跑成了實驗,結論很掃興。

先搞懂:為什麼「寫程式」可以自我改進,你的生意不行

先講一個關鍵字:目標函數(target function),白話講就是「一把能判定對錯的尺」。

Boris 和 Peter 講的迴圈,之所以在寫程式的世界跑得動,是因為程式碼有一把最乾淨的尺:這段 code 能不能編譯、能不能跑起來? 能,就是對;不能,就是錯。二元、乾脆、機器自己就能判。

有了這把尺,你確實可以讓 AI 自己跑:寫一版、跑跑看、壞了、改一版、再跑,一直到綠燈為止。你不用盯,它自己知道有沒有過關。

這就像家裡的恆溫器。

恆溫器為什麼能自己運作一整晚不用你管?因為它有一支溫度計。設定 26 度,現在 28 度,它知道要降;降到 25 度,它知道要停。它有一個清清楚楚、隨時量得到的訊號。

現在你回頭看你的生意。

「這句主打文案夠不夠吸引人?」有溫度計嗎?「這檔母親節活動企劃好不好?」有溫度計嗎?「這封 EDM(電子報)該不該這樣寫?」有溫度計嗎?

沒有。你大部分的商業決策,根本沒有那支溫度計。

有清晰訊號的恆溫器可以自我調節,沒有溫度計的商業決策讓 AI 自動迴圈空轉燒 token
有清晰訊號的恆溫器可以自我調節,沒有溫度計的商業決策讓 AI 自動迴圈空轉燒 token

Langfuse 的 Growth Engineer(成長工程師)Annabell Schäfer 在 AI Engineer World's Fair 2026 的演講《Stop Burning Tokens》裡,講的就是這件事:coding 是特例,不是通則。程式碼那把「能不能編譯」的尺,是這世界上少數幾把乾淨的尺之一。你在醫療、法遵、客服、行銷這些領域丟給 AI 的目標,不但模糊,而且永遠是不完整的(來源:Annabell Schäfer, Langfuse)。

沒有溫度計,你還硬要 AI「自我改進」,它要往哪裡改進?

它只能瞎跑。而瞎跑,是要付 token 錢的。

Langfuse 那場實驗:第一輪拿走大半,之後全是碎步

Annabell 團隊做了一件很誠實的事。他們不空口說白話,直接去找一個「最乾淨的目標函數」,把自我改進迴圈跑給你看。

他們挑的題目是:arXiv 論文分類。每篇論文的作者,會依標題和摘要幫自己的論文選一個主類別,這就是現成的正確答案(ground truth,真值)。分類對不對,一翻兩瞪眼。

實驗設計很講究,我幫你翻成生意人聽得懂的話。

他們把資料切成三堆:200 篇拿來練、100 篇拿來驗、300 篇拿來考。練的那堆讓 AI 邊做邊學,考的那堆藏起來最後才拿出來,確保 AI 不是死背答案,是真的學會(防止 overfitting,過度擬合)。

做事的 AI,是跑在 GPT-5 nano 這種又小又便宜的模型上,只給一句話的簡單提示。負責優化的,才是透過 Claude Code 動用 Claude Opus 4.8 這種前沿模型,去分析錯在哪、提出提示詞要怎麼改。停止條件設兩個:跑滿 15 輪,或準確率碰到 92%。

結果呢?

一開始準確率 68%。跑到第三、第四輪,衝到 83%(這是迭代過程中的高點)。然後就卡住了,之後一直在 80% 上下晃,最後拿去考那 300 篇「從頭到尾沒讓它看過」的題目,得到 80.2%,證明它是真學會、不是死背答案。

聽起來還不錯,15 個百分點的成長。

但真正的重點藏在細節裡:第一輪,就從 68% 跳到 78%,一口氣吃掉 10 個百分點。 後面十幾輪加起來,只多擠出幾個百分點的碎步。

你看懂這條曲線在說什麼了嗎?

自我改進迴圈的價值,絕大部分在第一次拿到清晰訊號的那一下,就已經給你了。第一刀砍得最深,之後越砍越鈍。

先講清楚,這是一場實驗、一個分類任務的結果,不是放諸四海的鐵律。但它指的方向夠明確:別預設迴圈會一路線性變聰明。

講白一點:在這場實驗裡,你跑滿 15 輪,跟第一輪就收手,成果差不了多少,差的是後面那一大筆 token 帳單。

Langfuse 自我改進迴圈實驗報酬遞減曲線:第一輪 68% 到 78% 拿走大半增益,之後 83% 高點回落約 80% plateau,測試集泛化 80.2%
Langfuse 自我改進迴圈實驗報酬遞減曲線:第一輪 68% 到 78% 拿走大半增益,之後 83% 高點回落約 80% plateau,測試集泛化 80.2%

而且還有一個更掃興的發現。就算他們挑了幾乎是全世界最乾淨的尺,準確率還是卡在 80% 上不去。你知道為什麼嗎?因為連論文作者自己選標籤,都有創作自由,同一篇論文換個人來分,可能就選了別的類。

目標函數再乾淨,都還是有內建的雜訊。

這不是 AI 不夠努力,是這件事本來就沒有 100 分的標準答案。

那大多數「連乾淨尺都沒有」的生意場景呢?更慘。因為你連讓 AI 打分的那個評分員,本身都是不穩的。同一份文案、同一個 AI 評審,你今天叫它打分和明天叫它打分,分數可能就不一樣。

這裡有個很實用的研究結論可以借。與其讓 AI 用 1 到 5 分去打一個模糊的分數,不如逼它回答「是或不是」的二元判斷。相關研究發現,光是把評分從三級改成兩級的是非題,人和 AI 判斷的一致性就能拉高大約 20 個百分點(來源:Evidently AI, LLM-as-a-judge guide)。

翻成白話:別問 AI「這篇好不好,給幾分」,改問它「這篇有沒有講錯折扣,是或不是」。

訊號乾淨,迴圈才跑得動。

你要花錢導入 AI 自動優化前,先問這三個問題

好,理論講完,回到你的電商後台。

對電商來說,重點從來不是「能不能讓 AI 自動跑」,而是「你有沒有辦法把生意上的判斷,變成一個機器量得到的訊號」。

我看過有電商把 AI 自動優化當永動機在開,設好一個「自動改文案、自動調投放」的迴圈就放著給它跑,想說反正它會自己越跑越好。結果月底一對帳,token 帳單比原本請人做省下來的錢還貴,優化出來的東西也沒特別好。

那不叫自動化,那叫燒錢。

要避免這種事,你在掏錢導入任何「AI 自我改進 / 自動優化」流程之前,先誠實回答自己三個問題。

問題一:這件事,有沒有一把能判定對錯的尺?

有清晰對錯訊號的任務,才適合交給 AI 自動跑迴圈。哪些算?商品自動分類、上架歸類、標籤歸戶、規格欄位抽取、退換貨政策的問答(答對答錯查得到)。這些都有現成的正確答案,AI 跑迴圈很划算(前提是你的商品資料夠乾淨,這也是我一直強調的AI 時代新護城河)。

哪些不算?「這句 slogan 夠不夠打動人」「這檔活動好不好玩」「這個品牌故事感不感人」。這種沒有溫度計的題目,讓 AI 自動優化就是空轉燒錢,該由你和你的人來定義什麼叫好,再想辦法把這套判斷編碼成 AI 照著做的技能包

電商任務分兩堆:有清晰對錯訊號的任務適合交給 AI 自動迴圈,沒有清晰訊號的任務該由人來定義
電商任務分兩堆:有清晰對錯訊號的任務適合交給 AI 自動迴圈,沒有清晰訊號的任務該由人來定義

問題二:我能不能靠第一個清晰訊號,就拿走大半?

記住那條曲線,第一刀砍最深。

與其讓 AI 無限迭代生 500 篇商品描述、再自己給自己打分打十幾輪,不如先設幾個乾脆的是非題關卡:這篇有沒有講錯折扣?品牌名有沒有拼錯?有沒有掰出不存在的規格或成分?

光這幾個二元檢查,第一輪就能幫你砍掉大半的錯。省下來的,正是後面那十幾輪本來要燒掉的 token。

問題三:我有沒有幫這個迴圈設一個停損點(escape hatch,逃生艙)?

任何自動優化流程,都要先設好「跑幾輪沒進步就停、把方向盤交還給人」的規則。

就像 Langfuse 那場實驗,一開始就設定「跑滿 15 輪或到 92% 就收手」,不會讓機器對著一面牆一直撞、一直燒。你的流程也一樣,別讓它跑到月底帳單爆表你才發現。

一句話收這三題:有尺、第一輪就有收益、有停損點,三個都點頭,這個迴圈才值得你開下去。

最後,講一句可能得罪人的話

這一年,太多人在比誰更敢讓 AI 自動跑。

但如果你問我,真正把 AI 用得好的人,比的不是這個。

以前大家在比誰的提示詞寫得漂亮,現在大家在比誰的迴圈設計得聰明。下一個真正拉開差距的,是另一件更不性感的事:你知不知道什麼時候,不該讓 AI 自己跑;什麼時候,該喊停。

會踩油門的人很多,會踩剎車的人才值錢。

自我改進迴圈不是永動機,它是一台很貴的引擎。你得先給它一條看得見的路(清晰訊號),它才跑得動;你還得知道,它其實在第一個彎道就跑完了大半路程,剩下的油,該省就省。

把 token 燒在刀口上,不是保守,是本事。

常見問題 FAQ

Q1:AI 自我改進迴圈(self-improvement loop)是什麼?真的能讓 AI 越跑越好嗎?

它指的是讓 AI 自己分析錯誤、自己提出修正、反覆迭代的自動化流程。它能不能越跑越好,取決於一個前提:這件事有沒有可判定對錯的清晰訊號。有訊號時效果好,而且照 Langfuse 的實驗,大半進步集中在第一輪;沒有訊號時,多半是原地空轉燒 token。

Q2:什麼是目標函數(target function)?為什麼有它 AI 才優化得起來?

目標函數就是「一把能判定對錯的尺」,像程式碼「能不能編譯」那樣二元又乾脆。AI 要自我優化,得先知道什麼叫「更好」;沒有這把尺,它不知道往哪改,只能瞎跑。

Q3:哪些電商工作適合交給 AI 自動跑迴圈,哪些不適合?

有明確對錯的適合:商品分類、標籤歸戶、規格抽取、退換貨政策問答。沒有明確對錯的不適合:文案吸不吸引人、活動企劃好不好、品牌故事感不感人,這些該由人定義。

Q4:讓 AI 自動優化,要怎麼知道什麼時候該停?

事先設好停損點(escape hatch),例如「跑滿 N 輪沒進步就停」或「準確率到某個門檻就收手」,把方向盤交還給人,別讓它對著牆一直撞、一直燒 token。

協作聲明與免責

這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱;若原始出處有公開連結,會以 `[來源名稱](URL)` 形式附上,方便你進一步查找。若文中內容與原始出處有任何出入,請以原文為準。

內容僅供參考與學習交流,不構成任何專業、商業或投資建議,請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動,請以各官方最新公告為準。

Read more