> ## Content Index
> Fetch the complete content index at: https://growthhackers.tw/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI 自我改進迴圈的真相：別再燒 token，第一輪就拿走大半價值，剩下都是空轉（解碼 Langfuse 實驗）
- URL: https://growthhackers.tw/blog/ai-self-improvement-target-function/
- Published: 2026-07-26T13:00:00.000Z
- Updated: 2026-07-26T13:00:00.000Z
- Description: AI 自我改進迴圈真能讓 AI 越跑越好？解碼 Langfuse 實驗：自動優化的價值大半在第一輪就給你，之後是報酬遞減、空轉燒 token。台灣電商導入 AI 自動優化前，先問三個關於目標函數與停損點的問題。
- Author: Lewis wang
- Tags: AI agent, AI 自我改進, LLM 評測, AI 導入, 電商經營

2026 年 6 月，整個 AI 圈被兩句話點燃。

Claude Code 的負責人 Boris Cherny 在台上說：「我已經不 prompt Claude 了，我寫的是 loop（迴圈），讓 loop 去 prompt Claude。」幾天後，OpenClaw 的作者、現在在 OpenAI 的 Peter Steinberger 在 X 上補了一刀：「你不該再去 prompt 你的 coding agent，你該設計會 prompt agent 的 loop。」這則貼文 24 小時衝破 500 萬觀看（來源：[Peter Steinberger @steipete](https://x.com/steipete/status/2063697162748260627?ref=growthhackers.tw)）。

一時之間，「設計迴圈，別寫提示詞」變成新的政治正確，講的其實就是把 AI 當成一個[會自己跑的代理框架（agent harness）](https://growthhackers.tw/blog/what-is-agent-harness/)在編排，而不是一句一句下指令。

然後每個老闆的腦袋裡都冒出同一個畫面：買一套 AI，設一個會自我改進的迴圈，它就會自己越跑越聰明，自己修正、自己進步，我躺著收成果就好。

聽起來很美。

問題是，這個美夢有一個沒人跟你講的前提。而一位 Langfuse 的工程師，真的把這件事拿去跑成了實驗，結論很掃興。

## 先搞懂：為什麼「寫程式」可以自我改進，你的生意不行

先講一個關鍵字：目標函數（target function），白話講就是「一把能判定對錯的尺」。

Boris 和 Peter 講的迴圈，之所以在寫程式的世界跑得動，是因為程式碼有一把最乾淨的尺：**這段 code 能不能編譯、能不能跑起來？** 能，就是對；不能，就是錯。二元、乾脆、機器自己就能判。

有了這把尺，你確實可以讓 AI 自己跑：寫一版、跑跑看、壞了、改一版、再跑，一直到綠燈為止。你不用盯，它自己知道有沒有過關。

這就像家裡的恆溫器。

恆溫器為什麼能自己運作一整晚不用你管？因為它有一支溫度計。設定 26 度，現在 28 度，它知道要降；降到 25 度，它知道要停。它有一個清清楚楚、隨時量得到的訊號。

現在你回頭看你的生意。

「這句主打文案夠不夠吸引人？」有溫度計嗎？「這檔母親節活動企劃好不好？」有溫度計嗎？「這封 EDM（電子報）該不該這樣寫？」有溫度計嗎？

沒有。你大部分的商業決策，根本沒有那支溫度計。

![有清晰訊號的恆溫器可以自我調節，沒有溫度計的商業決策讓 AI 自動迴圈空轉燒 token](https://growthhackers.tw/content/images/2026/07/aistf-inline-signal.png)

有清晰訊號的恆溫器可以自我調節，沒有溫度計的商業決策讓 AI 自動迴圈空轉燒 token

Langfuse 的 Growth Engineer（成長工程師）Annabell Schäfer 在 AI Engineer World's Fair 2026 的演講《Stop Burning Tokens》裡，講的就是這件事：coding 是特例，不是通則。程式碼那把「能不能編譯」的尺，是這世界上少數幾把乾淨的尺之一。你在醫療、法遵、客服、行銷這些領域丟給 AI 的目標，不但模糊，而且永遠是不完整的（來源：[Annabell Schäfer, Langfuse](https://www.youtube.com/watch?v=eAXxdtNlK04&ref=growthhackers.tw)）。

沒有溫度計，你還硬要 AI「自我改進」，它要往哪裡改進？

它只能瞎跑。而瞎跑，是要付 token 錢的。

## Langfuse 那場實驗：第一輪拿走大半，之後全是碎步

Annabell 團隊做了一件很誠實的事。他們不空口說白話，直接去找一個「最乾淨的目標函數」，把自我改進迴圈跑給你看。

他們挑的題目是：arXiv 論文分類。每篇論文的作者，會依標題和摘要幫自己的論文選一個主類別，這就是現成的正確答案（ground truth，真值）。分類對不對，一翻兩瞪眼。

實驗設計很講究，我幫你翻成生意人聽得懂的話。

他們把資料切成三堆：200 篇拿來練、100 篇拿來驗、300 篇拿來考。練的那堆讓 AI 邊做邊學，考的那堆藏起來最後才拿出來，確保 AI 不是死背答案，是真的學會（防止 overfitting，過度擬合）。

做事的 AI，是跑在 GPT-5 nano 這種又小又便宜的模型上，只給一句話的簡單提示。負責優化的，才是透過 Claude Code 動用 Claude Opus 4.8 這種前沿模型，去分析錯在哪、提出提示詞要怎麼改。停止條件設兩個：跑滿 15 輪，或準確率碰到 92%。

結果呢？

一開始準確率 68%。跑到第三、第四輪，衝到 83%（這是迭代過程中的高點）。然後就卡住了，之後一直在 80% 上下晃，最後拿去考那 300 篇「從頭到尾沒讓它看過」的題目，得到 80.2%，證明它是真學會、不是死背答案。

聽起來還不錯，15 個百分點的成長。

但真正的重點藏在細節裡：**第一輪，就從 68% 跳到 78%，一口氣吃掉 10 個百分點。** 後面十幾輪加起來，只多擠出幾個百分點的碎步。

你看懂這條曲線在說什麼了嗎？

自我改進迴圈的價值，絕大部分在第一次拿到清晰訊號的那一下，就已經給你了。第一刀砍得最深，之後越砍越鈍。

先講清楚，這是一場實驗、一個分類任務的結果，不是放諸四海的鐵律。但它指的方向夠明確：別預設迴圈會一路線性變聰明。

講白一點：在這場實驗裡，你跑滿 15 輪，跟第一輪就收手，成果差不了多少，差的是後面那一大筆 token 帳單。

![Langfuse 自我改進迴圈實驗報酬遞減曲線：第一輪 68% 到 78% 拿走大半增益，之後 83% 高點回落約 80% plateau，測試集泛化 80.2%](https://growthhackers.tw/content/images/2026/07/aistf-inline-curve.png)

Langfuse 自我改進迴圈實驗報酬遞減曲線：第一輪 68% 到 78% 拿走大半增益，之後 83% 高點回落約 80% plateau，測試集泛化 80.2%

而且還有一個更掃興的發現。就算他們挑了幾乎是全世界最乾淨的尺，準確率還是卡在 80% 上不去。你知道為什麼嗎？因為連論文作者自己選標籤，都有創作自由，同一篇論文換個人來分，可能就選了別的類。

目標函數再乾淨，都還是有內建的雜訊。

這不是 AI 不夠努力，是這件事本來就沒有 100 分的標準答案。

那大多數「連乾淨尺都沒有」的生意場景呢？更慘。因為你連讓 AI 打分的那個評分員，本身都是不穩的。同一份文案、同一個 AI 評審，你今天叫它打分和明天叫它打分，分數可能就不一樣。

這裡有個很實用的研究結論可以借。與其讓 AI 用 1 到 5 分去打一個模糊的分數，不如逼它回答「是或不是」的二元判斷。相關研究發現，光是把評分從三級改成兩級的是非題，人和 AI 判斷的一致性就能拉高大約 20 個百分點（來源：[Evidently AI, LLM-as-a-judge guide](https://www.evidentlyai.com/llm-guide/llm-as-a-judge?ref=growthhackers.tw)）。

翻成白話：別問 AI「這篇好不好，給幾分」，改問它「這篇有沒有講錯折扣，是或不是」。

訊號乾淨，迴圈才跑得動。

## 你要花錢導入 AI 自動優化前，先問這三個問題

好，理論講完，回到你的電商後台。

對電商來說，重點從來不是「能不能讓 AI 自動跑」，而是「你有沒有辦法把生意上的判斷，變成一個機器量得到的訊號」。

我看過有電商把 AI 自動優化當永動機在開，設好一個「自動改文案、自動調投放」的迴圈就放著給它跑，想說反正它會自己越跑越好。結果月底一對帳，token 帳單比原本請人做省下來的錢還貴，優化出來的東西也沒特別好。

那不叫自動化，那叫燒錢。

要避免這種事，你在掏錢導入任何「AI 自我改進 / 自動優化」流程之前，先誠實回答自己三個問題。

### 問題一：這件事，有沒有一把能判定對錯的尺？

有清晰對錯訊號的任務，才適合交給 AI 自動跑迴圈。哪些算？商品自動分類、上架歸類、標籤歸戶、規格欄位抽取、退換貨政策的問答（答對答錯查得到）。這些都有現成的正確答案，AI 跑迴圈很划算（前提是你的商品資料夠乾淨，這也是我一直強調的[AI 時代新護城河](https://growthhackers.tw/blog/ai-agent-first-party-data-moat/)）。

哪些不算？「這句 slogan 夠不夠打動人」「這檔活動好不好玩」「這個品牌故事感不感人」。這種沒有溫度計的題目，讓 AI 自動優化就是空轉燒錢，該由你和你的人來定義什麼叫好，再想辦法把這套判斷[編碼成 AI 照著做的技能包](https://growthhackers.tw/blog/agent-skills-andrew-ng-course/)。

![電商任務分兩堆：有清晰對錯訊號的任務適合交給 AI 自動迴圈，沒有清晰訊號的任務該由人來定義](https://growthhackers.tw/content/images/2026/07/aistf-inline-buckets.png)

電商任務分兩堆：有清晰對錯訊號的任務適合交給 AI 自動迴圈，沒有清晰訊號的任務該由人來定義

### 問題二：我能不能靠第一個清晰訊號，就拿走大半？

記住那條曲線，第一刀砍最深。

與其讓 AI 無限迭代生 500 篇商品描述、再自己給自己打分打十幾輪，不如先設幾個乾脆的是非題關卡：這篇有沒有講錯折扣？品牌名有沒有拼錯？有沒有掰出不存在的規格或成分？

光這幾個二元檢查，第一輪就能幫你砍掉大半的錯。省下來的，正是後面那十幾輪本來要燒掉的 token。

### 問題三：我有沒有幫這個迴圈設一個停損點（escape hatch，逃生艙）？

任何自動優化流程，都要先設好「跑幾輪沒進步就停、把方向盤交還給人」的規則。

就像 Langfuse 那場實驗，一開始就設定「跑滿 15 輪或到 92% 就收手」，不會讓機器對著一面牆一直撞、一直燒。你的流程也一樣，別讓它跑到月底帳單爆表你才發現。

一句話收這三題：有尺、第一輪就有收益、有停損點，三個都點頭，這個迴圈才值得你開下去。

## 最後，講一句可能得罪人的話

這一年，太多人在比誰更敢讓 AI 自動跑。

但如果你問我，真正把 AI 用得好的人，比的不是這個。

以前大家在比誰的提示詞寫得漂亮，現在大家在比誰的迴圈設計得聰明。下一個真正拉開差距的，是另一件更不性感的事：你知不知道什麼時候，不該讓 AI 自己跑；什麼時候，該喊停。

會踩油門的人很多，會踩剎車的人才值錢。

自我改進迴圈不是永動機，它是一台很貴的引擎。你得先給它一條看得見的路（清晰訊號），它才跑得動；你還得知道，它其實在第一個彎道就跑完了大半路程，剩下的油，該省就省。

把 token 燒在刀口上，不是保守，是本事。

## 常見問題 FAQ

### Q1：AI 自我改進迴圈（self-improvement loop）是什麼？真的能讓 AI 越跑越好嗎？

它指的是讓 AI 自己分析錯誤、自己提出修正、反覆迭代的自動化流程。它能不能越跑越好，取決於一個前提：這件事有沒有可判定對錯的清晰訊號。有訊號時效果好，而且照 Langfuse 的實驗，大半進步集中在第一輪；沒有訊號時，多半是原地空轉燒 token。

### Q2：什麼是目標函數（target function）？為什麼有它 AI 才優化得起來？

目標函數就是「一把能判定對錯的尺」，像程式碼「能不能編譯」那樣二元又乾脆。AI 要自我優化，得先知道什麼叫「更好」；沒有這把尺，它不知道往哪改，只能瞎跑。

### Q3：哪些電商工作適合交給 AI 自動跑迴圈，哪些不適合？

有明確對錯的適合：商品分類、標籤歸戶、規格抽取、退換貨政策問答。沒有明確對錯的不適合：文案吸不吸引人、活動企劃好不好、品牌故事感不感人，這些該由人定義。

### Q4：讓 AI 自動優化，要怎麼知道什麼時候該停？

事先設好停損點（escape hatch），例如「跑滿 N 輪沒進步就停」或「準確率到某個門檻就收手」，把方向盤交還給人，別讓它對著牆一直撞、一直燒 token。

### 協作聲明與免責

這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱；若原始出處有公開連結，會以 \`\[來源名稱\](URL)\` 形式附上，方便你進一步查找。若文中內容與原始出處有任何出入，請以原文為準。

內容僅供參考與學習交流，不構成任何專業、商業或投資建議，請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動，請以各官方最新公告為準。