MIT 95% 生成式 AI 投資零回報:企業導入 AI 敗在哪堵牆?為什麼贏家是中型企業
95% 零回報不是說 AI 沒用。MIT 報告量的是損益表上有沒有改變,而它藏著一個幾乎沒人引用的發現:試點最多、投錢最凶的大企業,規模化反而最慢。中型企業 90 天,大企業九個月。
三四百億美元。這是麻省理工學院(MIT)NANDA 實驗室去年那份報告裡,全球企業砸進生成式 AI 的金額。
結論只有一句:95% 的組織,零回報。
這個數字後來被轉了幾萬次,變成所有唱衰 AI 的人的萬用彈藥,也變成所有賣 AI 的人拿來嚇你的開場白。我自己也轉過。
但我最近把那份報告的原文從頭到尾讀了一遍,讀完的感覺很微妙。
那個 95%,跟大家以為它在說的事情,差得有點遠。而報告裡真正有用的那一段,幾乎沒有中文內容引用過。
那一段是這樣寫的:試點數量最多、投錢最凶、團隊配得最齊的大企業,規模化的成功率最低。
換句話說,在「把 AI 真的推到全公司上線」這件事上,體型大反而拖後腿。
MIT 報告稱 95% 生成式 AI 投資零回報,那個數字到底量了什麼
先把口徑攤開。
這份報告叫《The GenAI Divide: State of AI in Business 2025》,MIT NANDA 團隊出的,主要作者是 Aditya Challapally,研究期間是 2025 年 1 到 6 月。方法是三個來源疊起來:系統性回顧 300 多個公開揭露的企業 AI 專案、對 52 家組織做結構式訪談、在四場產業會議收集 153 份高階主管問卷。
報告原文的講法是:「95% of organizations are getting zero return」,而只有 5% 的整合型試點真的產出數百萬美元等級的價值,其餘絕大多數卡在「no measurable P&L impact」,也就是損益表上量不到東西。
看清楚,它量的是損益表上有沒有量得到的改變。
它沒有在判斷 AI 有沒有用,也沒有在評模型聰不聰明。
而且報告自己在方法學那一頁寫了一段很誠實的話,我覺得每個引用這個數字的人都該一起貼上:這些數字是「directionally accurate」,方向性正確,來源是各家公司自己講的,不是查核過的財報;不同組織對「成功」的定義本來就不一樣。它對「成功導入」的定義甚至是「使用者或主管說它帶來了明顯且持續的生產力或損益影響」。
所以這是一份高品質的產業體檢,不是一份審計報告。
我為什麼要特別把這件事講清楚?因為你等一下開會,如果有人拿「MIT 說 95% 都失敗」來否決你的提案,你至少要知道這個數字沒有那麼硬。
而它旁邊那個數字,其實更硬。麥肯錫 2025 年 11 月的《The State of AI》調查裡,符合「AI 高績效者」的組織大約 6%,標準是 AI 對稅前息前利潤(EBIT)貢獻達 5% 以上、而且拿到顯著價值。兩份完全不同機構、不同方法的研究,都指向個位數。
一份可能會偏,兩份都往同一邊偏,那就要看一下了。
企業導入 AI 的共同敗因:買的人和用的人,被層層轉述隔開了
報告裡最刺的一句,是它自己下的判斷:
「The core barrier to scaling is not infrastructure, regulation, or talent. It is learning.」
規模化最大的障礙不是基礎建設、不是法規、不是人才,是「學習」。多數生成式 AI 系統不記住反饋、不吸收上下文、不會隨時間變好。
這句話翻成生意人的話是什麼?
你買回來的不是員工,是一個每天早上都會失憶的工讀生。他很聰明,但你昨天教他的事情,今天要重教一次。(這一層要怎麼補,我另外寫過 AI agent 的記憶系統怎麼設計。)
有三組數據把這堵牆的形狀畫得很清楚。
第一,試點到上線的落差。 通用型的 LLM 工具,80% 的公司評估過、50% 做過試點、40% 真的上線。但那些為特定任務打造、嵌進流程裡的 AI 工具呢?60% 評估、20% 試點、只有 5% 真的上線。愈貼近你真實業務的東西,愈死在半路。

第二,影子 AI 經濟。 只有四成公司幫員工買了官方的 LLM 訂閱。但超過九成受訪公司裡,員工回報自己固定用個人帳號的 AI 工具處理工作。報告裡有個案例我很喜歡:一家中型律所花了五萬美元買專業合約分析工具,資深律師照樣拿 ChatGPT 起草,理由很樸素,買的那個摘要太死板、沒法照她的習慣調。
公司的官方系統在空轉,員工在旁邊繞道而行,而且繞得比較快。

第三,預算投錯地方。 報告請主管做假想分配,不論用哪個口徑,銷售和行銷都拿走最大宗的 AI 預算。但實際上最戲劇性的成本節省來自後台:合約審查、採購、風控、對帳、客服工單。原因也很誠實,前台的成效好寫進董事會簡報,後台的成效不性感。
還有一個對照我覺得台灣讀者要放心裡:報告掃過的主要產業裡,只有科技與媒體電信這兩個出現明確的結構性變化,其餘的試點做了一堆,結構沒動。(順帶一提,報告自己在摘要寫「8 大產業有 2 個」、內文寫「9 個裡有 7 個沒動」,前後口徑不一致,這也是為什麼我不建議把單一數字當精準統計用。)
報告裡引了一位中型製造業營運長(COO)的話,我看到的時候笑出來:
「LinkedIn 上的風向說一切都變了,但回到我們的營運裡,沒有任何根本的東西改變。合約處理是快了一點,改變的就只有這樣。」
另一位資訊長(CIO)講得更狠:今年看了幾十場 demo,大概一兩個真的有用,剩下的是套殼跟科展作品。
順帶更正一件事。范冰在《前線部署工程師》這本書裡寫「模型不夠聰明、算力不夠便宜、技術不夠先進,都不在列」,這句話講得太滿。我對回原始報告,「模型輸出品質疑慮」其實是主管與第一線使用者票選出來的第二大障礙,僅次於「不願意採用新工具」。
但報告的解釋很值得玩味:同一批人在 ChatGPT 上用得很順、換到公司內部系統就覺得不可靠。差別不在模型,在於那個系統不記得他們是誰、不記得上次改過什麼。
所以那堵牆的本體,還是同一個。造軟體的地方,和價值產生的地方,不在同一個地方。
需求從業務單位出發,經過工單、會議紀要、週報、顧問簡報,一層一層轉述到工程師手上,每轉一次掉一層血。而客戶真正的工作流,藏在沒人寫進文件的 Excel 裡、口耳相傳的慣例裡、還有那句台灣每間公司都有的「這個要問一下阿姨」。
我在雨傘產業做了七年,工廠、品牌、百貨專櫃都待過。當年在專櫃站櫃的時候,總部發下來的陳列規範跟我實際在賣的手法,中間永遠差一段。那段差距不是誰不專業,是總部的人沒站在那個櫃位上,看不到週三下午三點客人是從哪個方向走過來的。
現在我在做電商 SaaS 的資料應用,看到的是同一件事的數位版:後台開著,儀表板每天更新,沒人看。
以前這叫做「系統上線了但沒人用」,現在這叫做「AI 專案零回報」。
換了名字,同一堵牆。
為什麼大企業導入生成式 AI,反而比中型企業慢
這是我覺得整份報告最該被台灣讀者看到、卻幾乎沒人引用的一段。
報告把年營收超過一億美元的公司定義為「大企業」。這些公司試點數量最多、投入 AI 相關的人力最多。然後:
中型企業裡的頂尖表現者,從試點到全面上線平均 90 天。大企業要九個月以上。

九個月是什麼概念?九個月足夠讓當初提案的那位主管換部門、讓模型換兩代、讓當初那個痛點自己消失。
還有一組數字更直白。報告樣本裡,透過外部策略夥伴共同開發的專案,佔了成功部署的 66%;純內部自建的佔 33%。外部夥伴的達成部署率大約 67%,自建大約 33%,整整兩倍。報告自己也很守規矩地加註:這可能反映的是組織能力本身的差異,相關不等於因果。
這裡要講清楚,報告說的「外部夥伴」不是賣你一份授權就走的廠商,是能把產品底座、現場訪談、流程調整一起帶進來的那種。差別在有沒有人真的坐到你的現場。
而「把人送到現場」這件事,本來就是有人試過的解法。
2003 年 Palantir 成立時遇到一個死結:他們要幫情報單位做軟體,但團隊裡沒人認識情報分析師,就算認識,對方也不會告訴你他平常怎麼工作。第 13 號員工 Shyam Sankar 的解法是派工程師直接住進客戶現場。2007 年前後他自己在一個實體隔離的保密室裡待了兩週,連手機都不准帶進去,只好用膠帶把電話綁在頭上,一隻耳朵聽分析師抱怨、一隻耳朵聽總部同事講話,兩隻手繼續敲程式碼,每天十九個小時。
但 Sankar 真正關鍵的動作不是那兩週,是他改了這件事在財報上的科目。在軟體業的帳本裡,「為單一客戶做客製」叫服務,是毛利率的敵人。他把它翻了過來:
現場客製不是成本,是產品發現。
效果有多實在?空中巴士(Airbus)圖盧茲工廠的 A380 燃油泵反覆故障,自家工程師查了兩年沒頭緒;Palantir 工程師進場接上感測器資料,兩週破案,原因是飛機爬升時燃油晃離了泵體。空中巴士的數位化負責人後來公開講了一句:「同樣的問題,我們以前要查二十四個月。」
這個角色現在的正式名字叫前線部署工程師(Forward Deployed Engineer,FDE)。它是什麼、為什麼變成矽谷最搶手的職位、大廠怎麼搶人,我前一篇已經完整拆過,這裡只借它的核心邏輯:解法不是把需求文件寫得更漂亮,是把需求的轉述鏈砍短。
所以這篇要接的是另一半:你請不起 FDE,怎麼辦?
在台灣講「派工程師進駐客戶端」,很多老闆第一個反應是皺眉。可以理解,我們對「工程師駐場」有一段不太好看的歷史,那基本上是人力外包的別名。范冰在書裡把這條界線劃得很清楚,我覺得值得抄下來:
駐場按工時算錢,FDE 按階段交付、按結果驗收;駐場從零寫,FDE 帶著產品底座來做工程;駐場愈駐愈久、人走系統停,FDE 做完會走、能力留在系統和客戶團隊裡。
一句話:駐場賣的是人頭,FDE 賣的是結果。
Anthropic 跟金融科技公司 FIS 合作建反洗錢的 AI agent,合作寫明的目標不是交付一套系統,是「轉移知識,讓 FIS 以後能自己建」。
顧問希望你一直需要他。做這件事的人,希望你遲早不需要他。
下次有廠商來提案,你就用這一句去問。
台灣中小企業導入 AI,真正該做的五件事
講完了,回到你的公司。
如果你的年營收沒有一億美元、公司沒有一整層樓的資訊部門、也請不起年薪三十萬美元的工程師,這份報告對你其實是好消息。因為它證明了一件事:這場比賽贏的不是資源,是離現場的距離。
台灣中小企業老闆離現場多遠?三公尺。你走出辦公室就看得到倉庫、看得到客服在回什麼、看得到會計在對哪張帳。
那九個月變成 90 天的差距,就是從這三公尺來的。
► 第一,別問「我們要導入什麼 AI」,先問「這週誰在加班」。 痛點不會出現在會議室,只出現在工作現場。挑一個具體到有名有姓的痛:不是「提升客服效率」,是「客服主管每週一早上要花三小時,從四個系統手動匯總上週的退換貨工單」。第一個問題就要具體到這種程度,後面才不會歪。
► 第二,把預算從前台挪一點到後台。 報告裡最戲劇性的節省全部發生在後台,但錢都往行銷跑。對電商來說,這代表對帳、退換貨工單分流、供應商風險提醒、庫存週轉,這些不性感的地方,回本速度比你想的快。你的行銷 AI 好寫進簡報,但你的財務長只會記得帳提早三天結完。
► 第三,用「周」當單位,不要用「月」。 給任何一個試點寫死畢業標準:幾週後、用什麼指標、達到什麼數值,達不到雙方體面散夥。范冰在書裡稱這個為最小可行部署(Minimum Viable Deployment),關鍵是縮小切口、不縮小野心。不做「全公司的智慧客服」,做「只處理退換貨這一類工單,但端到端無人干預」。六個月的「最小驗證」,最後一定會長成一個什麼都想要的大專案。
► 第四,順著人的習慣,不要順著系統的習慣。 報告裡員工最大的抗拒是「不願意採用新工具」。如果你的業務同事的核心動作發生在 LINE 和 Excel 裡,那 AI 就應該出現在 LINE 和 Excel 裡,而不是要他登入一個全新的入口。新系統最大的敵人不是舊系統,是舊習慣。
► 第五,找夥伴,但要問三個問題。 外購比自建成功率高兩倍,這個方向可以信。但你要問廠商:一、你們的產品底座是什麼(沒有底座就是純人力外包);二、上一個從客戶現場學到、然後變成你們標準功能的例子是什麼(講不出來就是每次重寫);三、專案結束以後,這個能力留在誰身上。
第三題最重要。答案如果是「留在我們身上」,你買的是依賴,不是能力。
我的判斷
那個 95% 不會維持很久。
至少在多數辦公與流程型的任務上,模型能力早就不是唯一的瓶頸了。真正在補的是讓 AI「記得住」的那一層:記憶、上下文、工具串接、agent 之間的協定。這些東西過去一年變化的速度,比模型本身還快。我寫過 AI agent 五分鐘做得出、為什麼半年上不了線,講的就是同一件事的另一面。
但基礎建設補上以後,勝負會回到一個很老派的地方。
誰真的知道現場在發生什麼事。
這件事沒辦法外包,沒辦法用預算買,也沒辦法靠開更多會議取得。它只能靠一個人,搬張椅子,坐到那個每週一早上要手動匯總四個系統的同事旁邊,看他做完一整天。
如果你問我,台灣中小企業在這一輪最大的本錢,就是這個。我們的組織夠扁、簽核鏈夠短、老闆離現場夠近。這些以前被說成「不夠制度化」的缺點,在這份報告的數據裡,全部是優勢。
別浪費了。
常見問題
Q1:MIT 那份 95% 的報告是誰做的?可信嗎?
是 MIT NANDA 實驗室 2025 年 7 月發布的《The GenAI Divide: State of AI in Business 2025》,主要作者 Aditya Challapally,研究期間 2025 年 1 到 6 月。方法是 300 多個公開專案回顧 + 52 家組織訪談 + 153 份高階主管問卷。它有參考價值,但報告自己註明數字是「方向性正確」、來自各公司自陳而非查核財報,各家對「成功」的定義也不一致。當趨勢訊號看可以,當精確統計引用要小心。
Q2:95% 零回報,是說生成式 AI 沒用嗎?
不是。它量的是損益表上有沒有量得到的改變,不是模型能力。報告明確寫了,這個落差不是模型品質或法規造成的,是做法造成的。同一份報告也指出,超過九成受訪公司的員工正在用個人帳號的 AI 工具處理工作,而且用得很順。工具有用,是公司的採購和導入方式沒把價值接進工作流。
Q3:這算是數位轉型失敗案例嗎?跟以前 ERP、CRM 上線失敗有什麼不同?
本質上是同一類失敗,換了新名字。過去的數位轉型失敗案例,典型症狀是「系統上線了但沒人用」,官方流程空轉、員工繼續用 Excel 和紙本繞道。現在的差別只有兩點:一是速度變快,五分鐘就能做出讓高層拍板的 demo,落差被放大;二是員工手上已經有一個更好用的替代品(個人帳號的 ChatGPT),所以繞道的成本比以前低很多。判斷方式也一樣:不要看系統有沒有上線,要看有沒有人改變工作方式。
Q4:企業導入 AI 案例要怎麼選第一個題目?
先找痛點,不要先找工具。挑一個具體到有名有姓、每週真實吃掉人時的問題(例如「客服主管每週一要花三小時,從四個系統手動匯總退換貨工單」),寫死驗證期限(以週為單位)和成功指標,再決定要不要買。優先看後台流程,報告顯示最明確的成本節省來自合約審查、採購、對帳、客服工單這類不性感的地方。
Q5:為什麼大企業導入生成式 AI 反而比中型企業慢?
報告數據顯示,中型企業的頂尖表現者從試點到全面上線平均 90 天,年營收破一億美元的大企業要九個月以上。原因是大企業的決策者離現場太遠,需求經過多層轉述會失真,加上採購與變更管理流程長。試點做得最多的公司,規模化成功率反而最低。
Q6:AI 工具應該自己找工程師建,還是找外部夥伴?
報告樣本裡,外部策略夥伴共同開發達成部署的比率約 67%,純內部自建約 33%,差兩倍(報告也註明相關不等於因果)。實務上的判準是問對方三件事:產品底座是什麼、最近一次從客戶現場學到並沉澱成標準功能的例子、專案結束後能力留在誰身上。第三題答案如果不是「留在你的團隊」,那你買的是依賴。
資料來源
- MIT NANDA,《The GenAI Divide: State of AI in Business 2025》(2025 年 7 月):本文所有數字與引述均對回報告全文 PDF。媒體報導可參考 Fortune,但請注意媒體轉述的樣本數(150 場訪談 / 350 份員工問卷)與報告原文自述的方法學(52 家組織訪談 / 153 份高階主管問卷 / 300+ 公開專案)口徑不同,本文採報告原文。
- McKinsey,《The State of AI》(2025 年 11 月):McKinsey QuantumBlack
- 范冰,《前線部署工程師:人工智慧時代的客戶價值交付祕籍》2026 年 7 月開源版:www.zengzhang.ai。本文中 Palantir 起源、Shyam Sankar 保密室駐場、空中巴士 A380 燃油泵、駐場與 FDE 的界線、Anthropic × FIS 知識轉移、最小可行部署等段落引自該書第 1、2 章,書中相關案例出處另見該書附錄 C。書中提及的擊斃賓拉登相關傳聞,作者自述「從未被證實,也從未被證偽」,本文不予採用。
協作聲明與免責
這篇文章由王董與 AI 一起整理製作完成。文中引用的第三方資料、研究或工具都會標註來源名稱;若原始出處有公開連結,會以 [來源名稱](URL) 形式附上,方便你進一步查找。若文中內容與原始出處有任何出入,請以原文為準。
內容僅供參考與學習交流,不構成任何專業、商業或投資建議,請依自身情況判斷並自行承擔行動風險。文中提及的工具功能、數據與平台政策可能隨時間異動,請以各官方最新公告為準。