Claude Code 準確率怎麼看?AI 八成程式碼能信嗎
文章摘要
Claude Code 準確率怎麼看?本文拆解八成程式碼與驗證成功率落差。
我自己建並指揮過一套會自我迭代的內容自動化管線(pipeline:一連串自動接力的處理流程),最大的教訓是:每一輪都看起來有在動,不代表它真的在進步——我把這種狀態叫「假性迭代」。Anthropic(Claude 背後的 AI 公司)上週發布的 Automation Index,正好是這個教訓的大型企業版。
Anthropic 宣稱,截至 2026 年 5 月的內部自測數字顯示,超過 80% 的 merged(合併後)程式碼由 Claude(Anthropic 的 AI 助手)撰寫,且計算方式未完全公開。同一份研究裡,工作階段「至少部分成功率」高達 88-92%,但通過測試驗證的「驗證成功率」只有 28-33%。在你決定要不要更積極導入 AI 工具之前,先把這兩組數字的差距弄清楚。
Anthropic 指標說什麼
2026 年 9 月 17 日,Anthropic 發布 Automation Index,由 Marina Favaro 和 Phillie Wright 撰寫——一份衡量 AI 自動化程度的自述報告。三項主要指標:
-
AI 主導的研發工作佔比:2026 年 8 月達 26%(2026 年 2 月不到 1%)
-
約 30,000 個活躍 agent(可以自己執行任務的 AI 助理)工作階段,其中 0.002% 動作被人工攔截
-
安全研究佔 AI 研發算力的 6%
「截至 2026 年 5 月,超過 80% 的程式碼由 Claude 撰寫」是這份報告最被引用的一句話。問題在於:這 80% 的具體計算方式,是 git blame(程式版本紀錄工具)的行數佔比、PR(程式碼修改提交)數量、還是邏輯變更量,Anthropic 並未完全公開,外部無從核查。
成功率怎麼看
這是這篇最核心的一個區分。Anthropic 的 Claude Code(Anthropic 的 AI 程式助手)工作階段研究,分析了約 40 萬筆 session(一次工作階段),產出兩組數字:
| 指標類型 | 中高階用戶 | 初學者 |
|---|---|---|
| 部分成功率(至少有一步完成) | 88-92% | 77% |
| 驗證成功率(通過測試或有具體完成證據) | 28-33% | 約 15% |
媒體廣泛引用的 88-92%,對應的是「至少部分完成」。通過測試或有可確認完成證據,那個數字是 28-33%。選擇哪一個數字當主標題,本身就是一個立場。
這不是說 Anthropic 在造假。但當你評估某個 AI coding 工具的「成功率」時,第一個問題應該是:這個成功率衡量的是什麼——是「至少做了一些事」,還是「問題確實被解決了」?
外部數據怎麼看
用了 AI 反而更慢
METR(獨立 AI 安全評估機構)做了一個隨機對照實驗(RCT:雙盲設計、結果不受預期影響的研究方法):16 名資深開源開發者,在自己維護的真實程式碼庫(codebase)上完成 246 個任務。使用 AI 工具的任務,比禁用 AI 的任務慢了 19%(信賴區間:+2% 到 +39%)。
同一批開發者事後估計 AI 讓他們快了 20%——感知與實測差距高達 39 個百分點。
要注意的是:METR 的樣本只有 16 人,研究時間點是 2025 年初,使用的工具是 Cursor Pro + Claude 3.5 Sonnet,不等於現在所有 AI coding 工具的狀況。結論是:「感覺 AI 讓我更快」本身不能當成生產力提升的佐證,而 Anthropic 的部分指標正依賴使用者主觀感知。
PR 量不等於交付量
Faros AI(開發者生產力數據商)覆蓋 22,000 名開發者的遙測數據顯示:AI 採用率高的團隊,中位 PR(程式碼修改提交)審查時間上升 441%,31% 的 PR 在無人審查的情況下合併——技術債(累積下來的品質問題)隱憂不小。
台灣媒體 TechOrange 報導:台北某 SaaS(軟體即服務)技術主管團隊導入 AI coding agent(可以自己執行程式任務的 AI 助理)後,PR 量增至 3 倍,但上線功能數僅增加不到 50%;AI 生成程式碼的 30 天留存率不到 30%。
這直接挑戰「工程師每日吸收的 merged 程式碼量是兩年前的 8 倍」的論述——8 倍程式碼量,不等於 8 倍有效交付。
Claude 自評 Claude
Anthropic 坦承,Automation Index 的部分評分由 Claude 擔任評分員,也就是 AI 評自己的工作。研究學術誠信聯盟 CASRAI 明確指出:所有數字尚無第三方獨立驗證。
這不代表數字是假的,但它是公司自我揭露的聲明,而非可被外部審計的量測。看到這類自測數字時,「有沒有第三方驗證」比「數字本身是多少」更值得先問。
安全宣示與商業訊號
Anthropic 執行長 Dario Amodei 在 Automation Index 發布五天前,發文呼籲前沿 AI 應謹慎減速。五天後,公司公布自家 AI 研發自動化佔比從不到 1% 飆到 26%。
可以理解「要先跑在前面,才有能力制定規則」的邏輯。但讀者需要意識到:這份 Automation Index 同時是安全透明度披露,也是對外展示技術領先地位的商業信號——Anthropic 在這件事上有明確的利害關係。目前只有動機上的合理懷疑,沒有直接證據指向主動誤導,但發布動機值得讀者自己判斷。
傳統指標為何失效
arXiv(學術預印本平台)論文《The Substrate Collapse》(2606.20882)論證:AI 大量生成程式碼後,以程式碼作者身份為基礎的傳統指標——提交次數、程式碼行數、PR 數——根本失效。「誰寫了這行程式碼」已無法對應「誰有這個知識、做了這個決策」。Nicole Forsgren(DORA/SPACE 開發者生產力指標創始人)也指出,AI 讓傳統指標系統性失真。Anthropic 的 80%「authored code」指標,正依賴這個已被動搖的「作者」概念。
替代指標的三個方向:
邏輯變更量(logical code change):扣掉 AI 膨風行數——AI 動輒生出幾千行 diff(差異比對),但真正的邏輯改動可能只有幾行——之後,實際變動了多少邏輯。度量衡要換。
程式碼留存率(code durability):AI 生成的程式碼,30 天後還有多少留在程式碼庫裡。台灣 SaaS 案例顯示不到 30%。
問題收斂率:同樣的問題有沒有在後續輪次真的消失。
我的三道驗證
我做了一條會自我迭代的內容自動化管線——每天跑完自己評分、自己改、再重跑。有一次,管線每個步驟都顯示成功,日誌也很乾淨,但下一輪又出現完全一樣的問題。
那次讓我確認:必須凍結一個動不了的基線(baseline:固定不變的對照版本)當對照組,否則永遠分不清是真的變好,還是一起漂移。量會騙人,每輪都有在動不代表在進步。
這三道問題,從那段自建自動迭代系統的踩坑經驗蒸餾出來,放回去看 Anthropic 的 Automation Index 同樣成立:
第一道:有沒有凍結基線當對照組?
沒有一個動不了的對照組,你永遠分不清「變好」還是「一起漂移」。Anthropic 的 26% R&D 自動化率從不到 1% 長上來,但中間有沒有保留固定的對照版本,從外部看不出來。
第二道:衡量的是邏輯變更,還是膨風行數?
「80% 程式碼由 Claude 撰寫」如果是行數算法,就要先問:有多少行是 AI 為了補格式或增加可讀性而膨脹的?真正的邏輯改動佔多少?
第三道:問題有沒有真的收斂?
每輪都有在動,不代表在迭代——假性迭代的徵兆是同一個問題反覆出現。Automation Index 可以量化 AI 產了多少、動了多少,但它沒有回答「問題有沒有真的在消失」這道最根本的問題。
用這三道問題去評估任何 AI 工具的生產力宣稱,比看宣傳數字大小更可靠。
現在可以問自己三個問題:你的 AI 工具有沒有一個凍結的基線當對照?你在看的是邏輯變更量還是產出量?上一輪出現的問題,這一輪有沒有真的消失?
常見問題
-
Claude Code 好用嗎? 值得用,但衡量方式要換。不要只看 session(工作階段)完成率,要看你提的問題有沒有在後續輪次消失。初學者驗證成功率只有 15%,意思是大多數任務需要幾次迭代才到位,但這不代表沒用,代表要有迭代的心態。
-
AI 生產力提升真的嗎? 感知提升很普遍(METR 研究裡所有開發者都覺得快了),但 RCT 實測顯示 16 位資深開源開發者用了反而慢 19%。兩件事可以同時為真:感覺對、量測方法錯。換到邏輯變更量、問題收斂率這類指標,才能拿到可靠答案。
-
Anthropic 的 80% 數字是真的嗎? Anthropic 本人說是 2026 年 5 月的時間快照、自測數字、計算方式未完全公開。它不是「持續監控指標」也不是「第三方驗證結果」。這個數字不是假的,但使用脈絡需要你自己判斷。
-
什麼指標比較可靠? 邏輯變更量(扣掉膨風行數後真正的邏輯改動)、程式碼留存率(30 天後還在不在)、問題收斂率(同樣的問題有沒有消失)。這三個指標比 PR 數、行數、session 完成率更能反映 AI 帶來的真實改變。
重整開頭,先講結論統一成功率與驗證定義刪減重複的驗證段落