Claude Code 模型怎麼選?Sonnet 5.5 該換嗎
文章摘要
Claude Code 模型怎麼選?本文拆解 Sonnet 5.5 成本、省幅與任務格位
Sonnet 5.5 於 2026-09-28 發布,我確認的第一件事是:Claude Code(Anthropic 的 AI 程式開發工具)和 API(程式串接介面)的定價沒動。做了幾年的自動化分派,我的紀律一直是從最小夠用開始選模型,所以我不問「要全換嗎」,我問「工作流裡哪個格位換了划算」。
第三方實測給了一個具體答案:Lovable(AI 應用開發平台)技術長 Fabian Hedin 測出來,完成同樣的 coding(程式開發)任務,外部工具呼叫少了三分之一、命令列步驟少了一半。省的不是 token(AI 計費最小單位)單價,是你的工作流走的路徑。
省 30% 省在哪
「每任務成本降 30%」的說法常被誤讀成「token 變便宜了」。Anthropic(Claude 背後的 AI 公司)官方公告明確寫:API 定價維持 $2/$10 per 1M tokens 不變。省的機制是行為效率:Sonnet 5.5 完成同一件事呼叫外部工具的次數變少,每避免一次 tool call(外部工具呼叫),就少一次網路往返與 context(對話記憶)增長。
| 官方宣稱 | 第三方實測 |
|---|---|
| 每任務成本降最多 30% | Lovable CTO:tool calls 少 1/3、shell executions(命令列執行)少一半 |
| 速度提升 30%+ | GitHub Copilot(GitHub 的 AI 程式輔助工具)changelog:完成同等任務步驟更少(同日上架) |
| Terminal-Bench(跑分測試)4.0:70.6% | 測試力道是 Max effort(最大運算力道),Opus 5.5(Anthropic 高階模型)的 66.4% 是 Xhigh effort(次高力道)——條件不同,不能直接比 |
官方的 30% 是 Anthropic 自家工作負載量出來的,不是通用值。你自己的工作流省多少,要用自己的任務量測。
Sonnet 贏 Opus 嗎
Terminal-Bench 4.0 上,Sonnet 5.5 拿 70.6%,Opus 5.5 是 66.4%,標題看起來 Sonnet「打敗」了高階模型。但這兩個數字用的測試力道不一樣:Sonnet 5.5 是 Max effort,Opus 5.5 是 Xhigh effort,測試條件不同,直接比較數字會誤導判斷。
Artificial Analysis(獨立 AI 評測機構)的 Intelligence Index(能力評比指數)給了更清楚的圖像:Opus 5.5 = 58,Sonnet 5 = 38,差距約 20 分。中等難度任務 Sonnet 5.5 確實大幅追近 Opus,但深度推理、複雜多步任務這些格位,Opus 5.5 仍有明顯優勢。
跑分數字是給人看爽的,格位判斷才是你真正需要的。這不是說 Sonnet 5.5 不夠好,是說「哪個格位適合它」才是對的問題。
省幅要怎麼量
Orca Router(獨立技術分析平台)指出,正確的量法是 task-level cost(任務層成本),不是 per-request(每次請求)計算。如果用 per-request 平均,可能完全看不到省幅。正確的量測步驟如下:
-
挑 25–50 個代表性任務:從你實際工作流裡最常跑的任務挑出來,要能代表真實使用情境
-
記錄每個任務的 first-pass success(一次通過率)、total tokens(總計費量)、retries(重試次數)、latency(回應時間)
-
算 cost per accepted result(每個被接受結果的成本),不是 cost per request 平均值
Anthropic 自家工作負載算出來是 30%,你的工作流可能更省、也可能更少。套你自己的代表性任務量才知道真正的省幅落點。
任務格位怎麼分
以下是可以直接套用的格位對照:
| 任務類型 | 推薦模型 | 說明 |
|---|---|---|
| 搬數據、純程式腳本 | 不進模型 | 純計算任務不需要 LLM(大型語言模型) |
| 日常文件、bug(程式缺陷)修正、spec 翻譯、feature(功能)草稿 | Sonnet 5.5 | 甜蜜點,官方確認 + GitHub Copilot 同日上架佐證 |
| 低頻深度診斷、安全敏感決策 | Opus 5.5 | HLE(推理評測)低 7.5 分、ProgramBench(程式碼評測)低 11.5 分 |
| 跨多檔重大重構、模糊需求 | Opus 5.5 | CodeRabbit(獨立程式碼審查平台)測評顯示有命名一致性問題 |
Opus 5.5 的 API 定價是 Sonnet 5.5 的兩倍($4/$20 vs $2/$10 per 1M tokens)。在低頻診斷格位多花兩倍是值得的;日常任務格位用兩倍的錢沒有對應回報,那格換 Sonnet 5.5 就是划算的。
我的分派紀律
課程裡我教的框架是「選路看需求不看程度」:工具不是越強越好,是放對格位才值錢。我自己的分派紀律是這樣設計的:搬數據、跑批次,走純程式不進模型;spec 翻譯、日常 bug 修正、feature 草稿,交中階;低頻的複雜診斷和安全判斷,才排高階 Opus。
Sonnet 5.5 出來後,中階那一格的性價比更好了。我不需要全換、也不需要觀望,按這套分派紀律走,答案本來就清楚。每百萬 token 換回多少有效產能,才是值得管理的數字。官方宣稱的 30% 是測試環境的結果,你自己的任務用自己的紀律量才準。
先確認模型設定
切換 Sonnet 5.5 之前,有一步很多人跳過:確認你的 Claude Code 現在跑的是哪個模型。
Claudefa 技術部落格觀察指出,Claude Code v2.1.280 的預設仍是 Opus 5.5;Sonnet 5.5 是新增的可用選項,而不是取代了預設。如果沒有手動切換,可能你以為在用新的、其實還在跑 Opus,成本和速度完全沒有改變。確認方法因版本而異,建議在 Claude Code 設定介面手動查看目前使用的模型,再評估省幅。
Claude Code 怎麼選
選模型值不值得換,核心可以壓成一句話:新模型省不省錢,不看官方跑分和標題數字,看你自己的工作流裡有幾格換了真的有差。
自我檢查:
-
我的工作流裡,哪些任務屬於日常中階(bug 修正、spec 翻譯、feature 草稿)?
-
哪些任務屬於低頻高難度(安全敏感、跨多檔重構、複雜架構診斷)?
-
我有確認 Claude Code 目前使用的是哪個模型嗎?
常見問題
-
Claude Sonnet 5.5 值得升級嗎? 如果你有日常中階 coding 任務(bug 修正、spec 翻譯、feature 草稿),現在就值得在那個格位切換。深度診斷和安全敏感任務繼續留 Opus 5.5,不要整個工作流一次全換。
-
Sonnet 5.5 跟 Opus 5.5 差在哪? Artificial Analysis 的 Intelligence Index:Opus 58,Sonnet 38,深度推理和複雜多步任務 Opus 5.5 仍有約 20 分優勢。中等難度任務 Sonnet 5.5 已接近 Opus 水準,且速度更快、定價是 Opus 的一半($2/$10 vs $4/$20 per 1M tokens)。
-
Claude Code 要用 Sonnet 還是 Opus? 依任務格位:日常任務用 Sonnet 5.5,低頻診斷用 Opus 5.5。先確認你的 Claude Code 設定,預設可能仍是 Opus 5.5,沒手動切換就不會自動享受到新版的速度與效率。
-
30% 省幅是固定的嗎? 不是固定值。Anthropic 的 30% 是他們自家工作負載的量測,你的工作流省幅需要自己量(replay 25–50 個代表性任務,算 cost per accepted result,不是 per-request 平均)。
-
Sonnet 5.5 適合寫安全敏感的程式碼嗎? 不建議獨立使用。CodeRabbit 測評指出安全敏感程式碼需要更徹底的人工審查;這個格位建議留 Opus 5.5,並確保有完整的人工審核流程。
補上清楚的切換行動步驟統一模型名稱與比較範圍