Danny

Claude Code 模型怎麼選?Sonnet 5.5 該換嗎

文章摘要

Claude Code 模型怎麼選?本文拆解 Sonnet 5.5 成本、省幅與任務格位

Sonnet 5.5 於 2026-09-28 發布,我確認的第一件事是:Claude Code(Anthropic 的 AI 程式開發工具)和 API(程式串接介面)的定價沒動。做了幾年的自動化分派,我的紀律一直是從最小夠用開始選模型,所以我不問「要全換嗎」,我問「工作流裡哪個格位換了划算」。

第三方實測給了一個具體答案:Lovable(AI 應用開發平台)技術長 Fabian Hedin 測出來,完成同樣的 coding(程式開發)任務,外部工具呼叫少了三分之一、命令列步驟少了一半。省的不是 token(AI 計費最小單位)單價,是你的工作流走的路徑。

省 30% 省在哪

「每任務成本降 30%」的說法常被誤讀成「token 變便宜了」。Anthropic(Claude 背後的 AI 公司)官方公告明確寫:API 定價維持 $2/$10 per 1M tokens 不變。省的機制是行為效率:Sonnet 5.5 完成同一件事呼叫外部工具的次數變少,每避免一次 tool call(外部工具呼叫),就少一次網路往返與 context(對話記憶)增長。

官方宣稱 第三方實測
每任務成本降最多 30% Lovable CTO:tool calls 少 1/3、shell executions(命令列執行)少一半
速度提升 30%+ GitHub Copilot(GitHub 的 AI 程式輔助工具)changelog:完成同等任務步驟更少(同日上架)
Terminal-Bench(跑分測試)4.0:70.6% 測試力道是 Max effort(最大運算力道),Opus 5.5(Anthropic 高階模型)的 66.4% 是 Xhigh effort(次高力道)——條件不同,不能直接比

官方的 30% 是 Anthropic 自家工作負載量出來的,不是通用值。你自己的工作流省多少,要用自己的任務量測。

Sonnet 贏 Opus 嗎

Terminal-Bench 4.0 上,Sonnet 5.5 拿 70.6%,Opus 5.5 是 66.4%,標題看起來 Sonnet「打敗」了高階模型。但這兩個數字用的測試力道不一樣:Sonnet 5.5 是 Max effort,Opus 5.5 是 Xhigh effort,測試條件不同,直接比較數字會誤導判斷。

Artificial Analysis(獨立 AI 評測機構)的 Intelligence Index(能力評比指數)給了更清楚的圖像:Opus 5.5 = 58,Sonnet 5 = 38,差距約 20 分。中等難度任務 Sonnet 5.5 確實大幅追近 Opus,但深度推理、複雜多步任務這些格位,Opus 5.5 仍有明顯優勢。

跑分數字是給人看爽的,格位判斷才是你真正需要的。這不是說 Sonnet 5.5 不夠好,是說「哪個格位適合它」才是對的問題。

省幅要怎麼量

Orca Router(獨立技術分析平台)指出,正確的量法是 task-level cost(任務層成本),不是 per-request(每次請求)計算。如果用 per-request 平均,可能完全看不到省幅。正確的量測步驟如下:

  1. 挑 25–50 個代表性任務:從你實際工作流裡最常跑的任務挑出來,要能代表真實使用情境

  2. 記錄每個任務的 first-pass success(一次通過率)、total tokens(總計費量)、retries(重試次數)、latency(回應時間)

  3. 算 cost per accepted result(每個被接受結果的成本),不是 cost per request 平均值

Anthropic 自家工作負載算出來是 30%,你的工作流可能更省、也可能更少。套你自己的代表性任務量才知道真正的省幅落點。

任務格位怎麼分

以下是可以直接套用的格位對照:

任務類型 推薦模型 說明
搬數據、純程式腳本 不進模型 純計算任務不需要 LLM(大型語言模型)
日常文件、bug(程式缺陷)修正、spec 翻譯、feature(功能)草稿 Sonnet 5.5 甜蜜點,官方確認 + GitHub Copilot 同日上架佐證
低頻深度診斷、安全敏感決策 Opus 5.5 HLE(推理評測)低 7.5 分、ProgramBench(程式碼評測)低 11.5 分
跨多檔重大重構、模糊需求 Opus 5.5 CodeRabbit(獨立程式碼審查平台)測評顯示有命名一致性問題

Opus 5.5 的 API 定價是 Sonnet 5.5 的兩倍($4/$20 vs $2/$10 per 1M tokens)。在低頻診斷格位多花兩倍是值得的;日常任務格位用兩倍的錢沒有對應回報,那格換 Sonnet 5.5 就是划算的。

我的分派紀律

課程裡我教的框架是「選路看需求不看程度」:工具不是越強越好,是放對格位才值錢。我自己的分派紀律是這樣設計的:搬數據、跑批次,走純程式不進模型;spec 翻譯、日常 bug 修正、feature 草稿,交中階;低頻的複雜診斷和安全判斷,才排高階 Opus。

Sonnet 5.5 出來後,中階那一格的性價比更好了。我不需要全換、也不需要觀望,按這套分派紀律走,答案本來就清楚。每百萬 token 換回多少有效產能,才是值得管理的數字。官方宣稱的 30% 是測試環境的結果,你自己的任務用自己的紀律量才準。

先確認模型設定

切換 Sonnet 5.5 之前,有一步很多人跳過:確認你的 Claude Code 現在跑的是哪個模型。

Claudefa 技術部落格觀察指出,Claude Code v2.1.280 的預設仍是 Opus 5.5;Sonnet 5.5 是新增的可用選項,而不是取代了預設。如果沒有手動切換,可能你以為在用新的、其實還在跑 Opus,成本和速度完全沒有改變。確認方法因版本而異,建議在 Claude Code 設定介面手動查看目前使用的模型,再評估省幅。

Claude Code 怎麼選

選模型值不值得換,核心可以壓成一句話:新模型省不省錢,不看官方跑分和標題數字,看你自己的工作流裡有幾格換了真的有差。

自我檢查:

  • 我的工作流裡,哪些任務屬於日常中階(bug 修正、spec 翻譯、feature 草稿)?

  • 哪些任務屬於低頻高難度(安全敏感、跨多檔重構、複雜架構診斷)?

  • 我有確認 Claude Code 目前使用的是哪個模型嗎?

常見問題

  • Claude Sonnet 5.5 值得升級嗎? 如果你有日常中階 coding 任務(bug 修正、spec 翻譯、feature 草稿),現在就值得在那個格位切換。深度診斷和安全敏感任務繼續留 Opus 5.5,不要整個工作流一次全換。

  • Sonnet 5.5 跟 Opus 5.5 差在哪? Artificial Analysis 的 Intelligence Index:Opus 58,Sonnet 38,深度推理和複雜多步任務 Opus 5.5 仍有約 20 分優勢。中等難度任務 Sonnet 5.5 已接近 Opus 水準,且速度更快、定價是 Opus 的一半($2/$10 vs $4/$20 per 1M tokens)。

  • Claude Code 要用 Sonnet 還是 Opus? 依任務格位:日常任務用 Sonnet 5.5,低頻診斷用 Opus 5.5。先確認你的 Claude Code 設定,預設可能仍是 Opus 5.5,沒手動切換就不會自動享受到新版的速度與效率。

  • 30% 省幅是固定的嗎? 不是固定值。Anthropic 的 30% 是他們自家工作負載的量測,你的工作流省幅需要自己量(replay 25–50 個代表性任務,算 cost per accepted result,不是 per-request 平均)。

  • Sonnet 5.5 適合寫安全敏感的程式碼嗎? 不建議獨立使用。CodeRabbit 測評指出安全敏感程式碼需要更徹底的人工審查;這個格位建議留 Opus 5.5,並確保有完整的人工審核流程。

補上清楚的切換行動步驟統一模型名稱與比較範圍

【延伸閱讀】