Claude Sonnet 5.5 评测:半价逼近旗舰,终端编程反超 Opus 5.5,大多数人的新默认模型

引言

2026 年 9 月,Anthropic 在 22 日推出 Opus 5.5 后仅六天,又于 28 日放出中端型号 Claude Sonnet 5.5。它维持 Sonnet 5 的 2/10 美元定价,却在终端智能体编程基准 Terminal-Bench 4.0 上以 70.6% 反超旗舰 Opus 5.5 的 66.4%。这篇评测只回答一个问题:在大多数日常场景里,你是不是该把默认模型从 Opus 换成 Sonnet 了?

主体内容

一、定位:Claude 5.5 家族的「性价比型号」

Sonnet 5.5 是 Claude 5.5 家族的第二款型号,定位在 Opus 5.5(旗舰)之下、待发布的 Haiku 5.5 之上。它的核心卖点不是「更强」,而是「几乎一样强,但便宜一半、快三成」。API 价格与 Sonnet 5 完全一致:输入 2 美元、输出 10 美元 / 百万 token;Opus 5.5 则是 4/20 美元,正好两倍。上下文 1M token、最大输出 128K、知识截止 2026 年 6 月,全平台可用(Claude.ai 免费版、Claude Platform、AWS Bedrock、Google Vertex AI、Azure、OpenRouter)。

二、成绩单:哪里追平、哪里反超

基准(厂商自报,2026-09-28)Sonnet 5.5Opus 5.5Sonnet 5
Terminal-Bench 4.0(终端智能体编程)70.6%66.4%10.3%
FrontierCode 1.1(最高努力)46.2%54.4%42.4%
CursorBench 4.055.5%57.8%34.1%
GDPval-AA v2.1(知识工作 Elo)184418461449
OSWorld 2.1(电脑操作)80.1%81.8%57.0%
Chartography(图表识别)61.6%64.4%15.6%
SWE-bench Pro(多文件仓库)81.3%89.9%—
HLE·带工具64.5%67.7%—

最亮眼的是 Terminal-Bench 4.0:Sonnet 5.5 的 70.6% 是 Anthropic 所有 Claude 表里最高的终端编程分,比 Opus 5.5 高 4 个点(±2.5 标准误差内,领先但幅度不大)。独立机构 Artificial Analysis 在自己环境测得 Sonnet 63.6% vs Opus 59.6%,方向一致;Vals AI 同基准两者几乎打平(64.1% vs 65.2%)。知识工作(GDPval-AA)两者几乎齐平,比上代 Sonnet 5 高出约 400 Elo。

要泼盆冷水:Sonnet 5 那 10.3% 跑的是更新、更难的 Terminal-Bench 4.0(它发布时用的是旧版 harness),所以「十倍跃升」有一半是换基准造成的,别全信。

三、价格与真实成本:半价是 token,不是 task

token 单价 Sonnet 比 Opus 便宜一倍,但「单次任务成本」未必更省。Vals AI 在 Terminal-Bench 4.0 实测里,Sonnet 5.5 单次任务花 16.51 美元、Opus 5.5 花 13.20 美元——更便宜的型号反而更贵,因为它吐了更多输出 token。Anthropic 也说 Sonnet 5.5 比 Sonnet 5 单次任务最多省 30%,但努力档拉到 max 时,单次任务成本从 high 档的 1.08 美元飙升到 7.60 美元(接近 Opus max 的 8.71)。结论:默认用 medium/high 档,别无脑拉满。客户实测则利好明显——Balyasny 在 2441 个金融任务上,Sonnet 5.5 单答约 12.1 万 token,Sonnet 5 是 49.7 万(少约 75%);Box 快 2.4 倍、总 token 少 12%;Slack 多数离线评测更好、输出 token 少约 14%。

四、实战可用性:已经到处能用了

五、三个必须直说的短板

  1. 最难的任务仍是 Opus 的地盘:FrontierCode、CursorBench、SWE-bench Pro、HLE、OSWorld 上 Opus 5.5 全胜。多文件架构、长程模糊、容错成本高的任务,别为省 token 翻车。
  2. 思考不能彻底关:想零思考得用 between_tools 把前置思考关掉,低延迟流水线要留意。
  3. 基准多为厂商自报,独立复现刚起步:max 档性价比崩、别当默认;被某些客户任务里「更便宜的型号反而更贵」提醒——按 task 而非 token 算账。

六、谁该用

七、任务路由速查:什么活交给谁

任务类型推荐模型理由
日常编码、终端 agent、跑脚本Sonnet 5.5Terminal-Bench 反超 Opus,成本减半
文档 / 表格 / 分析类办公流Sonnet 5.5质量持平 Opus,更快更便宜
多文件架构、长程模糊需求Opus 5.5FrontierCode / SWE-bench Pro 全面领先
长程无人值守 agentOpus 5.5容错成本低,别在关键路径省 token
免费试用 / 轻量问答Sonnet 5.5(免费版)直接白嫖旗舰级能力

一句话口诀:边界清、量大的用 Sonnet;模糊、长程、容错贵的用 Opus。

结论与推荐

  1. 量大、任务边界清晰的,直接 Sonnet 5.5 当默认:token 成本只有 Opus 一半,日常编程/办公几乎无感降质。
  2. 终端 / 命令行类 agent 编程,优先 Sonnet 5.5:Terminal-Bench 4.0 基准反而更高,是它最值得吹的点。
  3. 多文件架构、长程模糊、容错成本高的任务,继续 Opus 5.5:别为省 token 在关键路径上翻车。
  4. 努力档默认 medium/high:max 档单次任务成本暴涨近 7 倍,非必要不开。
  5. 已在用 Claude Code / Cursor / Copilot 的,核对模型别名已切到 5.5;免费版用户直接白嫖,这是 9 月最划算的「旗舰级降级」。

联盟链接

相关推荐自适应内嵌广告接入百度联盟/AdSense 后替换此处代码
底部广告728x90 横幅广告接入百度联盟/AdSense 后替换此处代码