Anthropic 发布 Claude Sonnet 5.5:终端编程得分从 10.3% 跳到 70.6%,价格没涨
先把可核对的部分定下来。据 Anthropic 官方发布页(9 月 28 日),Claude Sonnet 5.5 是 Claude 5.5 家族的第二款模型,是对 Claude Sonnet 5 的明确升级,运行速度快 30% 以上,在大多数工作上的成本最多降低 30%。价格方面官方写得很清楚:与 Sonnet 5 保持一致,每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 token 0.20 美元,但由于完成同样的工作通常需要更少的 token,官方测试中单任务成本最多比上一代低 30%。路透社在同一天的报道里补了上下文:这是 Anthropic 在计划 IPO 之前的第二次模型发布,该公司称企业客户占其业务约 80%。本文只写官方发布页、系统卡与权威媒体报道中能核对的内容。
数字里最扎眼的是终端编程这一类。官方公布的 Terminal-Bench 4.0 上,Sonnet 5.5 得 70.6%,Sonnet 5 是 10.3%,差出近七倍;作为参照,官方在同一张表里给出的 Opus 5.5 在 Xhigh 档位下是 66.4%。CursorBench 4.0 这一类模糊、跨文件、来自真实 Cursor 会话的任务上,Sonnet 5.5 得 55.5%,Sonnet 5 是 34.1%,Opus 5.5 是 57.8%。FrontierCode 1.1 主集上,Sonnet 5.5 在 Max 档得 46.2%、Xhigh 档得 52.1%,Opus 5.5 是 54.4%,官方同表列出的 GPT-6 Sol 是 49.3%。官方自己的结论是务实的:在某些评测上,Sonnet 5.5 在 Max 档可以接近 Opus 5.5,但基准分数只反映能力的一个侧面,在需要持续判断的复杂开放式工作上,Opus 5.5 依然明显更强。
知识工作这一类更能说明它想抢的是谁的活。官方表格里,GDPval-AA v2.1 这个覆盖 44 种职业真实工作场景的基准上,Sonnet 5.5 得 1844,Sonnet 5 是 1449,Opus 5.5 是 1846,官方同表列出的 GPT-6 Sol 是 1487。AA-Briefcase v1.1 这个长周期知识工作基准上,Sonnet 5.5 是 1811,Sonnet 5 是 1359,Opus 5.5 是 1822。也就是说,和自家旗舰的差距被压到了个位数分级别的两分。计算机操作上,OSWorld 2.1 的部分完成口径下 Sonnet 5.5 是 80.1%,Sonnet 5 是 57.0%,Opus 5.5 是 81.8%。图表识别这一类偏视觉的任务上,Chartography 无工具口径下 Sonnet 5.5 是 61.6%,Sonnet 5 是 15.6%,Opus 5.5 是 64.4%,GPT-6 Sol 是 53.6%。
成本这一段是这次发布真正的卖点,也是最容易被误读的地方。官方强调的不是降价,而是完成同样工作所需的 token 更少:价格表维持 Sonnet 5 的水平不变,但官方称在测试中单任务成本最多降低 30%。更细的说明在准确率对成本的图表里:在若干基准上,Sonnet 5.5 用 Low 或 Medium 档就能超过 Sonnet 5 的最好成绩,而单任务成本只有它的约十分之一;Terminal-Bench 4.0 上,Medium 档(Claude 应用里的默认档)就远超 Sonnet 5 的最好成绩而成本不到十分之一;CursorBench 4.0 上,Low 档就超过了 Sonnet 5 的最好成绩;AA-Briefcase 上,Medium 档的性能优于 Sonnet 5 最好成绩而成本约为九分之一。官方的使用建议也顺势更新了:Sonnet 5.5 最适合跑低档位,与 Opus 5.5 形成互补,档位调高后成本会接近,这时该评估的就该换成 Opus 5.5。
安全和可迁移性上有两条值得记的细节。官方说,在自动化行为审计中,Sonnet 5.5 在多数对齐指标上优于或持平 Sonnet 5;由于网络安全能力与 Opus 5 相当,它成为首个上线时就配备网络安全防护与回退机制的 Sonnet 模型,方式与公司为最强模型开发的方案一致,生物防护则与 Sonnet 5 相同。两套防护都只针对一小组高风险请求,常规软件开发与大多数生命科学工作不受影响。工程侧的具体信息也给了:模型 ID 是 claude-sonnet-5-5,支持 1M token 上下文与 128K 最大输出,已在 AWS、Google Cloud 和 Microsoft Azure 等平台上线,并支持零数据保留;如果你此前是以 thinking 关闭的方式运行 Sonnet,迁移到 Sonnet 5.5 前需要改用 between_tools 设置。Haiku 5.5 将在未来几周加入这个家族,Snowflake Cortex AI 也已宣布以公开预览形式提供 Sonnet 5.5。
官方还主动披露了三条对自己不利的细节,这点值得单独说。第一,FrontierCode 上 Sonnet 5.5 在 Max 档的得分低于 Xhigh 档,官方解释是 Max 档下模型更频繁地调用 Claude Code 的代码评审技能,把评审拆给许多子代理,在 Cognition 检查的两个案例里这导致了超时、或者超出任务范围的额外改动,因此得分更低。第二,Artificial Analysis 的 GDPval-AA 与 AA-Briefcase 是在预发布部署上跑的,官方发现那个部署有一个可能降低结构化输出类请求质量的 bug,官方判断影响很小并且会低估 Sonnet 5.5 的表现,该 bug 已经修复。第三,官方提到 OpenAI 最近修复了一个影响 GPT-6 Sol 图像理解能力的 bug,因此 Artificial Analysis 的 AA-Briefcase v1.1、GDPval-AA v2.1 分数与 Surge AI 的 Chartography 分数可能尚未更新到最新模型版本。把自家弱点与对手的测量时差都写进发布页,比只放最好看的那一列更有参考价值。
最后说一句这类发布该怎么读。把它放回 9 月下旬这一串动作里,Anthropic 的节奏很清楚:9 月 22 日发布旗舰 Opus 5.5(每百万输入 4 美元、输出 20 美元),一周后的 9 月 28 日发布中端的 Sonnet 5.5,价格砍半而知识工作基准只差两分,Haiku 5.5 还在路上。路透社点出的背景是,这家公司正在为计划中的 IPO 扩张产品线,同时其首席执行官 Dario Amodei 本月早些时候还呼吁全球 AI 社群放慢发布新能力的节奏。这两件事放在一起并不矛盾:把前沿能力往下压到中端价格,本身就是一种把风险与普及绑在一起的商业选择。对使用方来说,真正要做的动作不是追问哪家模型更强,而是把自己手上的任务按难度和延迟要求重新分一遍档,因为价格表没变、档位能效变了的这种更新,改变的是你的成本结构,不是你的使用习惯。
🤔 常见问题解答
Sonnet 5.5 涨价了吗?
没有。官方写明价格与 Sonnet 5 一致:每百万输入 token 2 美元、每百万输出 token 10 美元、每百万缓存读取 token 0.20 美元。它省钱的机制不是降价,而是完成同样工作通常需要更少的 token,官方测试中单任务成本最多降低 30%。
它能替代 Opus 5.5 吗?
官方给的答案是部分可以,但要分场景。在部分评测上 Sonnet 5.5 于 Max 档接近 Opus 5.5(例如 GDPval-AA v2.1 为 1844 对 1846),但官方明确说 Opus 5.5 在需要持续判断的复杂开放式工作上依然明显更强。官方还给了操作建议:Sonnet 5.5 最适合跑低档位,档位调高后单任务成本会接近,这时应评估 Opus 5.5。
怎么接入,有什么迁移注意点?
模型 ID 是 claude-sonnet-5-5,支持 1M token 上下文与 128K 最大输出,已在 Amazon Web Services、Google Cloud、Microsoft Azure 等平台上线,并支持零数据保留。官方给出一条具体的迁移要求:如果你此前以 thinking 关闭的方式运行 Sonnet,迁移到 Sonnet 5.5 前需要改用 between_tools 设置,细节见官方迁移指南。
新加的网络安全防护会影响正常开发吗?
按官方说明,网络安全防护与回退机制是与公司为最强模型开发的方案同款,这也是首个上线即配备这类防护的 Sonnet 模型,生物防护与 Sonnet 5 相同。两套防护都只针对一小组高风险请求,常规软件开发与大多数生命科学工作不受影响。也就是说,它拦的是特定高风险用法,不是普通的开发任务。
🛠️ 推荐工具
- AI 模型路由器官方建议本身就是一套路由逻辑:低档位用 Sonnet,高档位评估 Opus。把这类判断从业务代码里搬到配置里,模型换代时你改的是路由表,不是每一处调用点。
- AI Token 计数器这次省钱靠的是 token 少了而不是单价降了,而缓存读取还单独计价(每百万 0.20 美元)。上线前量一次真实请求的 token 分布,才知道官方那个三成是从哪省出来的。
- CSV 转 Excel官方把表格、文档与幻灯片这类日常工作列为 Sonnet 5.5 的强项场景,也是企业侧需求最大的一块。如果你的流水线里还在手工搬运数据文件,先把这段交给脚本,再谈要不要交给模型。
总结
按 Anthropic 官方发布页(9 月 28 日)与路透社报道:Claude Sonnet 5.5 是 Claude 5.5 家族第二款模型,比 Sonnet 5 快 30% 以上,在多数工作上成本最多降低 30%,价格维持 Sonnet 5 水平(输入每百万 2 美元、输出每百万 10 美元、缓存读取每百万 0.20 美元),省钱来自需要更少 token。基准方面,Terminal-Bench 4.0 从 10.3% 升到 70.6%(Opus 5.5 为 66.4%);GDPval-AA v2.1 得 1844(Sonnet 5 为 1449、Opus 5.5 为 1846、GPT-6 Sol 为 1487);AA-Briefcase v1.1 为 1811;OSWorld 2.1 为 80.1%;Chartography 为 61.6%。它是首个只靠截图通关《宝可梦 红》的 Sonnet 模型,也是首个上线即配备网络安全防护与回退机制的 Sonnet 模型。模型 ID 为 claude-sonnet-5-5,支持 1M 上下文与 128K 输出,已在 AWS、Google Cloud、Azure 上线并支持零数据保留,Haiku 5.5 未来几周推出,Snowflake Cortex AI 已提供公开预览。路透社补充:这是其计划 IPO 前的第二次发布,企业客户约占其业务 80%。官方同时披露了 FrontierCode Max 档得分低于 Xhigh 档、预发布部署存在影响结构化输出的 bug、以及对手模型分数可能未更新三条细节。本文所有事实来自下方列出的官方与权威来源,未加入推测。
来源链接:Anthropic: Introducing Claude Sonnet 5.5 (official)
Anthropic: Claude Sonnet 5.5 System Card (official)
Reuters: Anthropic rolls out second Claude 5.5 model as it builds toward IPO
Snowflake: Announcing Anthropic Claude Sonnet 5.5 on Snowflake Cortex AI
VentureBeat: Anthropic launches Claude Sonnet 5.5