Anthropic 发布 Claude Sonnet 5.5
Anthropic 发布了 Claude Sonnet 5.5,这是 Claude 5.5 系列继 Opus 5.5 之后的第二个模型。和上一代 Sonnet 5 相比,它的输出速度快了 30% 以上,完成同样的任务最多能省 30% 的钱。
Claude 目前对外开放的模型分四档:Fable 最强,往下依次是 Opus、Sonnet、Haiku,越往下越便宜。按 Anthropic 的定位,Fable 负责要跑好几个小时、横跨整个代码库的大项目,Opus 5.5 负责需要反复权衡的复杂工作,Sonnet 5.5 擅长范围明确的日常任务,比如修 Bug、写文档、做 PPT 和表格。Haiku 5.5 会在几周内发布。
进步最大的是编程。在 Terminal-Bench 4.0(考察模型在命令行里完成多步骤专业任务的基准测试)上,Sonnet 5.5 得分 70.6%,Sonnet 5 只有 10.3%,Opus 5.5 的最好成绩是 66.4%。在 CursorBench(题目来自真实的 Cursor 编程会话)上,它和 Opus 5.5 只差两分左右。早期测试者还发现,它更常把多个工具调用合并成一步完成,步骤少了,花费也跟着降了。
办公类任务也追得很近。GDPval-AA 用 44 个职业、9 大行业的真实工作任务给模型打分,Sonnet 5.5 拿到 1844 分,Opus 5.5 是 1846 分,Sonnet 5 是 1449 分。Anthropic 做过一个内部测试:把一家上市公司的季度财报材料、电话会议记录和一份 PPT 模板交给它,让它做一份 10 页的经营回顾。两位专家看完初稿,认为可以直接发出去。它也是第一个只看截图就通关《宝可梦 红》的 Sonnet 模型。
价格和 Sonnet 5 一样,每百万输入 Token 2 美元,每百万输出 Token 10 美元,是 Opus 5.5 的一半。省钱靠的是干同样的活用的 Token 更少。
Claude 可以调“思考力度”(effort),从 Low 到 Max 共五档,档位越高想得越久,花钱也越多。Claude App 和 Claude Code 默认用 Medium 档。在 Terminal-Bench 上,Sonnet 5.5 用 Medium 档,每个任务约 0.83 美元,得分 28.8%;Sonnet 5 开到 Max 档,每个任务花 11.62 美元,只拿到 10.3%。日常用 Claude 的人不改任何设置,拿到的就是一个更能干、回得更快的模型。
Anthropic 也提醒,跑分只反映了一部分能力。在他们自己和外部测试者的使用中,碰到开放式、需要持续判断的复杂工作,Opus 5.5 仍然明显更强。
安全上有两处变化。Sonnet 5.5 的网络安全能力和 Opus 5 相当,所以它成了第一个带网络安全防护的 Sonnet 模型:日常查 Bug、修 Bug 不受影响,高风险的网络安全请求会退回给 Sonnet 5 处理,用户能看到切换。它还是第一个带防蒸馏机制的 Sonnet。蒸馏指有人用成千上万个假账号批量调用模型,拿输出去训练自己的模型。为此,Claude 的思考内容会和生成它的账号绑定,在 Claude Code 里中途切换账号的用户会受影响。
Sonnet 5.5 已在所有平台上线,包括 AWS、Google Cloud 和 Microsoft Azure,API 模型名是 claude-sonnet-5-5。之前关闭思考功能调用 Sonnet 的开发者,迁移前需要改用新的 between_tools 设置。
Your browser does not support the video tag.