Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 从 10.3% 升至 70.6%,输出快 30%+、单任务成本最多降 30%
核心概要
Anthropic 发布 Claude 5.5 家族第二款模型 Claude Sonnet 5.5,定位为比 Sonnet 5 更快更省的日常任务与编码模型:Terminal-Bench 4.0 从 10.3% 提升到 70.6%,GDPval-AA 从 1449 升至 1844(接近 Opus 5.5 的 1846),输出速度提升 30% 以上,在多数工作中单任务成本最多降低 30%,并首次为 Sonnet 系列配备网络安全防护与防蒸馏分类器。
深度剖析
Sonnet 5.5 在智能体编码上大幅超越 Sonnet 5:Terminal-Bench 4.0 得 70.6%,而 Sonnet 5 为 10.3%,Opus 5.5 为 66.4%;CursorBench 4.0 得 55.5%(Sonnet 5 为 34.1%,Opus 5.5 为 57.8%)。 相对上一代 Sonnet 5,这是跨代际的跃升,而非小幅迭代;在 CursorBench 上其最佳成绩与 Opus 5.5 相差约两个百分点。 来自官方评测表格中的多项智能体编码基准分数,并注明评测细节见 Sonnet 5.5 System Card;文中同时说明 FrontierCode 在 Max effort 下因越界改动与超时而得分低于 Xhigh。
在知识工作与多学科推理上,Sonnet 5.5 接近 Opus 5.5:GDPval-AA v2.1 得 1844(Sonnet 5 为 1449,Opus 5.5 为 1846),AA-Briefcase v1.1 得 1811,Humanity's Last Exam 带工具得 64.5%,OSWorld 2.1 得 80.1%,Chartography 无工具得 61.6%。 GDPval-AA 覆盖 44 个职业与九大行业,Sonnet 5.5 比 Sonnet 5 高出约 400 分,并在长时程知识工作上明显优于 Sonnet 5 与 GPT-6 Sol。 分数来自 Artificial Analysis 与 Surge AI 的评测;文中脚注说明 GDPval-AA 与 AA-Briefcase 在预发布部署上运行,该部署存在可能影响结构化输出请求的缺陷,官方认为影响很小且会低估其表现,缺陷已修复。
成本与速度:定价与 Sonnet 5 相同(输入每百万 token 2 美元、输出 10 美元、缓存读取 0.20 美元),但每任务所需 token 更少,测试中单任务成本最多降低 30%,输出生成速度提升 30% 以上。 在价格不变的前提下通过 token 效率与生成速度获得成本优势,并在多个基准上以 Low 或 Medium effort 用约十分之一的单任务成本超过 Sonnet 5 的最佳成绩。 基于官方定价表与内部测试陈述,并配有按 effort 级别绘制的分数—单任务成本曲线;具体数值为官方自测口径。
安全与防护:在约 1850 个场景的自动化行为审计中,Sonnet 5.5 在多数对齐、抗滥用与诚实性指标上优于或持平 Sonnet 5;因网络安全能力接近 Opus 5,它成为首个配备同类网络防护与回退机制的 Sonnet 模型,并首次搭载防止推理提取的安全分类器与扩展的 preserved thinking。 把此前只用于最强模型的网络防护与防蒸馏机制下放到 Sonnet 层级,同时生物学防护与 Sonnet 5 保持一致。 来自官方自动化行为审计与新的容器逃逸评测;文中明确说明没有任何评测能可靠捕捉所有失败,模型可能存在尚未发现的倾向。
启示与展望
该发布面向需要在日常、边界清晰的任务上快速迭代的开发者与知识工作者:修 bug、理解代码库、生成文档、幻灯片与表格,并可通过 effort 级别在成本、速度与质量之间取舍(Claude Code 与应用默认 Medium,Claude Platform 默认 High)。官方定位是 Opus 5.5 的低成本补充,而非替代:在需要持续判断的复杂开放式工作上 Opus 5.5 仍明显更强。网络防护针对高风险请求并会可见地回退到 Sonnet 5,生物学防护针对有害请求,常规软件开发与多数生命科学工作不受影响;需要更高权限的团队可申请 Cyber Verification Program 与 Life Sciences Verification Program。
读者仍需留意:多数分数为官方自测口径,第三方评测(Artificial Analysis、Surge AI)的部分结果来自存在结构化输出缺陷的预发布部署,且 GPT-6 Sol 相关分数可能尚未更新到最新模型版本;FrontierCode 在 Max effort 下因越界改动与超时反而低于 Xhigh,说明 effort 与得分并非单调关系。对齐方面,官方明确表示没有评测能可靠捕捉所有失败,模型可能存在尚未发现的倾向;生物学防护可能误标部分微生物学与病毒学请求。此外,从 thinking off 迁移需改用 between_tools 设置,跨账户移动会话会受 preserved thinking 影响。
