Anthropic 发布 Claude Haiku 5.5:小模型基准大幅提升,运行成本较 Haiku 4.5 平均降低约 75%
核心概要
Anthropic 发布小模型 Claude Haiku 5.5,面向高并发、成本敏感任务,在 GDPval-AA v2.1、AA-Briefcase v1.1、OSWorld 2.1、Humanity's Last Exam、Terminal-Bench 4.0、FrontierCode 1.1 与 Chartography 等基准上均高于 Haiku 4.5,并首次在 Haiku 级模型上提供可调 effort 设置,同时运行成本平均降低约 75%。
深度剖析
Haiku 5.5 在多项基准上明显高于 Haiku 4.5:知识工作 GDPval-AA v2.1 为 1620 对 735,AA-Briefcase v1.1 为 1578 对 614;计算机使用 OSWorld 2.1 离线子集为 72.4% 对 15.7%;多学科推理 Humanity's Last Exam 为 45.9%(无工具)与 57.4%(有工具),对应 10.2% 与 18.7%;智能体编码 Terminal-Bench 4.0 为 39.2% 对 0.0%,FrontierCode 1.1(Main)为 46.4%;视觉推理 Chartography 为 46.4% 对 6.4%。 相对上一代 Haiku 4.5,提升覆盖知识工作、计算机使用、推理、编码与视觉推理多个维度,而不只是单一任务;文中同时给出 GPT-6 Luna 与 Sonnet 5.5 作为对照,Sonnet 5.5 在多数项目上仍更高(如 Terminal-Bench 4.0 为 70.6%)。 证据来自文中列出的基准表格,并注明评估细节见 Haiku 5.5 System Card;OSWorld 2.1 与 Chartography 标注为离线子集或无工具设置,Humanity's Last Exam 区分有无工具,FrontierCode 1.1 对 Sonnet 5.5 标注 Xhigh。
Haiku 5.5 是首个带可调 effort 设置的 Haiku 级模型,用户可在成本与智能之间取舍;文中称其在三个基准上按各 effort 设置的表现以图表呈现。 此前 Haiku 级模型没有该设置,这一能力此前只出现在其他模型上,使同一模型可按任务需要在成本与能力之间调节。 文中以图表形式给出三个基准在各 effort 设置下的表现,但正文未列出具体数值;细节指向 System Card。
定价上,Haiku 5.5 每百万 token 的缓存读取为 $0.01(不超过 100k 提示)/ $0.05(超过 100k),缓存写入 $0.125 / $0.625,输入 $0.10 / $0.50,输出 $0.50 / $2.50;Haiku 4.5 对应为 $0.10、$1.25、$1.00、$5.00,Sonnet 5.5 为 $0.10、$2.50、$2.00、$10.00。 文中称 Haiku 5.5 平均运行成本比 Haiku 4.5 低约 75%;脚注进一步说明不超过 100k token 的请求价格低 90%,超过 100k 的请求低 50%,且 Haiku 4.5 上约 90% 的请求属于前者;该计算还计入新分词器带来的每任务 token 用量略增。 证据为文中定价表与脚注中的价格对比和请求分布说明,属于厂商公布的定价信息。
安全方面,文中称 Haiku 5.5 在几乎所有对齐评估上相对 Haiku 4.5 有大幅改进,错位行为实例更少、配合滥用的意愿更低;网络安全防护比 Haiku 4.5 更严格,但比近期其他模型略宽松,允许比 Sonnet 5.5 更广的防御性任务,仍阻止渗透测试等更可能被攻击者使用的手法;生物学防护与 Sonnet 5、Sonnet 5.5、Opus 5 相同,允许研究性生物学问题但限制可能造成伤害的请求。 对齐评估整体改善,同时防护强度按能力做了差异化设定,并为更广泛的生物学与网络活动提供 Life Sciences Verification Program 与 Cyber Verification Program 申请通道。 证据为文中对对齐评估与防护策略的定性描述,具体评估流程与结果指向 System Card。
启示与展望
该发布面向需要高并发、成本敏感推理的开发者与团队:摘要、压缩、数据库查询、分类请求,以及作为 Opus 5.5 与 Sonnet 5.5 的子智能体参与编码工作;也适用于对速度敏感的场景,如实时客户支持与浏览器使用。文中明确 Haiku 5.5 最适合范围较窄、此前因成本而难以承担的任务,而 Sonnet 5.5 与 Opus 5.5 仍是 Terminal-Bench 4.0 这类复杂智能体编码任务的更好选择。可用性覆盖 AWS、Google Cloud、Microsoft Azure 与 Claude Platform,开发者可通过 claude-haiku-5-5 接入,并有迁移指南。配套更新包括 Sonnet 5.5 缓存读取价格减半(每百万 token 从 $0.20 降至 $0.10,使多数智能体任务成本降低约 20%),以及面向 Max 与 Team 订阅者的月度 API 额度(Max 5x 为每月 $100,Max 20x 为 $200,Team 最高 $500 并在用户间共享)。
基准数值来自厂商自述,正文未给出各基准的样本量、评测协议或置信区间,评估细节指向 System Card;OSWorld 2.1 与 Chartography 标注为离线子集或无工具设置,Humanity's Last Exam 区分有无工具,FrontierCode 1.1 对 Sonnet 5.5 标注 Xhigh,跨模型比较时这些条件差异值得留意。可调 effort 设置下三个基准的具体数值以图表呈现,正文未列出,因此无法从文本判断各档位的具体取舍幅度。客户反馈仅以“与上述性能与成本改进一致”概述,未给出具体数据。安全部分为定性描述,对齐评估的具体指标与结果需查阅 System Card。
