Claude Haiku 5.5发布,成本降75%

Anthropic于10月7日发布Claude Haiku 5.5,标准请求输入、输出价格分别降至每百万Token 0.10美元和0.50美元,较Haiku 4.5平均运行成本降低约75%。新模型还大幅提升电脑操作与智能体编程基准成绩,并首次为Haiku加入可调节推理强度。
Anthropic把Haiku的价格打了下来,能力也不再只够做简单任务
Anthropic于10月7日发布Claude Haiku 5.5,这是Haiku系列面向高吞吐、低成本任务的新一代模型。按Anthropic公布的定价,Haiku 5.5的平均运行成本较Haiku 4.5降低约75%;在提示词不超过10万Token时,输入和输出价格分别为每百万Token 0.10美元和0.50美元。更值得关注的是,它的电脑操作与智能体编程基准成绩相较前代显著提高,定位开始从“便宜、够快的小模型”转向可承担更多实际工作流的执行模型。
对于开发者和深度用户,这次发布的核心不是“又多了一个型号”,而是小模型的性价比边界在移动:更多原本需要中型模型的高频任务,可能可以交给Haiku处理,再把困难样例升级给Sonnet或Opus。Anthropic同时下调了Sonnet 5.5的缓存读取价格,试图把模型能力、调用频率与运行成本放进同一套分层产品组合里。

价格变化:常见请求降幅最大
Claude Haiku 5.5是Anthropic推出的轻量级模型,面向速度敏感、调用量大且单次任务相对明确的工作负载。它的定价按照提示词是否超过10万Token分档,长提示词请求的输入和输出单价更高;缓存读取和缓存写入也各有单独价格。
| 项目(美元/百万Token) | Haiku 5.5,提示词不超过10万Token | Haiku 5.5,提示词超过10万Token | Haiku 4.5 | Sonnet 5.5 | |---|---:|---:|---:|---:| | 缓存读取 | 0.01 | 0.05 | 0.10 | 0.10 | | 缓存写入 | 0.125 | 0.625 | 1.25 | 2.50 | | 输入 | 0.10 | 0.50 | 1.00 | 2.00 | | 输出 | 0.50 | 2.50 | 5.00 | 10.00 |
Haiku 5.5对标准请求的输入和输出价格都比Haiku 4.5低90%。提示词超过10万Token时,两项价格则各低50%。Anthropic给出的总体口径是平均运行成本降低约75%,这个数字与单项标价的降幅并不矛盾:实际成本取决于输入、输出、缓存使用以及请求长度,并非每类任务都能享受同样的降幅。
这一区别对预算测算很重要。只看“便宜75%”容易把它误读成每次调用成本都固定减少四分之三;更准确的理解是,Anthropic根据不同请求形态给出了不同价格,最终节省幅度由工作负载构成决定。对于提示词在10万Token以内、输出量也较为可控的分类、摘要和简单信息抽取任务,标价下降最直接;依赖超长上下文或大量生成的任务,仍要单独估算输入输出比例。
缓存价格则关系到重复上下文的成本。缓存读取在标准请求区间为每百万Token 0.01美元,缓存写入为0.125美元;超过10万Token后分别为0.05美元和0.625美元。对每轮请求都带有相同系统指令、规则或项目背景的应用,缓存读取价格会影响长期账单,但采用缓存能否省钱,还要看上下文复用次数和写入成本。
这次调整还不止于Haiku。Anthropic把Sonnet 5.5的缓存读取价格从每百万Token 0.20美元降至0.10美元,降幅为50%;公司称,这项改动可使Sonnet 5.5在多数智能体任务中的运行成本降低约20%。这释放出一个明确信号:成本竞争不再只发生在模型单价上,缓存、上下文管理和多模型分工也正在成为产品定价的一部分。
基准变化:轻量模型开始承担执行任务
Haiku 5.5是Anthropic目前定位为最快、最便宜且能力最强的Haiku系列模型。这里的“最快”是产品定位,不应脱离具体硬件、任务长度和服务负载理解为所有场景下的固定延迟保证;判断它是否适合生产环境,仍要用自己的提示词和工作流测试端到端响应时间。
现有资料给出的两个醒目对比来自电脑操作与智能体编程测试。在OSWorld 2.1的离线子集中,Haiku 5.5得分为72.4%,Haiku 4.5为15.7%;在Terminal-Bench 4.0智能体编程测试中,新模型为39.2%,前代为0%。这类成绩显示模型在特定评测任务上的能力变化,但基准测试不等于生产成功率,也不能直接推出任意桌面操作或代码库任务都能获得相同表现。
| 评测 | Haiku 5.5 | Haiku 4.5 | 说明 | |---|---:|---:|---| | OSWorld 2.1离线子集 | 72.4% | 15.7% | 电脑操作任务成功率 | | Terminal-Bench 4.0 | 39.2% | 0% | 智能体编程测试成绩 | | GDPval-AA v2.1 | 1620分 | 资料未提供 | 知识工作评测分数 | | AA-Briefcase v1.1 | 1578分 | 资料未提供 | 知识工作评测分数 |
OSWorld的变化尤其值得留意。电脑操作模型需要把自然语言目标转成屏幕观察、动作选择和结果确认,任务错误可能来自识别界面、理解状态、规划步骤或点击执行等多个环节。成绩由15.7%升至72.4%,意味着Haiku 5.5在该评测集上的成功率提高了56.7个百分点;这比笼统地说“能力更强”更有信息量,但仍需注意,它反映的是特定测试集,不是所有软件环境中的通用表现。
Terminal-Bench 4.0的39.2%则把注意力带到代码智能体。编程智能体不是只补全一段函数,而是要理解仓库、执行命令、定位失败并逐步修改。Haiku 5.5的成绩让它有机会参与这类多步骤任务,但39.2%也表明评测中仍有大量任务没有完成。适合的部署方式不是把整个工程交给小模型后不做检查,而是让它承担边界清晰的子任务,并由测试、人工审查或更强模型做验证。
在知识工作测试中,资料列出Haiku 5.5在GDPval-AA v2.1取得1620分、在AA-Briefcase v1.1取得1578分。评分可帮助比较同一套评测里的模型表现,但其业务意义取决于测试任务是否贴近企业实际,例如文档处理、研究摘要或跨资料整理。没有同口径的前代分数与完整评测说明时,不宜仅凭这两个数字推导出生产效率提升幅度。
可调节的effort:把推理预算交给任务决定
Effort是模型推理强度的可调设置,用户可用它在响应速度、成本和复杂任务表现之间做取舍。Haiku 5.5是首款支持可调effort的Haiku模型,提供Low、Med、High、Xhigh和Max五档。
这个设计改变了轻量模型的使用方式。过去,开发者往往要在“便宜但容易做错”和“更强但更贵”之间按模型整体选边;现在至少可以尝试让同一个Haiku模型在简单任务上少花推理预算,在复杂任务上提高强度。它更像给模型加了一档可调整的工作模式,而不是保证每次提高档位都按固定比例增加准确率。
真正的成本收益取决于任务分布。分类、短摘要和字段提取通常规则清楚,适合从低档开始;多步电脑操作、需要检查多个文件的编码任务,可能更适合提高effort。企业落地时,值得跟踪的不是单一基准分,而是分档后的任务成功率、平均Token消耗、端到端延迟、重试次数和人工介入率。若高档推理减少了失败重试,总成本可能下降;若只是增加生成Token而没有改善成功率,档位本身就没有带来价值。
放进工作流:适合做高频环节,不适合无差别替代
Haiku 5.5的合理位置,是承担数量大、规则相对稳定、错误可被发现或纠正的任务。Anthropic提到的使用方向包括摘要、上下文压缩、数据库查询、分类,也包括作为Sonnet 5.5或Opus 5.5的子智能体,执行复杂编码流程中的部分工作。
例如,一个代码智能体可以让Haiku先检索相关文件、归纳错误日志、整理候选修改范围,再由更强模型负责方案判断;一个客服系统可以先用Haiku识别意图、提取订单信息并路由请求,把高风险或含糊的问题交给人工或更强模型。这样的分工把高价模型留给不确定性更高的环节,也使小模型的低单价真正转化为整体工作流的成本优势。
不过,小模型并不自动等于便宜系统。若下游需要频繁重试、人工逐条修正,或者任务错误会带来较大业务损失,单次Token价格就不是完整成本。部署时至少要核算四项:模型调用费用、失败重试成本、验证或人工审核成本,以及延迟对产品体验的影响。对实时支持和高频数据库查询,响应延迟可能比每百万Token价格更影响用户体验;对批处理,吞吐量和任务成功率则更关键。
Anthropic将Claude 5.5系列划分为不同工作负载,体现了这种分工逻辑:Opus承担复杂推理与长任务,Sonnet面向日常知识工作和高频开发,Haiku负责高吞吐、成本敏感的任务。这个分层是否足够清晰,要看真实应用中的能力边界,而不是产品名称。开发者应把同一组代表性任务分别交给不同模型,比较完成质量和总成本,再决定何时升级、何时降级。
与同级模型竞争,关键看单位任务成本
Haiku 5.5的低价和基准成绩把它放进了轻量模型竞争的核心战场:不仅要看模型能不能完成任务,还要看完成一次有效任务要花多少钱、耗时多久,以及失败后需要多少补救。补充资料提到Anthropic公布了与GPT-6 Luna等模型的比较,但现有材料没有提供完整、可复核的同口径数据表,因此不适合据此断言Haiku 5.5在所有任务上领先竞品。
对开发者而言,最有用的比较方式是选取自己产品里的代表性请求,记录模型名称与版本、提示词长度、输入输出Token、是否使用缓存、成功判定方式和端到端延迟。尤其是智能体任务,比较单位应是“完成一个合格任务的成本”,而不是“每百万Token价格”。某个模型如果单价较低,但需要更多轮调用或更高比例的人为纠错,最终成本未必占优。
在评测设计上,也应避免让模型的自我判断充当唯一验收标准。代码任务可用测试通过率和回归缺陷衡量;电脑操作可以检查最终页面状态或业务结果;分类任务可以抽样人工复核混淆类别;知识工作则需要根据引用完整性、事实准确性和交付格式设定验收条件。只有把“完成”定义清楚,模型之间的成本比较才有意义。
上线信息与开发者判断
据现有报道,Claude Haiku 5.5已在Claude平台、AWS、Google Cloud和Microsoft Azure上线,模型ID为claude-haiku-5-5。可用地区、具体产品入口和服务配额可能因平台而异,部署前应以Anthropic及对应云平台的官方产品页面为准。
这次发布的结论可以概括为三点。第一,标准请求的输入和输出价格相较Haiku 4.5各下降90%,但长提示词的降幅是50%,不能把75%的平均成本下降理解成每种工作负载都享有同一比例。第二,OSWorld 2.1和Terminal-Bench 4.0成绩显示Haiku的能力边界正在扩展,但基准分数仍需经过真实业务任务验证。第三,可调effort与Sonnet缓存降价让Anthropic把竞争重点进一步推向单位任务成本和模型间协作,而不是单纯比拼旗舰模型的峰值能力。
对正在构建智能体或批量处理系统的团队,Haiku 5.5值得进入实测名单,尤其是分类、摘要、上下文压缩、信息抽取和可验证的子任务。它还不是对Sonnet或Opus的全面替代;更务实的策略是让Haiku处理高频、边界清楚的环节,为失败样例设置升级路径,并用自己的成功率、延迟与总账单决定模型路由。小模型真正的竞争力,不是标价最低,而是用足够低的成本稳定完成足够多的任务。
参考来源
- IT之家:Anthropic最快、最便宜模型Claude Haiku 5.5登场:发布信息与定价数据。
- 搜狐:Anthropic发布Claude Haiku 5.5,成本直降75%:补充基准成绩、产品定位与effort档位信息。
- 搜狐:成本下降75%,Anthropic推出全新小模型Claude Haiku 5.5:补充Haiku系列工作负载定位。
- 新浪科技:Anthropic推出Claude Haiku 5.5,API价格降低90%:补充OSWorld成绩及Sonnet缓存价格调整信息。



