Claude Fable 5.1降价升级

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,重点升级编程、科学研究和长程 Agent 能力。Fable 5.1 缓存读取价格下调 75%,复杂 Agent 工作负载成本最高下降 45%。
Claude Fable 5.1 降价升级:Agent 工作成本最高下降 45%
Anthropic 在 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1。新模型没有单纯追求聊天体验,而是把升级重点放在软件工程、科学研究、知识工作和长时间自主执行上;其中,Fable 5.1 的缓存读取价格下调 75%,典型工作负载成本下降约 25%,高度智能体化的任务成本最高下降 45%。
Anthropic 将 Fable 5.1 和 Mythos 5.1 称为面向编程与知识工作的前沿模型。两者采用相同的基础模型,但安全防护等级不同:Fable 5.1 面向普通用户和开发者开放,Mythos 5.1 则通过可信访问计划,向经过审核的网络安全、生命科学等机构提供。
这次更新的真正看点不只是跑分。过去,Claude Fable 5 的问题在于能力很强,但价格高、数据保留政策和安全拦截都可能影响生产接入。5.1 版本试图同时回答三个问题:模型能不能把复杂任务做完,长流程 Agent 是否算得起,以及企业能否更放心地把真实数据交给它。

核心数据:编程和科学研究能力明显抬升
Terminal-Bench-Science 0.1 是一个评估 AI 智能体完成科学研究任务能力的基准。它要求模型在终端环境中处理资料、调用工具并完成多步骤研究,而不是只回答一道知识问答题。
在 Anthropic 公布的数据中,Fable 5.1 得分为 52.6%,前代 Fable 5 为 24.7%,Opus 5 为 29.0%,OpenAI GPT-5.6 Sol 为 22.4%。以 Fable 5 为参照,Fable 5.1 的绝对得分提升 27.9 个百分点,相对提升约 113%。
这组数据说明,Fable 5.1 的优势更接近“研究执行器”,而不是传统意义上的问答模型。它需要先拆解任务,再读取文件、运行命令、核对中间结果,最后生成可以交付的研究产物。对于实验数据整理、技术资料交叉验证、科研代码运行等场景,这种多步执行能力比单轮回答更重要。
Terminal-Bench 4.0 是面向智能体编程能力的终端基准,重点考察模型能否理解代码库、修改文件、运行测试并处理错误。Fable 5.1 在该测试中得分 55.8%;安全防护更宽松的 Mythos 5.1 得分达到 60.9%。
| 模型 | Terminal-Bench-Science 0.1 | Terminal-Bench 4.0 | GDPval-AA v2 | |---|---:|---:|---:| | Claude Fable 5.1 | 52.6% | 55.8% | 1853 分 | | Claude Mythos 5.1 | — | 60.9% | — | | Claude Fable 5 | 24.7% | 未披露 | 1723 分 | | Claude Opus 5 | 29.0% | 未披露 | 1824 分 | | OpenAI GPT-5.6 Sol | 22.4% | 未披露 | 未披露 |
需要注意的是,Mythos 5.1 的 60.9% 不能直接理解为普通用户能拿到的成绩。它采用更宽松的安全防护策略,并且只向经过审核的机构开放。把 Mythos 的结果与 Fable 5.1 并列展示,可以看出安全策略对高风险编程任务的影响,但不能据此判断两个模型在所有场景下的综合差距。
知识工作分数超过 Opus 5
GDPval-AA v2 是一个评估模型完成知识工作任务能力的基准,覆盖分析、写作、信息处理和专业工作流等类型。Fable 5.1 在该测试中拿到 1853 分,高于 Opus 5 的 1824 分,也高于 Fable 5 的 1723 分。
Fable 5.1 相比 Fable 5 提升 130 分,增幅约 7.5%;相比 Opus 5 高 29 分。这个结果不像 Terminal-Bench-Science 那样呈现翻倍增长,但它更接近企业日常会遇到的工作:读一组材料、整理结构、完成分析、生成报告,并根据反馈继续修改。
因此,Fable 5.1 的定位并不是“所有问题都比旧模型聪明”,而是把更多能力集中到可交付任务上。对于开发团队来说,模型能否持续修改一个真实代码库、能否在测试失败后继续修复,通常比一次性生成一段漂亮代码更有价值。
价格调整:缓存读取从 1 美元降至 0.25 美元
缓存读取是指模型重复读取此前已经处理并缓存的输入内容时,用户无需再次按完整输入价格付费。对于长上下文和多轮 Agent 工作流,缓存读取价格直接影响总成本。
Fable 5.1 的缓存读取价格下调 75%,降至每百万词元 0.25 美元。基础输入和输出价格保持不变:
| 项目 | Claude Fable 5.1 价格 | |---|---:| | 输入 | 每百万词元 10 美元 | | 输出 | 每百万词元 50 美元 | | 缓存读取 | 每百万词元 0.25 美元 | | 典型工作负载成本变化 | 比 Fable 5 低约 25% | | 高度 Agent 化工作负载成本变化 | 最高降低 45% |
这次降价对普通聊天用户的影响有限,因为短问短答很少反复读取大段上下文。但对 Claude Code、企业知识库 Agent、自动化数据分析和长时间研究任务来说,意义很大。
一个 Agent 可能需要反复读取项目说明、目录结构、接口文档和历史操作记录。若每一次循环都按完整输入计费,模型越能工作,账单反而越容易失控。缓存读取价格降到每百万词元 0.25 美元后,重复上下文不再是主要成本,真正昂贵的部分会转向输出、推理过程、工具调用、失败重试和人工审核。
换句话说,Anthropic 不是把 Fable 5.1 变成了廉价模型。每百万词元 50 美元的输出价格仍然很高,复杂任务产生大量输出时,账单依旧可能超过输入成本。但它降低了 Agent 工作流里最容易被忽视的“重复阅读税”,使模型更适合连续工作。
为什么 Agent 场景能省到 45%
Agent 是能够自主拆解任务、调用工具、检查结果并持续执行的 AI 工作流程。与聊天机器人相比,Agent 通常会产生更多轮交互:读取上下文、规划下一步、调用终端或数据库、观察结果、修正错误,然后进入下一轮。
在典型工作负载中,Fable 5.1 成本比 Fable 5 低约 25%;在高度 Agent 化的工作负载中,成本最高下降 45%。下降幅度之所以更大,核心原因就是长流程更依赖缓存读取。
可以把一次复杂代码迁移理解为一个项目团队:第一次需要完整阅读代码库,之后每一轮只需重新确认部分文件和状态。如果这些重复读取都按全价计算,Agent 的每一次尝试都会放大成本;如果大部分上下文命中缓存,模型就能在更低边际成本下完成更多轮推理。
但“最高下降 45%”不是所有用户都能复现的固定折扣。实际成本还取决于缓存命中率、上下文长度、输出规模、工具调用次数、失败重试次数和任务是否触发模型回退。企业在预算时,更应该使用“每个成功任务成本”,而不是只看每百万词元价格:
每个成功任务成本 =(模型费用 + 工具费用 + 重试费用 + 回退费用 + 人工审核成本)÷ 验收通过的任务数
如果新模型一次就能交付,而旧模型需要多轮重试,即使新模型单价更高,也可能拥有更低的实际成本。反过来,如果 Fable 5.1 只是跑分更高,却没有改善任务通过率,降价也未必能改变投入产出比。
Fable 5.1 重点解决了哪些旧问题
Anthropic 此次还强调,Fable 5.1 调整了安全防护机制,以减少误拦截。误拦截是指模型把本身安全、合法的请求错误识别为高风险内容,从而拒答、缩减回答或回退到能力更弱的模型。
这对开发者尤其敏感。网络安全、系统管理、底层代码和生物信息学等领域经常同时包含正常研究与潜在风险信号。安全策略过于激进,可能导致模型无法完成漏洞修复、依赖排查或实验数据处理;策略过于宽松,又会增加滥用风险。
Fable 5.1 的方向不是取消安全边界,而是降低正常任务被误伤的概率。Anthropic 将 Fable 5.1 面向更广泛用户开放,将 Mythos 5.1 放在可信访问计划中,本质上是把能力和风险分层管理:普通版本保留更严格的防护,高风险专业场景则通过审核机制获得更强能力。
这套设计对开发者意味着,评测时不能只统计“回答正确率”。还要记录拒答率、误拒率、实际服务模型、回退次数和回退后的任务完成率。尤其在涉及安全敏感代码时,HTTP 请求成功并不代表任务真正完成,模型可能返回拒绝结果,或者由另一款 Claude 模型完成响应。
企业数据政策:EFS 还要等到秋季
Enterprise Frontier Safeguards,简称 EFS,是 Anthropic 面向企业推出的数据与安全方案。EFS 的定义是:在结合前沿安全防护的同时,将客户数据存储在由企业完全控制的云基础设施中,而不是 Anthropic 自有系统中。
Anthropic 表示,EFS 将于 2026 年秋季开始分阶段向企业客户推出。在 EFS 正式可用之前,符合条件的客户可以通过零数据保留政策使用 Fable 5.1。
这里需要区分“零数据保留”和“企业完全控制基础设施”两个概念。零数据保留主要解决服务方是否保存请求数据的问题;EFS 则进一步强调数据存储位置和基础设施控制权。对于金融、医疗、政府和大型研发企业,后者通常涉及更复杂的审计、权限、区域合规和内部安全流程。
因此,企业现在可以评估 Fable 5.1,但不宜把 EFS 当作已经全面可用的现成能力。正式接入前,仍需要确认数据保留期限、日志范围、区域处理、模型回退、工具执行环境和第三方服务调用边界。
与 Fable 5、Opus 5 和 GPT-5.6 Sol 怎么选
如果任务是简单摘要、常规问答或短代码补全,Fable 5.1 的高输出价格未必划算。更强模型的价值,只有在它能减少人工介入、提升一次验收通过率或完成旧模型无法完成的任务时才会体现。
| 使用场景 | 更适合的选择 | 原因 | |---|---|---| | 短文本问答、简单改写 | 成本更低的通用模型 | 不需要 Fable 5.1 的长程执行能力 | | 多文件代码修改、复杂调试 | Fable 5.1 | 终端操作、测试和多轮修复能力更重要 | | 高风险网络安全、生命科学任务 | Mythos 5.1(需审核) | 安全防护更宽松,但访问受限 | | 企业知识库和长文档 Agent | Fable 5.1 | 缓存读取价格大幅下降,重复上下文成本更低 | | 需要严格数据控制的企业工作流 | Fable 5.1 + 零数据保留或 EFS | 需要结合企业数据政策评估 |
与前代 Fable 5 相比,5.1 的升级更像一次“能力、价格和可用性”同步修正;与 Opus 5 相比,它在 Anthropic 公布的 GDPval-AA v2 中领先 29 分;与 GPT-5.6 Sol 相比,它在 Terminal-Bench-Science 0.1 中高出 30.2 个百分点。不过,这些比较均来自 Anthropic 公布的测试数据,不能替代真实业务回放,也不能推导出所有任务上的绝对胜负。
开发者现在该不该迁移
我们的判断是:值得测试,但不适合发布日全量替换。
Fable 5.1 最有吸引力的地方,不是版本号从 5 变成 5.1,而是它开始同时改善 Agent 的三项关键指标:复杂任务完成能力、长流程成本和安全误拦截。对于已经使用 Claude Code 或自建 Agent 框架的团队,这可能直接影响单位任务成本。
但模型升级也会带来行为变化。企业至少应该检查以下指标:
- 任务质量:代码测试通过率、事实准确度、格式遵循和最终验收率。
- 长程可靠性:工具调用成功率、失败恢复率、循环次数和任务中断率。
- 实际成本:缓存命中率、输入输出词元、重试、回退和人工审核费用。
- 延迟表现:首次有效动作时间、p50、p95,以及从开始到交付的总耗时。
- 安全行为:拒答率、误拒率、敏感请求处理方式和回退情况。
- 数据合规:数据保留、日志、区域处理、权限隔离和审计能力。
比较稳妥的迁移路径是先冻结 Fable 5 的业务基线,再用历史任务回放 Fable 5.1;随后接入影子流量,观察真实请求下的缓存命中和拒答行为,最后只在低风险任务中进行小规模金丝雀发布。对于规划、复杂调试和最终复核,可以优先分配给 Fable 5.1;常规执行则继续使用成本更低的模型。
结语:前沿模型的竞争进入“每个成功任务多少钱”
Claude Fable 5.1 的发布,反映出前沿模型竞争已经从“谁的回答更聪明”,转向“谁能更稳定、更便宜地完成一项复杂工作”。52.6% 的科学研究 Agent 得分、55.8% 的终端编程得分和最高 45% 的 Agent 成本降幅,分别对应能力、可靠性和商业化的三个关键方向。
Anthropic 仍然没有把 Fable 5.1 变成适合所有请求的低价模型。每百万词元 10 美元的输入价格和 50 美元的输出价格,决定了它更适合高价值任务,而不是普通闲聊。但缓存读取降至每百万词元 0.25 美元后,长上下文、多工具、多轮执行的经济模型明显改善。
对开发者而言,下一步不应只是追逐榜单,而应该把评测单位从“单次回答”改成“成功交付的任务”。如果 Fable 5.1 能减少重试、缩短人工审核时间,并在真实代码库和知识工作中保持稳定,它才真正完成了从高分模型到生产力基础设施的转变。
参考来源
- IT之家:Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1 ——包含发布时间、基准测试成绩、价格调整和企业数据政策等信息。
- IT之家 ——国内科技媒体,可用于追踪 Anthropic 新模型及 AI 行业动态。



