AI 快讯Opus 5突袭:更便宜,也更敢答
模型上新

Opus 5突袭:更便宜,也更敢答

2026-07-24T18:05:48.486Z
Opus 5突袭:更便宜,也更敢答

Anthropic 发布新旗舰 Claude Opus 5,价格低于 Fable 5,安全限制也更少。它未必在所有测试上都最强,却可能成为开发者更愿意长期部署的默认旗舰。

Anthropic 把旗舰模型重新拉回了“可日常使用”的价格带

Anthropic 在 7 月 24 日发布了新一代旗舰模型 Claude Opus 5,最关键的变化不是又多了几个跑分第一,而是它比上月推出的 Fable 5 更便宜,同时减少了后者那套容易干扰正常工作的安全限制。

Opus 5 是 Anthropic 面向通用开发、复杂推理和 Agent 任务推出的新旗舰 Claude 模型。根据 TechCrunch 7 月 24 日的报道,Opus 5 的价格低于 Fable 5,使用限制也更少,因此在大多数实际场景中,它很可能比 Fable 5 更值得优先选择。

这次发布最值得关注的地方,是 Anthropic 实际上承认了“能力最强”和“最好用”并不是一回事。Fable 5 在 6 月 9 日上线时被包装成面向公众开放的 Mythos 级模型,但高达每百万输入 Token 10 美元、输出 Token 50 美元的价格,加上敏感任务自动降级到 Opus 4.8 的机制,让它更像一辆被限速器锁住的超跑。

Opus 5 则试图把这两层摩擦一起拿掉。它未必意味着 Anthropic 放弃安全策略,但至少从产品定位上看,公司正在把更少误伤、更稳定的模型行为和更低的推理成本,放到单纯追求实验室能力上限之前。

Opus 5 与 Fable 5 到底是什么关系

Fable 5 是 Anthropic 将 Mythos 级底座能力经过安全分类器包装后,向普通用户开放的高性能模型。它与仅向 Project Glasswing 合作伙伴提供的 Mythos 5 使用相同底层模型,但会针对网络攻击、生物化学武器和模型蒸馏等高风险请求进行额外判断。

Fable 5 的防护机制不是简单拒绝回答,而是在分类器认为风险过高时,把请求自动交给能力较低、限制更成熟的 Opus 4.8。Anthropic 当时披露,超过 95% 的普通对话不会触发降级,换言之,触发率低于 5%。

低于 5% 的平均触发率并不代表专业用户只会遇到 5% 的影响。安全分类器的触发并非均匀分布,对普通写作和摘要用户几乎没有存在感,但对安全研究、逆向工程、漏洞分析、生物信息学和模型评测团队而言,触发概率可能明显高于总体平均值。

Opus 5 的“更少限制”因此比表面看起来更重要。开发者真正需要的不是模型在安全评测里少拒绝几道题,而是同一条自动化工作流不会因为分类器切换模型,突然改变推理风格、工具选择和输出质量。

目前公开报道尚未给出 Opus 5 安全策略的完整技术细节,因此不能把“限制更少”理解为完全没有护栏。更合理的判断是,Opus 5 没有照搬 Fable 5 那种 Mythos 级高风险分类与自动降级机制,或者至少缩小了相关机制的触发范围。

三代旗舰放在一起,Opus 5 的优势首先是可部署性

Opus 5 的精确定价、上下文窗口和完整基准测试数字,在现有公开材料中仍需等待 Anthropic 进一步披露。可以确认的是,它的价格低于 Fable 5,而 Fable 5 的标准价格为每百万输入 Token 10 美元、输出 Token 50 美元。

| 模型 | 发布时间 | 每百万输入 Token | 每百万输出 Token | 安全与访问策略 | 更适合的场景 | |---|---:|---:|---:|---|---| | Claude Opus 4.8 | 2026 年 5 月 | 5 美元 | 25 美元 | 通用 Claude 安全策略 | 高质量编码、复杂 Agent、作为 advisor 使用 | | Claude Fable 5 | 2026 年 6 月 9 日 | 10 美元 | 50 美元 | 高风险请求可能自动降级至 Opus 4.8 | 超长复杂任务、科学研究、能力上限测试 | | Claude Mythos 5 | 2026 年 6 月 9 日 | 10 美元 | 50 美元 | 取消部分公众版限制,仅向特定合作伙伴开放 | 授权网络安全与高风险研究 | | Claude Opus 5 | 2026 年 7 月 24 日 | 低于 10 美元,具体数字待确认 | 低于 50 美元,具体数字待确认 | 比 Fable 5 限制更少 | 通用旗舰、生产级 Agent、复杂编码与知识工作 |

这张表揭示了 Anthropic 产品线过去一个多月的尴尬:Fable 5 虽然能力更高,但价格正好是 Opus 4.8 的两倍。对一次性高价值任务,这个差价可以接受;对需要持续读代码、调用工具和反复纠错的 Agent,输出 Token 每百万 50 美元很容易把成本放大。

成本差异在长任务里不是抽象数字。假设一个代码 Agent 每次任务累计消耗 20 万输入 Token 和 5 万输出 Token,按 Fable 5 的公开单价计算,单次成本约为 4.5 美元,其中输入 2 美元、输出 2.5 美元;若使用 Opus 4.8,同样用量约为 2.25 美元。

Opus 5 只要把价格压到 Fable 5 以下,就会直接改变模型选择逻辑。即使它没有回到 Opus 4.8 的 5/25 美元水平,只要在大量任务上的能力接近 Fable 5,同时避免自动降级,它就可能拥有更好的单位任务成本。

单位任务成本是完成一个可验收任务所需的总模型费用,而不是单个 Token 的标价。一个单价更低但需要反复重试的模型,最终可能更贵;一个单价略高但能一次完成跨文件修改、测试和修复的模型,反而可能节省工程时间与总推理费用。

“更少限制”对 Agent 比跑分提升更有价值

Agent 是能够自主规划步骤、调用外部工具并根据执行结果继续行动的模型系统。对 Agent 来说,最重要的并非单轮回答有多漂亮,而是几十轮执行中的能力、规则和行为边界保持一致。

Fable 5 的自动降级机制会在一个隐蔽位置制造模型漂移。前十轮可能由 Fable 5 分析大型代码库,第十一轮因为涉及漏洞利用、权限边界或二进制行为而切换到 Opus 4.8,后续模型看到的是同一段上下文,开发者得到的却不再是同一个能力档位。

模型漂移是同一工作流中模型能力或行为模式发生非预期变化的现象。它会表现为工具调用策略改变、前后判断冲突、对既定计划的遵循度下降,甚至让自动评测难以复现同一个问题。

Opus 5 如果能够减少这种非预期切换,就会特别适合代码安全审查和企业内部工程任务。现代软件开发很难把“正常编码”和“安全敏感内容”彻底分开,认证逻辑、沙箱逃逸修复、依赖漏洞分析和权限检查都会出现攻击性术语,但这些内容本身并不意味着恶意用途。

更少限制也不等于开发者可以忽视安全责任。企业仍需对工具权限、网络访问、文件系统范围和人工审批节点进行控制,因为模型愿意回答更多问题,并不代表它执行的每一步都应该被系统自动放行。

Fable 5 不会立刻失去价值,但会退回极少数上限场景

Fable 5 的价值仍然建立在 Mythos 级底座的能力上。Anthropic 在发布 Fable 5 时宣称,该模型在 SWE-Bench Pro、GDPval-AA、GDP.pdf、Blueprint Bench 2 和 AutomationBench 等测试中超过 Opus 4.8,并在软件工程、视觉理解和科学研究等长周期任务上表现突出。

Fable 5 的代表性案例也确实足够激进。公开材料显示,Stripe 曾让它处理一个约 5000 万行代码的 Ruby 代码库迁移任务,并在一天内完成原本预计需要一个团队工作两个多月的任务;在生命科学方向,相关 Mythos 级模型则被用于蛋白质设计和长周期基因组研究。

这些案例证明 Fable 5 的上限很高,却没有证明所有企业都该默认使用它。实际生产环境里,大多数任务没有 5000 万行代码,也不需要模型自主研究一周;团队更常面对的是几万到几十万行代码、可控的工具链和每天数百次调用。

Opus 5 的真正竞争对象因此不是某个 benchmark 榜首,而是 Fable 5 在生产环境中的边际收益。只要 Opus 5 能用更低价格完成 90% 以上的同类任务,同时减少安全分类器误伤,它就足以成为默认模型,把 Fable 5 挤到少数高价值、低频率任务中。

这种分工类似于数据库中的冷热分层。Opus 5 负责高频、复杂但常规的生产工作,Fable 5 只在科学研究、超大代码库迁移或模型能力上限验证中启用,便宜模型则继续处理分类、检索和格式转换。

Anthropic 正在修正一个过于复杂的旗舰产品线

Anthropic 在两个月内先后推出 Mythos Preview、Opus 4.8、Fable 5、Mythos 5 和 Opus 5,产品线迭代速度很快,但命名与定位已经开始增加选型成本。开发者不仅要判断能力档位,还要理解哪些模型带有高风险分类器、哪些模型只向合作伙伴开放、哪些流量适用特殊保留政策。

Fable 5 的出现曾让 Claude 产品线从传统的 Haiku、Sonnet、Opus 三档结构,扩展出一个更昂贵的 Mythos 能力层。Opus 5 如今又以更低价格和更少限制回归,说明 Anthropic 仍然希望“Opus”承担公开市场上的主力旗舰角色,而不是让 Fable 成为所有高级任务的默认答案。

这也是一次明显的商业纠偏。Fable 5 每百万输出 Token 50 美元的价格适合展示技术上限,却不适合快速争夺大规模 Agent 工作负载;后者需要可预测的成本、稳定的可用性,以及不会在任务中途突然变化的模型行为。

OpenAI、Google 与 Anthropic 的旗舰竞争也正在从单模型跑分转向系统成本。开发者越来越关心完成一个真实 Pull Request 要花多少钱、连续运行 8 小时会不会偏航、复杂工具调用能否复现,以及安全策略是否会误伤正常业务。

开发者现在应该怎么选

Opus 5 更适合被视为新的通用旗舰候选,而不是无条件替换所有 Claude 模型。现阶段最合理的做法,是按照任务价值、持续时间与安全敏感度分层,而不是把最贵或最新的模型塞进每个环节。

  • 复杂编码与生产级 Agent: 优先测试 Opus 5,重点观察跨文件修改成功率、工具调用稳定性和单任务总成本。
  • 超长研究与能力上限任务: 保留 Fable 5 作为对照,确认它相对 Opus 5 的质量收益是否覆盖额外费用。
  • 网络安全相关正常业务: 重点比较两款模型的误判率和任务连续性,而不是只看平均拒答率。
  • 分类、抽取与简单改写: 继续使用 Sonnet 或 Haiku 档模型,旗舰模型在这些任务上的投入产出比通常不高。
  • 受监管数据与敏感代码: 在采用前核对 Opus 5 的数据保留、日志和企业隐私条款,不应直接套用 Fable 5 或旧版 Opus 的政策。

企业评测也应该把“是否发生模型降级”单独列为指标。传统评测通常只记录最终正确率,但对长链路系统而言,模型是否在过程中被替换、替换后成本如何计算、行为是否可复现,同样决定了产品能否上线。

Opus 5 更像一款务实旗舰,而不是又一次参数炫技

Opus 5 当前最有吸引力的卖点,是 Anthropic 同时处理了 Fable 5 的两块短板:价格过高和限制过重。前者决定开发者能不能规模化使用,后者决定模型能不能稳定进入真实工作流。

Opus 5 是否全面超过 Fable 5,仍需等待完整定价、上下文规格、官方模型卡和第三方基准测试。现阶段没有必要根据“新旗舰”三个字直接推断它在每个 benchmark 上都领先,也不能假设它拥有 Mythos 5 的全部高风险领域能力。

这次更新的方向仍然值得肯定。Fable 5 证明了 Anthropic 能把高风险前沿能力包装成公众产品,Opus 5 则进一步回答了一个更现实的问题:怎样让这种级别的智能真正进入开发者每天都在运行的 Agent 和代码工作流。

对大多数团队而言,最好用的旗舰从来不是跑分最高的那一个,而是能在预算、能力和规则之间维持稳定平衡的那一个。就目前披露的信息看,Opus 5 比 Fable 5 更接近这个答案。

参考来源

相关推荐

查看全部