AI 快讯Step 5预览版跻身效率前沿
模型上新

Step 5预览版跻身效率前沿

2026-09-19T10:05:07.982Z
Step 5预览版跻身效率前沿

StepFun Step 5 Preview于9月18日进入Artificial Analysis帕累托前沿,显示其智能水平与使用成本已形成当前评测体系下难以被同时超越的组合。

Step 5 Preview跻身帕累托前沿,阶跃星辰开始打“有效智能”牌

StepFun(阶跃星辰)的新模型 Step 5 Preview 已于 9 月 18 日被 Artificial Analysis 纳入评测,并进入该平台的帕累托前沿。距离评测上线仅一天,这个结果释放出的信号很明确:Step 5 Preview 未必是绝对能力最强或价格最低的模型,但它在智能水平和成本之间,已经站到了当前市场最有竞争力的一条线上。

**帕累托前沿是指一组无法在所有关键维度上被其他选项同时超越的方案。**放到大模型评测里,如果一个模型位于“智能水平—价格”帕累托前沿,就意味着暂时找不到另一个模型,既比它能力更强,又比它成本更低。

这比单纯拿到某个榜单第一更值得开发者关注。

Artificial Analysis智能水平与价格散点图示意,Step 5 Preview位于帕累托前沿,横轴为成本、纵轴为智能指数,突出右上与左上方向的竞争关系

Step 5 Preview赢的不是单项第一,而是组合效率

**Step 5 Preview此次最重要的成绩,是进入Artificial Analysis定义的高性价比模型集合。**帕累托前沿不是传统排行榜,不会简单地把所有模型从第一名排到最后一名,而是同时考虑能力和代价。

举个简单的例子:模型 A 的能力得分为 90,成本是 10 美元;模型 B 的能力得分为 88,成本是 2 美元。A 更强,B 更便宜,两者都可能留在帕累托前沿。模型 C 如果能力只有 85、成本却要 5 美元,就会被 B 同时从能力和价格两个维度压过,因此无法进入前沿。

**进入帕累托前沿意味着Step 5 Preview不存在明显的“同价更强”或“同能力更便宜”替代项。**这并不等于模型在所有任务上领先,也不意味着它适合所有业务,但至少在 Artificial Analysis 当前采用的统一评测与成本核算方法下,它已经具备直接进入模型选型清单的资格。

截至 2026 年 9 月 19 日,Artificial Analysis 展示的 Step 5 Preview 页面将其标记为帕累托前沿模型。由于该平台的模型成绩、价格数据和前沿曲线会随新模型加入及方法论升级动态变化,本文不引用未经固定快照确认的绝对分数,而重点分析这一位置本身代表的产品意义。

Artificial Analysis这次评的是什么

**Artificial Analysis Intelligence Index是一个将多项独立基准测试汇总后形成的综合模型能力指数。**它试图回答的不是“模型会不会做某一道题”,而是模型在推理、编程、数学、知识和智能体任务等多个维度上的整体表现。

当前使用的是 Intelligence Index v4.3。这个版本以 AutomationBench-AA 替换了此前的 τ³-Banking,并将 Terminal-Bench 升级至 4.0,说明评测重点正在从相对静态的问答能力,继续向工具使用、终端操作和自动化执行迁移。

**AutomationBench-AA是一项用于衡量模型完成自动化任务能力的基准测试。**这类测试通常比选择题更接近真实应用,因为模型不仅要给出正确答案,还需要理解环境、拆分步骤并持续执行任务。

**Terminal-Bench是一项评估AI模型在终端环境中完成实际操作任务能力的基准测试。**模型可能需要阅读文件、修改配置、运行命令、定位错误并验证结果,因此它更能反映编程助手和智能体产品的实际可用性。

这次方法论变化对 Step 5 Preview 的意义不小。如果一个模型能在 v4.3 中保持有竞争力的位置,说明它的优势大概率不只来自知识记忆或考试型推理,也经受了更偏执行能力的测试。

不过,综合指数依然会掩盖能力结构差异。两个 Intelligence Index 接近的模型,一个可能更擅长代码与终端任务,另一个可能在数学和长链推理上更稳定,开发者不能只看一个总分就完成选型。

成本算法比每百万Token报价更接近真实账单

**Artificial Analysis的加权任务成本,是按完成一组 Intelligence Index 任务实际消耗的输入、缓存、推理和回答Token计算出的综合成本。**每项评测的成本会先除以任务数量,再按照它在 Intelligence Index 中的权重进行汇总。

平台同时使用 7:2:1 的默认比例混合缓存输入、普通输入和输出价格。这个比例意味着,在其标准化价格视图中,每 10 份 Token 成本里,有 7 份按缓存命中价格计算、2 份按普通输入价格计算、1 份按输出价格计算。

| 成本指标 | 计算方式 | 更适合回答的问题 | 主要局限 | |---|---|---|---| | 每百万Token标价 | 分别展示输入与输出单价 | 模型的基础计费是否便宜 | 无法反映模型为解决任务生成了多少推理Token | | 7:2:1混合价格 | 按缓存输入、普通输入、输出进行加权 | 高频复用上下文时的平均成本如何 | 业务缓存命中率不同,实际账单会变化 | | Intelligence Index任务成本 | 统计完成评测任务的完整Token消耗 | 获得一定智能水平到底要花多少钱 | 仍然受评测任务类型和权重影响 | | 500 Token端到端时间 | 计入首Token等待、思考时间与输出时间 | 用户多久能拿到一段完整回答 | 不能完全代表超长输出和高并发表现 |

**任务成本比标价更能揭示推理模型的真实效率。**一个输出单价很低的模型,如果每道题都要生成数万枚隐藏推理 Token,最终成本未必便宜;另一个单价略高但推理路径更短的模型,反而可能拥有更低的任务成本。

这也是 Step 5 Preview 进入帕累托前沿值得重视的原因。它不是只靠低报价进入视野,而是在完成统一能力任务之后,仍然维持了具有竞争力的成本—能力组合。

它和“最快”“最强”“最便宜”不是一回事

**帕累托前沿模型并不自动等于速度最快的模型。**Artificial Analysis 将输出速度、首 Token 延迟、思考时间和生成 500 Token 的端到端时间分别纳入性能视图,因此一款模型可能在智能水平与价格图上位于前沿,却在实时交互场景中落后于轻量模型。

**帕累托前沿模型也不自动等于综合得分最高的模型。**最高能力区间的旗舰模型即使成本明显更高,仍然适合科研推理、复杂代码迁移和低容错任务;而 Step 5 Preview 的优势,更可能体现在大规模部署时的边际成本控制。

**帕累托前沿模型同样不自动等于绝对价格最低的模型。**Flash、Mini 和小参数模型通常拥有更低单次调用成本,但它们可能需要更多重试、额外校验或者复杂工作流补偿,最终业务成本未必更低。

| 模型类型 | 智能上限 | 典型成本 | 典型延迟 | 更适合的场景 | |---|---:|---:|---:|---| | 高端旗舰模型 | 最高 | 高 | 中到高 | 高难推理、关键代码、复杂智能体 | | Step 5 Preview这类前沿模型 | 高 | 中低至中等 | 需按实际服务验证 | 批量推理、企业助手、代码与自动化任务 | | Flash类模型 | 中等 | 低 | 低 | 搜索改写、分类、摘要、实时交互 | | 2B级小模型 | 有限 | 很低 | 很低 | 端侧任务、固定流程、隐私敏感场景 |

因此,Step 5 Preview 的直接竞争对象未必只是能力最高的一档模型。它真正瞄准的是“旗舰模型太贵、轻量模型又不够用”的中间地带,而这里恰恰是企业工作负载最密集的区域。

对开发者而言,价值要落到三个指标上

**开发者评估Step 5 Preview时首先要验证的是有效任务成本。**有效任务成本不只是模型账面价格,还要加入重试次数、工具调用失败率、人工复核时间以及长推理产生的额外消耗。

一个模型即使单次任务贵 20%,只要能把一次成功率从 70% 提升到 90%,总体成本就可能更低。反过来,一个看起来便宜的模型如果经常漏掉约束、输出不可执行代码或在多轮工具调用中失去状态,低价并没有太大意义。

**开发者评估Step 5 Preview时其次要观察延迟分布。**平均延迟只能描述典型情况,线上产品更关心 P95 和 P99 延迟,因为极慢请求会直接破坏对话体验,也会占用智能体工作流中的执行队列。

Artificial Analysis 使用生成 500 Token 所需的端到端时间来降低“只看每秒输出 Token”的误导。对于推理模型而言,用户真正等待的是完整答案,而不是模型开始吐出第一个字的速度。

**开发者评估Step 5 Preview时还要单独测试任务稳定性。**预览版模型通常可能经历权重、推理策略、服务参数或产品策略调整,公开评测中的一次成绩并不能替代持续回归测试。

建议企业至少建立以下四组内部样本:

  • 100 至 300 条高频真实请求,用于衡量基础成功率;
  • 50 条历史失败案例,用于观察模型是否重复踩坑;
  • 20 至 50 条长上下文任务,用于验证信息召回和约束保持;
  • 20 条多步骤工具任务,用于统计中途失败率和恢复能力。

只有当 Step 5 Preview 在企业自己的任务集上同时降低成本、错误率或响应时间,它的帕累托前沿位置才真正有业务价值。

“Preview”意味着成绩成立,但产品结论还不能下死

**Step 5 Preview中的Preview意味着当前版本更适合被理解为能力预览,而不是长期不变的生产规格。**预览阶段的模型可能继续调整上下文长度、速率限制、定价、输出风格和推理预算,这些变化都可能影响它在成本—能力图中的位置。

当前需要保持谨慎的地方主要有三点:

  1. **评测排名会变化。**新的高性价比模型上线后,原有帕累托前沿可能被重新改写。
  2. **公开基准不等于业务数据。**榜单上的代码、数学与智能体能力,未必能直接迁移到金融、医疗、客服等垂直任务。
  3. **服务质量尚需长期观察。**并发能力、地区延迟、版本稳定性和高峰期可用性,往往不会完整反映在模型能力得分中。

预览版的正确用法不是立即替换生产系统,而是进入灰度测试。开发者可以先让 Step 5 Preview 承担 5% 至 10% 的非关键流量,与现有主模型进行盲测,再根据成功率、端到端成本和用户偏好决定是否扩大比例。

阶跃星辰正在补齐模型公司的产品拼图

**Step 5 Preview进入帕累托前沿,说明阶跃星辰开始在通用语言模型的效率维度上建立更清晰的外部认知。**相比只展示参数规模或少数内部跑分,第三方成本—能力坐标更容易让开发者判断模型能否进入实际部署。

阶跃星辰此前已经公开了视频生成方向的 Step-Video-TI2V 项目,其官方 GitHub 资料展示了固定镜头、平移、摇摄、推拉、环绕、跟随和焦点转移等多种镜头控制能力。Step 5 Preview 则把外界注意力重新拉回通用模型竞争,显示这家公司仍在推进语言、推理与多模态并行发展的路线。

这种路线的挑战也很直接。视频、语音和大语言模型都需要持续投入训练与推理资源,而模型产品最终比拼的不只是一次发布时的能力,还包括迭代速度、服务稳定性和单位智能成本能否持续下降。

我们的判断:这是一次有效上桌,但还不是胜负手

**Step 5 Preview登上Artificial Analysis帕累托前沿,是一次有含金量的“上桌”。**它证明阶跃星辰的新模型至少已经进入全球模型选型体系中的有效竞争区,而不是只在单一中文榜单或厂商自测中表现突出。

这个成绩的含金量主要来自评测坐标的变化。行业正在从“谁的分数最高”转向“花同样的钱谁能完成更多任务”,模型能力也开始从静态答题转向终端操作、自动化和工具调用。Step 5 Preview 恰好在这个时间点进入前沿,方向是对的。

但这还不是决定市场格局的胜负手。预览版能否变成稳定版本、实际定价能否长期维持、复杂任务成功率能否复现,以及服务端能否支撑规模化流量,都会决定它能在前沿线上停留多久。

对开发者来说,现阶段最合理的结论不是“立即迁移”,而是“值得马上测试”。如果 Step 5 Preview 能在企业自有任务集上复现 Artificial Analysis 展示出的成本—能力优势,它就有机会成为旗舰模型之外,一个更务实的生产级选择。

参考来源

  • StepFun官方GitHub组织主页:阶跃星辰公开技术项目与代码仓库入口,可用于核对其开源技术布局。
  • Step-Video-TI2V项目:阶跃星辰公开视频生成项目,包含镜头控制方式及公开评测数据,可作为其多模态技术路线的补充资料。
  • StepFun Hugging Face主页:阶跃星辰公开模型与相关技术资产主页;该链接仅用于核对公开资源,不代表 Step 5 Preview 已开放权重。

相关推荐

查看全部