AI 快讯阶跃Step 5 Preview现身OpenRouter
模型上新

阶跃Step 5 Preview现身OpenRouter

2026-10-08T18:03:20.784Z
阶跃Step 5 Preview现身OpenRouter

阶跃星辰的 Step 5 Preview 已出现在 OpenRouter 模型目录中。这款 600B 总参数、27B 激活参数的稀疏 MoE 模型支持 1M 上下文;真正值得关注的,是它能否把长上下文与 Agent 任务能力转化为稳定、可负担的实际工作流。

Step 5 Preview 登上 OpenRouter,1M 上下文旗舰模型进入聚合目录

阶跃星辰的 Step 5 Preview 近日出现在 OpenRouter 的模型目录中,给开发者增加了一个发现和比较这款模型的入口。它不是一款刚在今天发布的新模型:阶跃星辰已于 2026 年 9 月 20 日公布 Step 5 Preview。此次目录上架的新闻价值,更多在于模型开始进入开发者常用的模型发现与接入生态,而不是模型能力在这一刻突然发生变化。

Step 5 Preview 是阶跃星辰面向复杂 Agent 任务推出的旗舰基座模型。它采用稀疏混合专家架构,官方公布的总参数量为 600B、每次推理激活参数为 27B,并支持最长 1M token 的上下文窗口。模型原生支持文本和视觉输入,定位覆盖软件工程、专业知识工作与金融研究等任务。需要注意的是,模型目录出现不等同于价格、可用地区、速率限制、视觉输入能力或工具调用能力已经在所有接入渠道保持一致;这些细节应以用户实际看到的模型页面和服务说明为准。

Step 5 Preview 模型目录页面与 600B 总参数、27B 激活参数、1M 上下文等关键信息

这次上架,重要的是“可发现”,不是“模型刚发布”

OpenRouter 是一个聚合多家模型的目录与接入平台,开发者可以在一个生态中查找不同提供方的模型,并根据页面列出的能力和条件做选择。对模型厂商来说,进入这类目录可以降低开发者发现模型的门槛;对开发者来说,模型的可见性和可比较性提高了,但实际使用体验仍取决于具体提供方的服务状态、计费方式和限制。

因此,Step 5 Preview 登上 OpenRouter,不能直接解读成阶跃星辰刚刚开放了一个全新版本,也不能只凭目录页面就推断它已经具备某个固定价格或稳定供应能力。更准确的说法是:模型已经进入一个开发者熟悉的模型发现渠道,是否适合接入,还要继续看服务条款、延迟、可用性以及任务表现。

这个区分对工程团队很实际。模型在目录里“看得到”,不代表它已经满足生产环境对可用性、数据处理方式和成本可预测性的要求。尤其是长上下文模型,名义上的窗口上限和日常工作中可持续使用的有效上下文并不是一回事。评估时,除了确认输入输出限制,还要测试长输入下的首 token 延迟、完整任务耗时、结果稳定性和实际计费。

600B 总参数,27B 激活:稀疏 MoE 的效率账

稀疏 MoE(Mixture of Experts,混合专家)是一种将模型容量分布在多个专家网络中、并在处理每个 token 时只调用其中部分专家的架构。Step 5 Preview 公布的 600B 是总参数量,27B 是每次推理激活的参数量;两者不能混为一谈,也不能据此简单断言它的运行成本等同于一个 27B 稠密模型。

直观地说,MoE 像一支规模很大的专家团队,每个问题只分派给其中一部分成员处理。这样做的目标,是让模型保留较大的知识和能力容量,同时避免每一步都计算全部参数。不过,实际成本还受到专家路由、显存与通信开销、批量大小、上下文长度和服务端硬件等因素影响。激活参数少是效率设计的信号,不是成本或速度的保证书。

这也是 Step 5 Preview 值得观察的地方。它试图把高容量模型的任务能力,与稀疏激活带来的推理效率结合起来。阶跃星辰此前公布的 Artificial Analysis Intelligence Index 得分为 44,并称模型的单任务成本约为 Claude Opus 5 的八分之一。这个数字来自厂商发布时对特定评测和成本口径的描述,不宜直接外推到所有任务、所有服务渠道,也不能替代开发者按自身工作负载做的成本测量。

1M 上下文的价值:少切片,但不是无限记忆

1M 上下文是 Step 5 Preview 最容易被记住的参数。上下文窗口是模型一次处理输入和生成内容时可容纳的 token 数量上限;1M token 的窗口,理论上可以容纳规模很大的代码、文档、日志或研究材料,让模型有机会在同一任务中关联更多原始信息。

对软件工程团队来说,这可能意味着把多个模块、测试结果、配置文件和故障日志放进同一次分析任务,而不必频繁手动摘录。做尽调或研究时,也可以把长篇报告与来源材料放在一起,让模型围绕证据进行归纳和交叉核对。这类能力真正的收益不是“能塞更多字”,而是减少切分任务时丢失的关联:一个错误可能出现在代码、依赖版本和部署配置之间,单独看任何一份材料都不够。

但长上下文并不会自动带来可靠的长程推理。模型可能在很长的输入里漏看关键细节,也可能对相互矛盾的材料给出过度自信的结论。输入长度越长,处理成本和等待时间也可能越高。实际评估时,应当准备已知答案的长文档任务,检查模型能否找对证据、给出来源位置,并在资料不足时明确承认不确定,而不是只测试它能否接收一百万 token。

此外,1M 是窗口规格,不代表每个 OpenRouter 提供方都开放相同的最大输入,也不代表任何任务都值得把完整资料一次性塞入。若一个问题只需要几段相关代码,先做检索和筛选,通常比把整个仓库交给模型更省钱、更快,也更容易定位错误。上下文窗口扩大了可选工作方式,但没有废除检索、索引和分阶段验证。

面向 Agent:基准分数之外,要看任务是否能闭环

Agentic 任务是指模型不仅生成一段回答,还要拆解目标、使用工具、依据中间反馈修正步骤,最终完成一项多阶段任务。Step 5 Preview 的发布定位正是这类真实工作流,而不是只追求单轮问答的流畅度。

阶跃星辰披露的评测信息包括软件工程、金融投资研究和跨领域深度研究等方向。相关资料提到 ALE-CLI、FrontierFinance、DRACO,以及覆盖多个代码仓库和编程任务的 StepCodeBench。厂商发布内容还提及,在一项 24 小时 GPU Kernel 优化任务中,模型将 MLA 内核峰值性能提升至 508 TFLOPS,并报告了自动化后训练实验中的准确率变化。这些结果能说明模型被测试的任务类型,却不能替代可复现的独立比较:评测环境、初始代码、工具权限、运行预算和人工干预程度都会影响结论。

开发者更应关注端到端成功率。比如模型是否能识别仓库中的关键依赖,是否能在修改代码后运行测试,是否能根据失败日志继续修复,以及最终结果能否在另一套环境中复现。单次演示成功很容易被记住,但团队真正关心的是连续多次运行时的稳定性、人工接管频率和每个成功任务的总成本。

金融研究也类似。一个模型能写出结构完整的研究备忘录,不等于它核验了引用、处理了反例或正确区分事实与推断。若要用于专业工作流,仍需要设置来源校验、计算复核和人工审批环节。对高影响决策而言,生成质量只是流程的一部分,不是责任链的替代品。

和竞品比较,别只盯着“开源前三”

目前公开材料中,阶跃星辰将 Step 5 Preview 描述为全球开源模型中的领先者,并列出与 Claude Opus 5 等模型的成本比较。不过,“开源”在模型行业中经常被宽泛使用:权重是否公开、许可证允许什么用途、训练数据是否披露,是不同问题。参考资料称模型权重计划于 2026 年 10 月 15 日释放;截至本文日期 10 月 8 日,这仍是未来计划,不能写成已经开源。权重发布后,还要看实际许可证和可获取内容,才能判断其开放程度及本地部署可行性。

| 维度 | Step 5 Preview 当前公开信息 | 对开发者的实际意义 | |---|---|---| | 架构 | 稀疏 MoE;600B 总参数、27B 激活参数 | 显示其采用大容量、部分激活的效率路线,不等同于本地运行成本 | | 上下文 | 最长 1M token | 适合尝试长代码库、长报告分析;应测试延迟、召回和计费 | | 输入 | 原生文本与视觉输入 | 具体服务渠道是否开放完整能力,需要逐项确认 | | 定位 | 软件工程、专业知识工作、金融研究与 Agent 任务 | 适合拿端到端任务做评估,而不是只比较聊天效果 | | 权重状态 | 发布资料称计划于 2026 年 10 月 15 日释放 | 10 月 8 日尚未到计划日期,开放范围和许可证仍需核验 | | 成本比较 | 厂商称单任务成本约为 Claude Opus 5 的 1/8 | 属于厂商披露的比较口径,实际成本取决于任务和服务渠道 |

和闭源旗舰模型相比,Step 5 Preview 的看点是长上下文、稀疏 MoE 和厂商披露的任务成本;潜在差距则需要从复杂指令遵循、工具调用可靠性、长任务持续性和服务成熟度来验证。和其他开放权重模型相比,关键问题也不是谁的总参数更多,而是谁能在目标任务上以更少的人力和更可控的成本交付结果。

接下来值得观察的三件事

第一,OpenRouter 目录中的实际服务条件是否透明且稳定。模型名称相同,不意味着不同服务提供方的延迟、上下文限制、价格和可用性完全一致。用户应优先核对目录中实际显示的提供方信息,并用小规模任务做基准测试。

第二,1M 窗口能否转化为长任务优势。对照测试可以使用同一组仓库或研究材料,记录模型是否找到了关键信息、是否正确引用证据、任务花费了多久、需要多少人工修正。单看上下文上限无法回答这些问题。

第三,计划中的权重释放会带来多大程度的可控性。即使权重按计划开放,也还需要许可证允许的使用范围、硬件需求、推理实现和社区支持共同决定它是否适合自托管。对于企业用户,权重可得性、模型可部署性与数据治理能力不是同一个概念。

判断:值得进入评测名单,先别把目录上架当成生产验证

Step 5 Preview 出现在 OpenRouter,降低了开发者发现这款模型的门槛。它的参数组合和 1M 上下文规格有明确的工程吸引力,尤其适合拿长代码库分析、跨文档研究和多步骤任务做验证。阶跃星辰披露的基准与成本数据也给出了值得追问的方向。

但眼下更稳妥的结论是“值得评测”,而不是“已经全面胜过竞品”。目录上架不能证明稳定性,超长上下文不能证明长程推理,厂商基准也不能替代真实工作负载。团队应把它与现有模型放在同一套任务集里,比较成功率、人工接管次数、端到端耗时和总成本,再决定是否纳入生产流程。

对模型开发者而言,Step 5 Preview 反映的是一条正在变得重要的路线:旗舰能力不一定只能靠每次推理激活全部参数来实现,长上下文也正在从规格竞赛走向工作流竞争。真正的分水岭,不是模型能否读完一百万 token,而是它能否在可接受的成本下,准确地找到信息、完成任务,并让结果可以复核。

相关推荐

查看全部