Ox Alpha匿名上线,疑似智谱新模

匿名模型 Ox Alpha 已在 OpenRouter 限时免费开放,10 项 DeepSWE 初测通过率达到 80%。分词器、参数接口与报错特征均指向智谱,但小样本跑分和匿名身份决定了它暂时只能算一场公开灰度测试。
Ox Alpha 带着 100 万上下文匿名登场
匿名模型 Ox Alpha 于 8 月 20 日登陆 OpenRouter,并在截至 8 月 22 日的首轮社区测试中拿到 80% 的 DeepSWE 任务通过率。 OpenRouter 将它标记为 stealth model,也就是暂不公开开发者和正式产品名的匿名预览模型;按照目前公布的安排,它将免费开放一周,若计划不变,体验窗口大约持续至 8 月 27 日。
Ox Alpha 是一款支持文本、图像和视频输入的超长上下文多模态模型。 OpenRouter 展示的规格包括 1,048,576 token 上下文窗口,以及单次最多 131,072 token 的输出上限;终端编程智能体 OpenCode 也已经把它放进免费套餐,并宣称每天可处理最高 100 万亿 token。

这组配置的重点不是单纯把上下文做到了 100 万 token,而是把长上下文、多模态和编程智能体能力塞进了同一个端点。 对真实开发任务而言,这意味着模型理论上可以同时读取大型代码库、设计稿截图、报错录屏和需求文档,再连续输出较长的分析或补丁。它瞄准的不是普通聊天场景,而是 Claude Code、OpenCode 一类会读仓库、操作终端并反复修复问题的 Agent 工作流。
不过,100 万 token 的标称窗口不等于模型能稳定记住并正确调用其中每一处信息。 长上下文模型真正需要验证的是有效召回率、跨文件推理、长任务中的指令保持,以及上下文增长后的延迟和成本。131,072 token 的最大输出同样更接近能力上限,而不是建议开发者让它一次生成十几万 token 的代码。
80% 是亮眼信号,但还不是胜负结论
DeepSWE 是用于衡量模型读取真实代码仓库、定位软件问题并生成有效补丁能力的编程评测。 与只要求补全单个函数的题库不同,这类测试更接近真实软件工程:模型需要理解项目结构、追踪跨文件依赖、判断失败原因,并提交能够通过验证的修改。
开发者 Ben Davis 让 Ox Alpha 完成了 10 项 DeepSWE 任务,结果是通过 8 项、失败 2 项,平均通过率为 80%。 按公开结果,它领先 Claude Fable 5 的 65% 达到 15 个百分点,相对增幅约为 23.1%;与 GLM-5.3 和 Grok 4.6 的 62% 相比高出 18 个百分点,与 GPT-5.6 Sol 的 52% 相比高出 28 个百分点。
| 模型 | 10 项 DeepSWE 平均通过率 | 与 Ox Alpha 差距 | 测试设置备注 | |---|---:|---:|---| | Ox Alpha(stealth) | 80% | — | 每项执行 1 次,共通过 8 项 | | Claude Fable 5(max) | 65% | -15 个百分点 | 公开对比中其他模型每项最多执行 4 次 | | GLM-5.3(max) | 62% | -18 个百分点 | 推理档位为 max | | Grok 4.6(xhigh) | 62% | -18 个百分点 | 推理档位为 xhigh | | GPT-5.6 Sol(max) | 52% | -28 个百分点 | 推理档位为 max |
这次 80% 更适合被视为强信号,而不是 Ox Alpha 已经击败前沿模型的证据。 原因首先是样本只有 10 项,单个任务就会让总成绩波动 10 个百分点;在如此小的样本下,8/10 对应的统计不确定性很高,其 95% 置信区间粗略可落在约 49% 至 94% 之间。
测试口径不完全一致进一步削弱了横向比较的确定性。 Ox Alpha 每个任务只运行一次,而其他模型在部分统计中每项运行了 4 次,再按成功次数计算通过率。Agent 编程任务对工具调用、初始随机性、依赖安装、超时设置和测试环境十分敏感,一次成功可能来自正确推理,也可能来自恰好走对了执行路径;一次失败同样可能只是工具链中断。
真正有价值的结论是 Ox Alpha 已经表现出前沿级代码代理潜力。 一个匿名预览模型能在 10 项真实仓库任务中完成 8 项,至少说明它不是单靠长上下文和漂亮规格吸引流量。它是否稳定强于 Claude Fable 5、GPT-5.6 Sol 或 GLM-5.3,则需要更多仓库、统一 Harness、相同预算和多次重复实验才能回答。
为什么社区把线索指向智谱
分词器指纹是通过比较不同文本在模型中被切分出的 token 数量和模式,反推模型技术谱系的方法。 同一段文本在不同分词器下可能被切成完全不同的 token,因此数字、罕见字符、多语言混排和代码符号都可以充当探针。
目前最强的一条归属线索,是 Ox Alpha 与 GLM-5.3 的 token 计数近乎完全重合。 有研究者使用 25 组差异明显的提示词测试,发现两者原始 token 数基本一致,Ox Alpha 每次只固定多出 75 个 token;固定偏差更像平台包装层或隐藏系统提示带来的开销,而不是底层分词器不同。
另一组测试也发现 Ox Alpha 在 11 项分词探针上与 GLM 系列全部匹配。 例如某项数字探针中,DeepSeek 使用了 98 个 token,而 Ox Alpha 与 GLM 均为 29 个 token;其他厂商模型与这组探针的最高匹配数量不超过 4 项。单看某一次计数没有太强证明力,但多个结构差异明显的提示词持续同构,巧合概率会迅速下降。
参数接口和错误响应构成了比名字联想更实际的旁证。 社区测试显示,Ox Alpha 与 GLM-5.3 都强制开启推理,思考档位集中在 low、high、max,默认使用 max,支持的采样参数和限制方式也高度相似。更引人注意的是,Ox Alpha 曾返回被社区认为具有智谱服务特征的 1210 状态码。
视频编码器行为和知识范围也被认为与智谱现有路线相符。 Ox Alpha 可以读取图像和视频,而公开版本的 GLM-5.3 尚未提供对应视觉端点;但智谱从 GLM-4.1V-Thinking、GLM-4.5V、GLM-4.6V 到 GLM-5V-Turbo,一直在推进视觉推理与多模态 Agent。把 GLM-5.3 的长上下文、推理控制和代码能力,与 GLM-5V 路线的视觉能力合并,技术上并不突兀。
| 身份线索 | 指向智谱的力度 | 仍存在的反例或不确定性 | |---|---|---| | 25 组提示词 token 数与 GLM-5.3 基本一致 | 强 | 同源或复用分词器不等于模型权重来自同一家公司 | | 固定多出 75 token | 中等 | 可能只是 OpenRouter 或供应商包装层系统提示 | | 推理档位、参数限制高度相似 | 中到强 | 兼容相同服务框架也可能产生类似接口 | | 出现 1210 状态码 | 中到强 | 尚缺少官方错误码映射确认 | | 支持图像和视频 | 中等 | 多家厂商都具备原生多模态能力 | | 智谱曾用 Pony Alpha 匿名测试 | 中等 | 历史惯例不能直接证明本次归属 |
智谱过去使用匿名模型做发布前测试的经历,让这套推断显得更可信。 此前 Pony Alpha 曾在 OpenRouter 以匿名模型出现,随后被确认属于 GLM-5 系列。社区因此把 Ox 与 Pony 的命名关系戏称为“牛马组合”,但真正有价值的仍是分词器、接口和响应特征,而不是代号本身。
小米仍是候选,但证据明显更弱
小米 MiMo 仍然是 Ox Alpha 的另一项主流猜测。 原因是小米此前曾把 MiMo-V2-Pro 的早期匿名版本以 Hunter Alpha 名义放上 OpenRouter,长上下文、多模态、Agent 和 Coding 也符合 MiMo 的产品方向。
小米猜测目前更多依赖发布惯例,而智谱猜测已经出现技术指纹。 两家公司都有匿名公测动机,也都需要在模型正式亮相前收集真实编程任务反馈;但截至 8 月 22 日,公开信息中尚未出现能让 Ox Alpha 与 MiMo 分词器、错误码或服务端参数逐项对应的同等级证据。
Ox Alpha 的真实开发者仍未得到任何官方确认。 分词器可以复用,服务框架可以兼容,错误响应也可能来自共同的基础设施;即使最终确认模型与 GLM 技术栈有关,它也可能是下一代 GLM、多模态 GLM-5.3 变体,或尚未命名的内部实验版本,不能直接把它写成某个已确定产品。
免费一周,本质上是把发布会变成压力测试
匿名限免是一种让模型先接受真实用户检验、再公布品牌的灰度发布方式。 厂商暂时拿掉名称后,开发者不会因为“下一代 GPT”或“国产模型”等标签预设结论,产生的成功率、失败日志和主观反馈通常比定向邀请测试更接近真实市场。
OpenCode 所称的每日 100 万亿 token 配额,更像压力测试目标而非常规福利。 100 万亿 token 等于 100,000,000,000,000 token;即便大量请求无法真正达到这一上限,这个数字也清楚说明供应方希望模型被高频接入终端智能体,连续处理代码库、网页、图片和视频,而不是只接受几轮聊天。
免费并不意味着这场测试没有交换成本。 模型供应方承担推理费用,开发者则贡献真实任务分布、失败模式和使用反馈。内部 Benchmark 很难覆盖依赖冲突、脏代码、无效测试、终端权限、超时和网页变化等问题,而这些恰恰决定了编程 Agent 在生产环境里是否可用。
零数据保留承诺降低了测试门槛,但仍不应被等同于可处理敏感数据的企业级保证。 在模型身份、供应方、日志策略和合规边界完全公开之前,开发者不应上传未发布源码、客户数据、生产凭证、内部视频或带有个人信息的文档。匿名模型适合跑公开仓库和脱敏任务,不适合承担无法追责的数据处理流程。
值得试,但不值得现在就替换生产模型
Ox Alpha 当前最合适的定位,是一个规格激进、初测优秀的前沿候选模型。 免费、100 万 token 上下文、原生图像与视频输入、13 万 token 输出上限,再加上 8/10 的 DeepSWE 初测结果,让它非常适合用来验证大型仓库理解、多模态调试和长链路 Agent 任务。
开发者现阶段应该测试边界,而不是只重复排行榜题目。 更有信息量的任务包括:一次读取数百个源文件后定位跨模块缺陷;根据报错录屏和日志还原操作路径;在连续数小时的工具调用中保持目标;比较 10 万、50 万和 100 万 token 下的召回率;以及重复运行同一修复任务,观察成功率和补丁质量是否稳定。
生产环境暂时不应把 Ox Alpha 作为唯一依赖。 匿名预览模型可能随时调整权重、系统提示、限速和可用时间,免费政策也可能在一周后结束;它目前没有公开版本承诺、长期价格、稳定性指标和正式服务等级。更稳妥的做法是并行评测,并保留成熟模型作为回退路径。
我们的判断是,Ox Alpha 最值得关注的并非“80% 碾压谁”,而是智谱可能正在测试一款融合长上下文、代码 Agent 与原生多模态的新模型。 如果后续身份揭晓后确属智谱,这意味着 GLM 的下一步不只是继续提高文本推理分数,而是把视觉、视频和真实软件工程工作流合并到统一模型中;如果最终不是智谱,这套技术指纹分析也说明,大模型发布正在进入一个先匿名跑真实流量、再正式命名的新阶段。
参考来源
- IT之家:神秘 Ox Alpha AI 模型限免上架,DeepSWE 初测与规格汇总——整理了 10 项 DeepSWE 测试结果、OpenRouter 展示的上下文与输出规格,以及模型归属线索。
- 知乎:如何看待 OpenCode 推出匿名模型 Ox Alpha——包含社区对分词器、推理参数、错误码、多模态路线和潜在开发者的讨论。



