Grok 4.7预告:参数暴涨40%

马斯克预告 Grok 4.7 将于 9 月 12 日前后上线,参数规模增至 2.1 万亿。真正值得关注的不是模型变大,而是更高 Token 效率能否抵消速度下降。
Grok 4.7预告:参数暴涨40%
马斯克今天预告,xAI 计划在未来 10 天内推出 Grok 4.7,按 2026 年 9 月 2 日计算,目标时间落在 9 月 12 日前后。新模型的参数规模将从 Grok 4.6 的 1.5 万亿提升至 2.1 万亿,增加 6000 亿,增幅正好为 40%。
Grok 4.7 是 xAI 下一代闭源大型语言模型,定位是在 Grok 4.6 基础上继续提升推理、指令执行和复杂任务处理能力。马斯克给出的判断相当直接:除了服务速度略慢,Grok 4.7 在各方面都将优于 Grok 4.6,而且会有更高的 Token 效率。
截至 9 月 2 日,Grok 4.7 仍处于预告阶段,xAI 尚未公布正式模型卡、上下文窗口、训练数据截止时间、价格、速率限制和经过审计的基准成绩。换句话说,发布日期和 2.1 万亿参数是目前最明确的信息,而“超越所有模型”仍然是马斯克的发布前判断,不是已经得到第三方复现的结论。

目前已经确认了什么
这次预告最有价值的信息可以归纳为四点:发布时间约为 9 月 12 日、参数规模达到 2.1 万亿、推理服务速度略有下降、Token 效率有所提高。后两项直接关系到开发者的实际体验,但 xAI 还没有提供延迟和 Token 消耗的量化数据。
| 对比项 | Grok 4.6 | Grok 4.7 | 变化与判断 | |---|---:|---:|---| | 参数规模 | 1.5 万亿 | 2.1 万亿 | 增加 6000 亿,增幅 40% | | 发布时间 | 2026 年 8 月已被外部评测提及 | 预计 2026 年 9 月 12 日前后 | 最终时间仍可能调整 | | 服务速度 | 基准版本 | 官方表述为略慢 | 尚无首 Token 延迟与吞吐数据 | | Token 效率 | 基准版本 | 官方称更高 | 尚未公布具体节省比例 | | 综合能力 | Cognition 评价为仅次于 Opus 5 和 Fable 5 | 马斯克称将超越所有模型 | 均需独立评测验证 | | 上下文窗口 | 未在本次预告中说明 | 未公布 | 无法判断长上下文表现 | | 输入、输出价格 | 本次预告未说明 | 未公布 | 暂时无法计算真实任务成本 | | API 模型名称 | 已有版本信息,但本文不作接口推断 | 未公布 | 现阶段不应预设模型标识符 |
Grok 4.7 的发布日期目前更适合被理解为目标窗口,而不是不可变更的承诺。马斯克在 X 上使用的是“未来 10 天”这一相对时间表述,不同地区的上线时间、灰度开放范围以及网页端与开发者平台的开放顺序,都可能让实际可用时间出现偏差。
2.1 万亿参数很大,但不能直接等于更强
参数规模是神经网络在训练过程中学习到的权重数量,通常决定了模型能够容纳多复杂的模式和知识表示。2.1 万亿参数意味着 Grok 4.7 的名义规模达到 2.1T,相比 1.5T 的 Grok 4.6 多出 0.6T,也就是 6000 亿个参数。
参数增加 40% 并不意味着能力也会线性增加 40%。大模型表现同时受到训练数据质量、计算量、后训练方法、推理时计算预算、路由机制和工具使用能力影响;如果只是扩大参数而训练不充分,新增容量可能无法转化成同等幅度的任务收益。
Grok 4.7 的架构细节目前仍然是关键未知项。xAI 没有说明 2.1 万亿究竟是总参数量还是每次推理都会激活的参数量,也没有确认模型是否采用混合专家架构,以及单个 Token 实际调用多少参数。
混合专家模型是把大量参数划分为多个“专家”,每次只激活其中一部分的稀疏模型架构。它有点像一家拥有 100 个科室的医院:医院总规模很大,但一名患者不需要同时经过全部科室,因此总参数量和单次推理成本之间不能直接画等号。
如果 Grok 4.7 采用稀疏激活设计,那么 2.1 万亿总参数未必会带来 40% 的推理计算增长。如果它提高了单次激活参数、推理深度或者测试时计算预算,速度下降就更容易理解,但这部分只能等待 xAI 的技术报告确认。
Token 效率比参数数字更值得开发者关注
Token 效率是模型完成同一任务时,对输入、输出和中间推理 Token 的利用效率。一个模型即使单个 Token 的处理速度更慢,只要它能用更短的提示、更少的无效推理和更少的返工完成任务,端到端成本仍然可能下降。
马斯克特意强调 Token 效率,说明 xAI 想把 Grok 4.7 的卖点从“更大模型”延伸到“更少浪费”。这对于编程代理、研究代理和多轮工具调用尤其重要,因为这些场景的成本并不只来自最后一段答案,还包括上下文回填、工具结果、失败重试和模型的中间规划。
一个典型的软件修复任务可能需要模型阅读仓库、定位文件、调用测试并多次修改代码。较弱模型即使每秒输出更快,如果要走 12 次工具调用才能解决问题,也可能输给一个速度略慢、但 5 次调用就完成任务的模型。
Token 效率目前还没有统一的行业口径。它可能指相同正确率下生成更少 Token,也可能指相同 Token 预算下得到更高正确率,还可能包含缓存命中、上下文压缩和隐藏推理计算,因此必须结合任务成功率一起看。
开发者最终应该测量的是“每个成功任务的总 Token 数”,而不是只看一次回答有多短。假设一个模型平均消耗 10 万 Token、成功率为 50%,那么完成一个成功任务的期望消耗约为 20 万 Token;另一模型即使单次消耗 12 万 Token,只要成功率达到 80%,期望消耗就只有 15 万 Token,实际反而更省。
“速度略慢”可能是 Grok 4.7 最大的现实代价
模型速度至少包含首 Token 延迟和持续输出吞吐两个不同指标。首 Token 延迟决定用户点击发送后需要等待多久,输出吞吐则决定答案开始生成后每秒能吐出多少 Token。
马斯克所说的“服务速度略慢”没有指明是哪一个指标变慢。对于聊天产品,首 Token 延迟更影响体感;对于长报告和代码生成,每秒输出 Token 数更重要;对于 Agent,工具调用之间的等待和完整任务耗时才是核心指标。
2.1 万亿参数会给推理基础设施带来明显压力。即使使用 BF16 精度,仅按每个参数 2 字节粗略计算,全部参数权重也需要约 4.2 TB 显存或内存;实际部署还要考虑 KV Cache、并行通信、激活值和系统冗余,不能简单塞进单张加速卡。
更大的模型也会放大跨节点通信成本。模型被拆到多台服务器后,每一层计算都可能涉及设备间传输,因此真实延迟不仅由芯片算力决定,还受到互联带宽、批处理策略、量化精度和专家路由负载的影响。
xAI 如果想让 Grok 4.7 在生产环境中有竞争力,就必须证明 Token 效率的收益足以抵消服务速度下降。否则,它可能成为适合高难度任务的“重型模型”,而不是能够全面替代 Grok 4.6 的默认选择。
“超越所有模型”现在仍是一句待验证的营销判断
Cognition 是 AI 编程代理 Devin 的开发公司,其 8 月 13 日发布的评价称,Grok 4.6 相比 Grok 4.5 有显著改进,表现超过 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。马斯克随后转发并表示,Grok 4.7 上线后将超过所有模型。
这项排名目前缺少足够的公开评测上下文。参考资料没有给出完整题集、模型版本、采样参数、推理预算、是否允许工具调用,以及每个模型的重复测试次数,因此无法把这项结论视作可复现的行业排名。
模型排名尤其容易受到推理预算影响。同一模型在允许长时间思考、调用搜索和执行代码时,成绩可能明显高于快速回答模式;如果不同模型使用的计算预算不一致,最终分数比较的就不只是模型能力,也包括厂商愿意为单题投入多少算力。
真正有说服力的领先至少需要三层证据:xAI 公布透明的官方评测方法、第三方机构在相同设置下复测、真实开发者任务显示出稳定收益。只满足其中一项,都不足以支持“全面超越所有模型”这样覆盖范围极广的判断。
| 评测层级 | 应关注的指标 | Grok 4.7 当前状态 | |---|---|---| | 静态基准 | 数学、代码、科学问答、长上下文正确率 | 尚未公布完整成绩 | | Agent 任务 | 工具调用次数、任务成功率、人工接管率 | 尚未公布 | | 性能指标 | 首 Token 延迟、输出吞吐、并发能力 | 仅确认速度略慢 | | 成本指标 | 输入价格、输出价格、每个成功任务成本 | 尚未公布定价 | | 稳定性指标 | 重试率、超时率、格式遵循率 | 尚未公布 | | 安全指标 | 越狱抵抗、误拒率、危险能力评估 | 尚未公布系统卡 |
高频迭代对开发者既是机会,也是风险
xAI 正在把旗舰模型迭代压缩到以周为单位。Grok 4.6 在 8 月被外部评测提及后,Grok 4.7 又计划于 9 月中旬上线,这种速度有利于快速修正模型短板,却也缩短了安全测试、回归测试和企业迁移的时间窗口。
开发者不应该因为一个新版本的宣传排名就立即替换生产模型。更稳妥的方式是先使用内部任务集进行影子测试,再比较新旧版本的成功率、延迟、Token 消耗、工具调用次数和输出一致性。
一套面向 Grok 4.7 的最低评测清单应当包括:
- 复杂指令一次完成率,而不是只看答案是否“像对的”;
- P50、P95 和 P99 延迟,而不是只测一次生成速度;
- 每个成功任务的输入与输出 Token 总量;
- 工具调用正确率、无效调用次数和循环调用比例;
- 长上下文中的约束遗漏率与关键信息召回率;
- JSON、表格和固定模板等结构化输出的合规率;
- 同一任务重复运行后的结果方差;
- 敏感数据处理、越狱防护和误拒绝情况。
模型切换机制也应当支持版本固定、灰度放量和快速回滚。高频更新意味着模型的回答风格、工具选择策略和结构化输出行为都可能变化,应用层如果把提示词和单一模型版本绑定得太死,升级成本会越来越高。
Grok 4.7 最可能先在高价值复杂任务中体现优势。代码库级修改、跨文档研究、长链条工具调用和高难度推理更有机会吃到模型规模与后训练改进的红利,而摘要、分类、抽取和简单客服未必需要一台 2.1 万亿参数的“重型机器”。
Grok 4.7 值得期待,但现在还不值得下结论
Grok 4.7 的预告证明 xAI 仍在用非常激进的节奏追赶并争夺旗舰模型第一梯队。2.1 万亿参数、40% 的规模增长和更高 Token 效率都值得关注,但参数数字只能证明 xAI 愿意投入更多计算资源,不能单独证明模型已经成为行业第一。
这次升级真正的胜负手是“速度略慢、Token 更省”能否形成正收益。如果 Grok 4.7 能在复杂任务上减少 30% 以上的总 Token 或工具调用,同时把任务成功率稳定推高,那么略微增加的延迟通常可以接受;如果效率提升只有几个百分点,却明显拉长首 Token 等待时间,它就更像一个面向少数高难任务的专项型号。
9 月 12 日前后最值得等待的不是一张跑分海报,而是完整模型卡、可复现评测、实际定价和线上延迟数据。在这些信息出现以前,Grok 4.7 可以被视为一个有潜力的旗舰模型,但“超越所有竞品”仍需要把马斯克的预告变成开发者能够重复验证的结果。
参考来源
- IT之家:马斯克预告 Grok 4.7 十天后上线:转述马斯克 9 月 2 日发布的时间表、2.1 万亿参数规模、速度与 Token 效率信息。
- 知乎:Grok 4.6 与 4.7 预告及开发者影响分析:讨论高频模型迭代对模型选型、Agent 架构、成本评测和版本回滚的影响。


