AI 快讯K3挤爆算力,Kimi暂停新订阅
产品更新

K3挤爆算力,Kimi暂停新订阅

2026-07-19T17:05:03.753Z
K3挤爆算力,Kimi暂停新订阅

Kimi K3上线约3天后,用户请求量逼近集群上限。月之暗面暂停C端新用户订阅保老用户,并计划拆分主产品与Kimi Code权益。

K3挤爆算力,Kimi暂停新订阅

月之暗面在 Kimi K3 上线约 3 天后踩下了新订阅的刹车。

7 月 19 日,Kimi 发布公告称,过去 48 小时的用户请求量远超预估,并已逼近现有集群承载极限。为了保障已订阅用户的体验,Kimi 即日起暂停 C 端新用户订阅,把现有算力优先投入已订阅用户,同时推进集群扩容。

**C 端订阅是面向个人用户销售的会员服务,通常包含更高使用额度、优先推理以及编程等增值能力。**此次调整针对的是 C 端新增会员,而不是关闭 Kimi 产品,也不意味着现有会员权益被削减。按照公告,已订阅用户的全部权益保持不变,新用户则暂时无法购买订阅。

Kimi发布“关于算力紧缺与会员暂停开放的说明”,重点标注过去48小时请求量逼近集群极限

这不是一次常规的会员策略调整,而是一场由新模型流量直接触发的容量事故预防。Kimi 没有等到排队、超时和错误率全面恶化后再处理,而是主动停止继续售卖有限资源,这一选择对老用户是负责任的;但从另一面看,新模型发布不到一周就需要限制商业入口,也暴露出月之暗面对 K3 流量峰值和推理资源需求估计不足。

48小时内逼近集群上限,K3流量超出预案

Kimi K3 是月之暗面面向长程编程、复杂推理和端到端知识工作推出的新一代大模型。根据目前公开信息,K3 总参数量为 2.8 万亿,支持 100 万 Tokens 上下文窗口,是 Kimi 迄今规模最大、能力定位最高的模型。

K3 于 7 月 16 日上线,而月之暗面在 7 月 19 日宣布暂停新订阅,容量压力几乎与产品热度同步到来。公告给出的关键时间窗口是过去 48 小时,但没有披露请求数、日活用户、GPU 数量、Tokens 吞吐量或服务错误率,因此外界暂时无法计算真实的流量增幅。

| 时间 | 事件 | 公开数据与影响 | |---|---|---| | 7 月 16 日 | Kimi K3 上线 | 2.8 万亿参数、100 万 Tokens 上下文 | | 7 月 17 日 | K3 发布节点流量与收入冲高 | ARR 创下历史最大单日增幅,但未公布绝对值 | | 7 月 18 日 | Kimi 总裁张予彤披露模型信息 | 确认 2.8 万亿参数,并称权重将在近日开放 | | 7 月 19 日 | 暂停 C 端新用户订阅 | 过去 48 小时请求量逼近现有集群承载极限 | | 后续 | 扩容并逐步恢复订阅 | Kimi 主权益与 Kimi Code 权益将拆分 |

月之暗面没有给出恢复订阅的具体日期,只表示会随着新算力陆续到位,逐步开放更多名额,直至全面恢复。这意味着此次限制不是一个确定时长的维护窗口,而是与 GPU、网络、存储和推理服务部署进度绑定的动态限流。

真正紧张的不是参数,而是推理吞吐

推理算力是模型在接收用户请求后生成结果所消耗的计算资源。模型训练通常是一次性的集中投入,而推理成本会随着用户数量、上下文长度、输出长度和并发任务数持续增长;新模型越受欢迎,服务端压力越接近一笔没有上限的实时账单。

2.8 万亿总参数并不能单独说明每次请求的成本,因为月之暗面尚未在现有资料中完整披露 K3 的激活参数量、专家路由策略和单请求部署配置。如果 K3 使用混合专家架构,每个 Token 可能只激活部分参数,因此不能简单地把 2.8 万亿参数等同于全部参与每一步计算。

100 万 Tokens 上下文也不意味着所有用户都会塞满窗口,但它显著抬高了极端请求的资源上限。一个普通问答可能只处理几千 Tokens,而一次大型代码仓库分析、跨文档研究或长周期 Agent 任务,可能连续读取数十万 Tokens,并多轮调用搜索、代码执行和文件分析工具。

**KV Cache 是模型为避免重复计算历史上下文而保存的中间状态。**上下文越长,KV Cache 对显存和内存带宽的占用通常越高;当大量用户同时进行长上下文编程任务时,服务瓶颈不只在 GPU 算力,也可能出现在显存容量、节点间通信、请求调度和缓存命中率上。

长程编程尤其容易制造“少数请求吃掉大量资源”的情况。普通聊天可能几十秒结束,编程智能体却可能持续数分钟甚至更久,在一个任务内反复读取代码、修改文件、运行测试和修复错误。对服务商来说,这更像同时运营大量远程开发工作站,而不是简单提供一问一答的聊天机器人。

因此,K3 带来的压力大概率不是单纯的注册用户暴涨,而是“用户数、单任务时长和单任务 Tokens 消耗”同时上升。Kimi 公告只说请求量逼近上限,没有公布三者各自贡献,现阶段不能把问题完全归因于模型参数规模。

价格很激进,但缓存决定真实成本

Kimi K3 在开放平台使用 kimi-k3 作为模型调用名称,并采用区分缓存命中与否的输入定价。缓存命中是指相同或高度复用的上下文可以直接使用已有计算结果,从而减少重复推理开销。

| Kimi K3计费项目 | 每100万Tokens价格 | 折算到10万Tokens | |---|---:|---:| | 输入,缓存命中 | 2 元 | 0.2 元 | | 输入,缓存未命中 | 20 元 | 2 元 | | 输出 | 100 元 | 10 元 |

这套定价明显在鼓励开发者复用稳定前缀,例如固定系统指令、同一个代码仓库索引或重复引用的知识库内容。缓存命中后,输入价格从每 100 万 Tokens 20 元降至 2 元,降幅为 90%;但输出仍然是每 100 万 Tokens 100 元,长时间推理和大量代码生成依然会快速累积成本。

一个完整的 100 万 Tokens 输入如果没有命中缓存,输入费用是 20 元;如果全部命中缓存,则是 2 元。若任务随后生成 10 万 Tokens,输出费用还需要 10 元。这个例子说明,超长上下文并不必然昂贵,真正影响成本的是缓存复用程度、输出规模以及任务是否会多轮重复读取上下文。

低价格也会反过来放大需求。开发者看到 100 万 Tokens 窗口和较低输入价格后,更愿意把完整代码仓库、长文档和复杂 Agent 流程交给模型,而不是先手动裁剪上下文。对 Kimi 而言,这能迅速带来使用量和收入,却也会让发布初期的峰值比普通聊天模型更难预测。

ARR冲高是好消息,但不能直接等于收入落袋

ARR 是 Annual Recurring Revenue 的缩写,即按照当前订阅或经常性收入水平折算出的年化收入指标。张予彤披露的数据显示,K3 发布节点的 ARR 从此前平缓区间陡然冲高,并创下历史最大单日增幅。

ARR 创纪录证明 K3 不只是社交媒体热度,也出现了真实的付费转化。不过,月之暗面没有公布增幅比例和 ARR 绝对值,因此不能据此推导公司已经获得多少现金收入,更不能判断新增订阅的长期留存率。

暂停新订阅会暂时牺牲收入增量,但比继续卖会员后让所有用户排队更合理。AI 订阅的核心商品不是一个账号标识,而是稳定可用的推理资源;如果高峰期无法响应,再便宜的会员也会变成负资产,并迅速损伤新模型积累的口碑。

这次决策也说明,月之暗面当前更在意已付费用户的服务质量,而不是趁热度继续扩大账面 ARR。对一家仍在扩张期的模型公司而言,这种克制值得肯定,但它并不能掩盖容量规划的问题:如果发布前已经把 K3 定位为长程编程和端到端知识工作模型,就应该预期其平均单任务计算量显著高于传统聊天。

Kimi Code将与主产品拆分,算力开始按场景定价

权益拆分是此次公告中比“暂停订阅”更值得长期关注的变化。Kimi 表示,后续面向新订阅用户,将拆分 Kimi 主权益与 Kimi Code 权益,其中主权益包含 Kimi Web、Kimi App 和 Kimi Work。

| 权益类别 | 包含产品 | 主要负载特征 | |---|---|---| | Kimi主权益 | Kimi Web、Kimi App、Kimi Work | 通用问答、文档处理、搜索与办公任务 | | Kimi Code权益 | Kimi Code | 长周期编程、仓库读取、工具调用与多轮执行 |

拆分权益的直接目的,是把资源消耗差异巨大的用户分开管理。通用聊天用户可能每天发起几十次短请求,而重度编程用户可能用一个 Agent 任务持续占用计算资源;如果两类用户共享同一档不限场景会员,轻度用户实际上会补贴高算力用户,服务商也很难准确控制成本。

Kimi 尚未公布拆分后的价格、额度和优先级,因此现在不能断言编程会员会涨价。不过,从推理经济性看,Kimi Code 独立计费几乎是必然方向:它既可以按任务数或 Tokens 设置更清晰的额度,也可以为高负载任务配置单独的排队与调度策略。

对普通用户而言,权益拆分未必是坏事。如果主要需求是搜索、写作和文档分析,用户不必为高成本编程能力共同买单;对重度开发者而言,独立权益则可能换来更稳定的并发、任务时长和高峰期优先级。最终体验取决于月之暗面是否把拆分做成精细化资源管理,而不是简单增加一道付费门槛。

“开放权重”不能立刻解决官方服务压力

开放权重是指模型厂商允许外部开发者下载模型参数并自行部署或二次研究。开放权重不必然等于完全开源,因为训练数据、训练代码、许可证权限和商业使用范围仍可能受到限制。

张予彤表示 K3 权重将在近日开放,但截至 7 月 19 日,用户仍应以月之暗面后续正式发布的模型文件和许可证为准。一个 2.8 万亿总参数模型即使开放权重,完整部署门槛也会非常高,普通开发者不可能靠一两张消费级显卡获得与官方服务相同的体验。

权重开放可以分流一部分企业和云厂商需求,却无法在短期内替代 Kimi 官方 C 端产品。企业可以针对自身场景进行量化、裁剪或托管部署,个人用户则仍然依赖官方完成模型并行、缓存系统、工具链和高并发调度,因此扩容依旧是恢复会员销售的核心路径。

这次“限购”既是产品成功,也是基础设施警报

K3 发布后迅速触及算力上限,首先说明市场确实需要更强的长程编程和知识工作模型。相比只在基准测试上提升几个百分点,一个能让用户主动付费、让请求量在 48 小时内冲到集群边界的模型,更能证明能力已经转化为产品需求。

但流量超预期不能长期成为服务不稳定的理由。前沿模型竞争已经从“谁能训练出更大的模型”进入“谁能以合理价格稳定提供模型”的阶段,容量预测、弹性调度、缓存命中、降级策略和会员额度设计,都与模型能力本身同样重要。

月之暗面这次优先保老用户的动作是正确的,甚至比悄悄降低速率或削减额度更透明。真正需要观察的是扩容之后的三件事:订阅何时恢复、Kimi Code 如何独立定价,以及 K3 在高峰期能否维持稳定的响应速度和任务成功率。

如果月之暗面能在较短时间内补齐算力,并用权益拆分建立可持续的推理成本模型,这次暂停订阅会成为一次可控的“甜蜜烦恼”。如果扩容持续拖延,或者恢复后再次出现限流,那么 K3 的热度反而会暴露月之暗面从模型公司走向大规模 AI 服务商时最现实的短板。

参考来源

相关推荐

查看全部