AI 快讯Qwen4已开训,阿里押注下一代模型
行业快讯

Qwen4已开训,阿里押注下一代模型

2026-09-22T05:04:47.518Z
Qwen4已开训,阿里押注下一代模型

阿里在2026云栖大会透露,基于新架构的Qwen4已经进入训练阶段,Qwen4.5、Qwen5未来将扩展至5-10T参数;下一代视频生成模型预计11月发布,并将重点提升长时一致性、镜头控制与叙事能力。

阿里透露:Qwen4 已经进入训练阶段

阿里在 2026 年云栖大会现场确认,基于新一代架构的 Qwen4 已经进入训练阶段,Qwen4.5、Qwen5 等后续版本则计划继续扩大模型规模,参数量可能延伸至 5T-10T。

这不是一次常规的模型版本更新,而是阿里首次把 Qwen 下一阶段的路线图讲得相对清楚:模型架构正在切换,训练方式开始引入更强的递归自我改进,规模上限继续向万亿级甚至多万亿级推进,同时视频、语音、图像、世界模型和全模态模型也会同步迭代。

更值得关注的是,阿里把模型自我进化放到了这次大会的核心位置。按照现场披露,递归自我改进(Recursive Self-Improvement,RSI)已经初步进入模型训练、推理优化以及芯片—模型协同设计等环节。

递归自我改进(RSI)是指模型参与训练数据构造、实验设计、缺陷定位和系统优化,并通过多轮自动迭代提升自身能力。

从公开信息看,阿里目前并不是简单地让模型“自己生成更多数据”,而是试图让模型介入一条更完整的工程闭环:先发现问题,再设计实验;根据实验结果调整训练策略;最后把优化结果反馈给模型和基础设施。这种方式更接近“自动化研发团队”,而不是传统意义上的数据增强工具。

2026云栖大会现场,展示Qwen4训练路线、递归自我改进与下一代视频模型的主视觉信息图

Qwen4 只是开始,5T-10T 参数意味着什么

Qwen4.5 和 Qwen5 计划扩展至 5T-10T 参数,意味着阿里仍然认为模型规模是推动基础能力增长的重要变量,但不会只依赖参数堆叠。

这里需要区分三个概念:总参数、激活参数和实际推理成本。MoE(混合专家)模型是将多个专家网络组合在一起的架构,单次推理只激活其中一部分参数,因此可以在保留巨大模型容量的同时控制计算成本。未来 Qwen 系列即使达到 5T-10T 总参数,也不代表每次请求都要完整运行这么多参数。

此前阿里已经通过 Qwen3.8-Flash 展示了这条路线的雏形。公开信息显示,Qwen3.8-Flash 采用 125B 总参数、6B 激活参数的 MoE 架构;其性能接近甚至超过更大规模的上一代模型,但推理时只需要调用少量专家模块。这种设计的核心价值在于:模型可以“记得更多、懂得更广”,但每次回答不必付出完整模型的计算成本。

| 模型或路线 | 已披露信息 | 主要意义 | |---|---:|---| | Qwen3.8-Flash | 125B 总参数,6B 激活参数 | 通过稀疏激活降低推理成本 | | Qwen3.8-Max | 经过 33 轮自动迭代 | 展示 RSI 在模型训练中的应用 | | Qwen4 | 已进入训练阶段 | 采用新一代模型架构 | | Qwen4.5、Qwen5 | 未来计划扩展至 5T-10T 参数 | 继续扩大基础模型容量上限 |

不过,5T-10T 仍然是未来路线图,不应被理解为 Qwen4 已经确定采用 10T 参数,也不代表下一代模型发布时一定会以单一超大稠密模型形态出现。最终效果还取决于数据质量、训练稳定性、专家路由、上下文长度、后训练方法和推理基础设施。

阿里此次更重要的信号是,Qwen 的竞争重点正在从“开源一个更大的模型”转向“构建能够持续迭代的模型系统”。如果 RSI 能够稳定运行,模型版本之间的差异就不再只是一次训练周期带来的升级,而可能变成持续数周、数月的自动优化结果。

Qwen3.8-Max 已完成 33 轮无人参与迭代

Qwen3.8-Max 的自我训练实验,是阿里此次展示 RSI 能力最具体的案例。

据现场披露,Qwen3.8-Max 在人类完全“零参与”的情况下,持续迭代超过 1 个月,完成了 33 轮有效迭代。模型能够自主搭建训练流程、构造训练数据、设计实验并定位缺陷,再通过 RSI 与后训练技术联合优化自身能力。

**Qwen3.8-Max 的 RSI 实验持续超过 1 个月,完成了 33 轮有效迭代。**这一数字的意义不在于迭代次数本身,而在于模型是否能够判断哪些改动有效、哪些改动只是让分数短期波动。

根据阿里披露的数据,Qwen3.8-Max 新版本在 Artificial Analysis 上的得分从 40 分提升到 45 分,并进入与 Claude、GPT 最强模型同一竞争梯队。阿里同时表示,该成绩领先于 GLM5.3、Kimi-K3 等国产模型。

需要注意的是,单一平台分数不能等同于真实使用体验。不同评测平台会采用不同的任务组合、权重和测试方式,模型在代码、数学、长文本、工具调用和多模态任务上的表现也可能差异很大。但从 40 分到 45 分的变化,至少说明阿里正在尝试把“模型自动改进”从概念验证推进到可测量的工程流程。

对于开发者而言,真正值得观察的是三件事:第一,模型是否能在不增加大量人工标注的情况下持续获得有效增益;第二,自动迭代是否会带来能力退化或评测过拟合;第三,这套机制能否迁移到不同尺寸、不同模态和不同硬件环境中。

推理吞吐提升 96%,模型开始主动适配芯片

阿里还展示了 Qwen3.8-Max 在推理优化和芯片—模型协同设计上的实验结果。

在推理优化方面,Qwen3.8-Max 在此前从未见过的平头哥新款 GPU 上,自主适配并优化了下一代架构 Qwen3.8-Flash 的推理框架,单实例推理吞吐量提升 96%。

**单实例推理吞吐量提升 96%,意味着同一实例在相同时间内可以处理接近两倍的请求量。**对于企业应用来说,这通常会直接影响单位请求成本、并发能力和服务稳定性。

传统做法是由工程师分析硬件特性,再手动完成算子适配、内存布局调整、并行策略修改和推理框架优化。阿里此次展示的方向,则是让模型根据硬件信息自主完成部分适配工作。它未必能完全取代底层系统工程师,但有机会把原本需要数周甚至更长时间的适配工作压缩为更短周期。

在芯片—模型协同设计方面,Qwen3.8-Max 仅基于一份真实的总线模块规范,自主完成前端、验证、后端的全链路自迭代。模型自主运行超过 60 小时,调用 EDA 工具超过 1 万次,最终完成了物理实现优化,芯片面积减少 42%。

**EDA 工具是用于芯片设计自动化的工程软件,覆盖电路设计、验证、布局布线和物理实现等环节。**这项实验的价值在于,模型不再只服务于软件代码,而是开始参与芯片设计流程本身。

当然,“面积减少 42%”并不等于芯片整体性能提升 42%。芯片设计往往需要同时权衡面积、频率、功耗、时序裕量、可靠性和制造成本。阿里目前披露的是物理实现面积优化结果,关于功耗、频率和芯片量产情况,公开信息尚未给出完整数据。

下一代视频模型 11 月发布,重点从短片段走向完整叙事

阿里确认,下一代视频生成模型将于今年 11 月发布,产品方向集中在更长、更可控、更完整和更智能四个关键词上。

**视频生成模型是能够根据文本、图像或其他条件生成连续视频内容的生成式模型。**相比图片生成,视频模型最大的难点不是单帧画面是否漂亮,而是人物、物体、空间和镜头在连续时间中的一致性。

阿里对下一代视频模型的描述,指向了当前视频生成产品最难解决的几个问题:

  • **时间一致性:**视频变长后,人物身份、服装、场景结构和物体状态仍然保持稳定。
  • **镜头可控性:**创作者能够精确控制人物动作、场景变化、镜头运动和画面构图。
  • **叙事完整性:**模型不只生成一个漂亮镜头,还能理解前后镜头之间的因果关系。
  • **导演级创作:**模型具备一定的分镜、节奏、镜头衔接和情绪推进能力。

此前一代通义万相 2.5 已经支持 1080P、24 帧每秒的视频生成,视频时长从 5 秒提升到 10 秒,并尝试生成与画面匹配的人声、音效和背景音乐。下一代模型如果要实现“更长、更完整”,就不能只靠简单地延长采样时间,而需要解决长时记忆、跨镜头状态管理和视频级规划问题。

从产品竞争角度看,视频模型的关键战场正在从“单个镜头生成质量”转向“可控内容生产”。对于广告、短剧、影视预演和游戏内容制作来说,创作者并不只是希望模型随机生成一段视频,而是希望模型能够按照分镜表执行:谁在什么地点出现,镜头从哪个角度推进,人物在第几秒完成什么动作,下一镜如何承接上一镜。

如果 11 月发布的模型能够在这些方面稳定工作,它的价值会明显高于一次单纯的画质升级。视频生成工具将从“灵感草图工具”逐步接近“可协作的制作工具”。但目前阿里尚未公布具体模型名称、生成时长、分辨率、开放方式和性能评测,因此不宜提前把这些目标等同于已经实现的产品能力。

三年内出现原生全模态统一模型?

阿里巴巴 ATH 技术副总裁、淘天集团首席科学家郑波在现场表示,三年内可能出现一个原生全模态统一模型,模型体验将不再受限于文本、图像、音频和视频之间的模态边界。

**原生全模态模型是从统一模型架构和统一训练目标出发,同时理解并生成文本、图像、音频、视频等多种信息的模型。**它与“多个单模态模型拼接成一个应用”不同,核心目标是让模型在同一个推理过程中理解跨模态关系。

目前很多多模态产品仍然采用模块化方案:视觉编码器负责看图,语音模型负责听和说,语言模型负责推理,中间再通过接口完成信息传递。这种方案容易落地,但不同模块之间可能存在信息损失、延迟增加和上下文割裂。

原生全模态模型如果成熟,用户可以直接给出一段视频、一段语音和一组文字要求,模型同时完成理解、推理和生成。例如,它可以看懂一场会议的视频,识别发言人和关键动作,提取讨论结论,再生成带有图表和旁白的汇报内容。对于智能手机、智能眼镜、车载系统和机器人,这种统一交互方式尤其重要。

但三年时间表仍然属于技术判断,而非已经确定的产品计划。全模态统一模型需要面对数据对齐、训练成本、实时推理、版权合规和长时记忆等多重问题。阿里能否把这些能力整合进一个可用、可部署、成本可控的模型,还要看后续版本的实际表现。

Qwen Intelligence 把大模型推进手机端

阿里此次还发布了面向手机场景的全栈 AI 方案 Qwen Intelligence,为合作伙伴提供基于千问大模型的 Agent 技术平台。

**手机 Agent 是能够理解用户目标,并跨应用执行多个操作的软件智能体。**它与传统语音助手的差别在于,用户不必逐步告诉手机“打开哪个应用、点击哪个按钮”,而是可以直接提出更复杂的任务目标。

例如,用户可以要求手机查找某个时间段的会议安排、比较多个出行方案、整理聊天记录中的地址,再根据结果创建日程。要完成这类任务,模型必须同时处理自然语言理解、屏幕视觉识别、应用状态判断、工具调用和错误恢复。

手机 Agent 的难点不在于模型会不会回答问题,而在于能否可靠执行任务。它需要知道什么时候该点击、什么时候该等待、什么时候需要向用户确认,还要避免误删内容、误发消息或泄露隐私。阿里强调 Qwen Intelligence 针对手机场景做了深度优化,说明其重点可能不只是把云端模型缩小,而是围绕端云协同、系统权限、应用适配和任务可靠性重新设计产品形态。

阿里这次释放的真正信号

阿里此次云栖大会释放的核心信号,是 Qwen 正在从模型家族升级为一套持续自我改进的 AI 基础设施。

第一,Qwen4 已经进入训练,说明新架构不再停留在概念阶段。第二,Qwen4.5 和 Qwen5 计划走向 5T-10T 参数,表明阿里仍在押注超大规模模型,但大概率会依赖 MoE、稀疏激活和更高效的训练推理系统。第三,RSI 已经被用于训练、推理和芯片设计,模型的角色正从“被优化对象”转向“参与优化的工程工具”。

第四,视频模型将在 11 月继续升级,竞争焦点从几秒钟的视觉效果转向长时一致性、精细控制和完整叙事。第五,Qwen Intelligence 进入手机端,意味着阿里希望把大模型能力进一步嵌入终端操作系统和应用生态。

对开发者和深度用户来说,短期最值得关注的不是 5T-10T 参数这个数字,而是三项可验证结果:Qwen4 是否能在真实任务中延续 Qwen3.8 系列的能力增长;RSI 是否能稳定带来跨基准、跨场景的提升;下一代视频模型是否能真正支持可控的长视频生产。

如果这三件事都能兑现,Qwen 的竞争力就不再只是“开源模型参数大、价格低”,而是覆盖基础模型、推理系统、芯片适配、视频生成和终端 Agent 的完整技术栈。反之,如果后续发布仍主要停留在规模宣传和单项跑分,5T-10T 参数也可能只是一个昂贵的工程目标。

目前可以确认的是,Qwen4 已经开始训练,下一代视频模型将在 11 月到来。接下来几个月,阿里需要用实际模型和公开评测回答一个问题:模型能否真正开始自己变强,而不只是变得更大。

参考来源

  1. IT之家:阿里 Qwen4 和下代视频模型训练中,Qwen4.5 后模型将扩展至 5-10T 参数 —— 报道 2026 年云栖大会现场披露的 Qwen4 训练进展、RSI 实验、下一代视频模型发布时间及 Qwen Intelligence 等信息。

相关推荐

查看全部