千问Qwen3.8-Max上线

阿里正式发布2.4万亿参数的Qwen3.8-Max,并接入千问办公。新模型主攻编程、真实办公与长程Agent任务,国内API输入、输出价格分别为每百万Tokens 12元和36元。
2.4万亿参数模型,开始直接交付办公成果
阿里巴巴在8月3日正式上线千问Qwen3.8-Max,总参数量达到2.4万亿,并同步将其接入新推出的Agent产品“千问办公”。这次发布的重点并不只是把模型参数继续做大,而是让模型从聊天窗口走进代码工程、数据分析和Office工作流,尝试端到端完成需要几十步操作的真实任务。
**Qwen3.8-Max是阿里千问目前面向复杂推理、编程和智能体任务的旗舰大模型。**按照官方说法,新模型在编程、真实办公、长程任务和多模态智能体等方向均有提升,能够在较少人工介入的情况下,把一个开放目标拆解为步骤、调用工具并交付最终结果。
这意味着千问正在把旗舰模型的竞争指标,从“单次回答得对不对”转向“整件事情能不能做完”。相比在基准测试里多拿几分,能否稳定处理跨文档检索、表格计算、演示文稿制作、代码修改和结果校验,才是模型进入生产环境后的真正分水岭。

从7月预览版到正式上线,迭代周期只有半个月
Qwen3.8-Max的正式发布距离预览版亮相只有约两周。7月19日,阿里已将Qwen3.8-Max-Preview首发接入千问PC端、Web端、Qoder、QoderWork及相关开发者产品;到8月3日,正式版完成API上线,并进一步进入千问办公。
**预览版是模型正式发布前用于收集反馈和验证能力的阶段性版本。**从预览到正式版的时间不长,说明阿里正在压缩旗舰模型的迭代周期,也说明模型发布已经与自家开发工具、办公Agent和云端服务同步推进,而不是先发布模型、数月后再补产品。
本次发布的已知关键信息如下:
- 模型名称:Qwen3.8-Max
- 总参数量:2.4万亿,即2.4T
- 重点能力:编程、真实办公、长程任务、多模态智能体
- 产品接入:千问AI平台、千问办公,以及此前已支持预览版的千问PC端、Web端、Qoder和QoderWork
- 国内API价格:每百万Tokens输入12元、输出36元
- 隐式缓存命中价格:每百万Tokens 1.5元
- 开源计划:Qwen3.8-Max模型权重预计下周开放,同时开源Qwen3.8-27B
2.4T很醒目,但参数规模不是完整答案
2.4万亿是Qwen3.8-Max最容易传播的数字,却不能直接等同于2.4万亿参数在每次推理时全部参与计算。官方目前披露的是“总参数量”,尚未在参考资料中进一步说明活跃参数量、专家数量、路由方式、上下文窗口以及训练数据规模。
**总参数量是模型包含的全部可训练参数数量,活跃参数量则是一次推理实际参与计算的参数数量。**如果Qwen3.8-Max采用混合专家模型架构,那么它可以拥有极大的总容量,同时只激活部分专家参与一次生成,从而控制推理成本;但在官方给出详细技术报告前,外界不宜根据2.4T这一数字自行推断其架构和实际算力需求。
参数量也无法单独解释模型在办公任务上的表现。真实办公场景更依赖指令遵循、工具调用、上下文管理、错误恢复和结果验证,一份财务分析报告可能要经历读取多个文件、统一字段、执行计算、绘制图表、核对异常值和生成演示文稿等步骤,其中任何一步出错都会影响最终交付。
因此,Qwen3.8-Max是否真正好用,关键要看长链路任务的成功率,而不是只看总参数量。阿里此次反复强调“真实办公”和“端到端完成”,方向是对的,但仍需要更多可复现评测来证明它在连续运行几十分钟乃至数小时后,能否维持稳定性和事实准确性。
千问办公才是这次发布更值得关注的部分
千问办公是阿里同步推出的面向复杂办公任务的Agent产品。它并非只负责生成一段文字,而是尝试理解用户目标、拆分任务、处理文件、协调多个子Agent,并输出可以继续编辑或直接使用的办公成果。
**AI Agent是能够围绕目标自主规划步骤、调用工具并根据执行结果调整行动的软件系统。**传统聊天机器人更像一个知识丰富的顾问,用户问一步、它答一步;办公Agent则更像项目执行者,需要持续记住任务状态,并在不同工具之间传递数据。
这一区别在实际工作中非常明显。用户要求“分析过去12个月的销售数据,找出增长放缓的区域,并制作一份给管理层的汇报”时,普通模型通常只会提供分析思路或模板;一个可用的办公Agent则要完成文件读取、数据清洗、同比环比计算、异常检查、结论提炼和幻灯片生成,还要保证图表数字与原始表格一致。
Qwen3.8-Max接入千问办公,也让阿里的模型、云服务和应用形成了更紧密的闭环。模型负责推理,Agent负责规划和工具编排,办公产品负责文件、界面与交付格式,这种组合比单独展示一个聊天页面更接近企业真正愿意付费的形态。
编程与长程任务,是旗舰模型最难啃的两块
编程能力的竞争已经从生成单个函数升级为理解整个代码仓库。官方称Qwen3.8-Max在全栈开发等内部真实任务中有所提升,这类任务通常涉及前后端联调、依赖安装、测试执行、错误定位和多文件修改,比一次性回答算法题复杂得多。
**长程任务是需要模型跨越多个步骤、较长时间和大量上下文才能完成的任务。**模型在长程任务中的主要敌人不是“不会”,而是执行过程中逐渐偏离目标:它可能忘记早先约束、重复已经完成的步骤、误读工具返回值,或者在局部修改后破坏其他模块。
多Agent并不天然解决这些问题。多个Agent可以分别承担研究、编码、测试和审查,但协作本身也会产生信息丢失、任务重复和结论冲突;如果调度模型不够稳定,多Agent只会把一次错误放大为一串错误。
Qwen3.8-Max真正需要证明的能力,是在代码工程和办公流程里完成闭环。生成一段看起来合理的代码并不难,难的是运行测试、读取报错、修改实现并确认没有引入回归;制作一页漂亮的幻灯片也不难,难的是确保里面的数字、图表和结论都能回溯到原始文件。
Arena进入第一梯队,但排名不能替代业务评测
Arena是通过用户匿名对比投票评估模型偏好的第三方竞技场榜单。根据8月3日公布的信息,千问模型在当日榜单中的整体表现仅次于Anthropic Claude系列,进入全球大模型第一梯队。
这一成绩对千问的意义在于,Qwen系列已经不再只是依靠开源生态和中文能力建立影响力,而是在综合体验上与全球头部闭源模型直接竞争。不过,参考资料没有给出具体榜单分项、分数、投票数量和快照版本,因此“仅次于Claude”更适合作为发布节点的排名描述,不应被扩展为所有任务上的统一结论。
Arena衡量的是用户在匿名对话中的主观偏好,而企业办公更关注任务完成率、延迟、成本和可审计性。一个模型可能更会写、更讨喜,却未必更擅长修改大型代码库或核对复杂表格;开发者仍应使用自己的数据集,对关键工作流做端到端测试。
国内输入12元、输出36元,缓存价格更有杀伤力
Qwen3.8-Max的国内API价格为每百万Tokens输入12元、输出36元,隐式缓存命中价格为每百万Tokens 1.5元。对于需要反复携带系统提示词、代码仓库上下文或企业知识库内容的Agent应用,缓存成本可能比基础单价更值得关注。
**隐式缓存是平台自动复用重复输入内容的机制。**当多次请求包含相同或高度复用的上下文时,系统无需每次都完整处理这些内容,命中部分可以按更低价格计费,从而降低持续对话和长上下文任务的成本。
| 计费项目 | 国内价格 | 相对普通输入价格 | 典型场景 | |---|---:|---:|---| | 输入Tokens | 12元/百万Tokens | 100% | 提示词、文档、代码和历史上下文 | | 输出Tokens | 36元/百万Tokens | 300% | 报告、代码、分析结果和工具调用计划 | | 隐式缓存命中 | 1.5元/百万Tokens | 12.5% | 重复系统提示词、固定知识库、代码仓库上下文 |
一项消耗10万输入Tokens和10万输出Tokens的任务,按基础价格计算约需4.8元,其中输入成本1.2元、输出成本3.6元。如果10万输入Tokens全部符合缓存命中条件,对应输入成本可降至0.15元;不过真实任务通常只有部分上下文能够复用,实际账单取决于缓存命中比例。
官方还以Anthropic Opus 5作为国际价格参照,称Qwen3.8-Max的国际输入和输出价格分别为Opus 5的40%与24%。由于参考资料没有给出国际市场的绝对价格、计费币种和完整套餐条件,这里更适合按相对比例理解。
| 国际价格对比 | 输入价格指数 | 输出价格指数 | |---|---:|---:| | Anthropic Opus 5 | 100 | 100 | | Qwen3.8-Max | 40 | 24 |
这套定价显然在争夺高频Agent工作负载。Agent会不断读取上下文、生成计划、调用工具并根据结果继续推理,请求次数和Token消耗都远高于普通聊天;如果模型能力接近,输出价格和缓存机制会直接影响产品能否长期运行。
下周开源2.4T权重,意义大于下载量
Qwen3.8-Max模型权重预计于下周开放,阿里还将同时开源规模更适合实际部署的Qwen3.8-27B。对于绝大多数开发者而言,27B版本可能比2.4T旗舰权重更具现实价值,因为它更容易完成本地推理、量化、微调和私有化部署。
**模型权重是大模型训练后形成的参数文件,开放权重允许开发者自行部署、评估和进行后续适配。**不过,开放权重并不自动等于完整开源,许可证、训练代码、数据说明、推理框架支持和商用限制仍需以正式发布内容为准。
2.4T模型即使采用较低精度存储,也会带来极高的下载、存储和集群部署门槛。它的开源价值更多体现在研究透明度、生态号召力和头部机构部署,而不是让普通用户在单台工作站上运行。
Qwen3.8-27B则可能承担生态普及的任务。27B级模型更有机会进入企业私有环境、专业工作站和多卡服务器,也更适合开发者围绕垂直数据进行微调;如果它能保留旗舰版本在工具调用、代码和办公任务上的方法能力,实际影响可能不小于Max版本。
目前仍有几项关键信息需要等待下周确认:
- Qwen3.8-Max的精确模型架构与活跃参数量;
- 上下文窗口、最大输出长度和支持的多模态输入类型;
- 权重格式、许可证及商业使用边界;
- 官方推理框架、量化方案和推荐硬件配置;
- Qwen3.8-27B与Max版本之间的能力差距;
- 可复现的编程、办公和长程Agent评测结果。
千问的优势是产品闭环,风险是内部评测说得太多
Qwen3.8-Max目前最明确的优势,是模型、开发工具、云端API和办公Agent在同一天形成了产品闭环。它既能进入开发者工作流,也能通过千问办公触达非技术用户,这比只发布模型权重或榜单成绩更有商业意义。
阿里需要补上的部分,是更完整的公开技术信息和第三方验证。现阶段关于全栈开发、数据分析、Office工作流和多Agent任务的描述,主要来自官方内部评测;没有任务集、成功率、运行时长和对照模型,外界很难判断“全面提升”究竟提升了多少。
开发者也不应只根据Arena排名或参数量迁移生产业务。更稳妥的方法是选取20至100个真实任务,对比Qwen3.8-Max与现有模型的首次完成率、人工接管次数、平均Token成本、端到端延迟和结果可追溯性。
办公用户则应重点检查数据准确性和文件兼容性。AI生成一份报告的速度可能从数小时缩短到十几分钟,但如果用户仍要逐个核对表格公式、引用来源和图表数字,节省的时间就会被审核成本抵消。
结论:这不是一次单纯的参数竞赛
Qwen3.8-Max的核心看点不是2.4万亿参数本身,而是阿里开始用旗舰模型承接可以计价、可以交付的长程工作。每百万Tokens输入12元、输出36元以及1.5元的缓存命中价格,为高频Agent应用提供了较清晰的成本基础;千问办公则负责把模型能力包装成普通用户能够直接使用的工作流。
这次发布也把千问推到了更困难的竞争阶段。模型进入全球第一梯队之后,下一步不再只是追逐榜单,而是证明它能在复杂工程和真实办公环境中稳定工作,并让用户少接管、少返工、少核对。
如果下周的权重开放如期完成,并同步给出架构、许可证和可复现评测,Qwen3.8-Max会成为2026年开源模型生态的重要节点。若这些信息继续缺位,那么2.4T仍然只是一个足够醒目的发布数字,而不是开发者可以充分验证的技术结论。
参考来源
- IT之家:阿里巴巴千问Qwen3.8-Max模型正式上线,总参数量2.4万亿——8月3日发布信息,包含模型能力、API价格、Arena表现、千问办公接入及开源计划。
- 知乎:阿里云千问Qwen3.8-Max模型2.4T参数量与体验渠道——补充整理预览版体验入口、模型规模及办公与代码场景信息。



