千问3.8 Max多平台上线

阿里上线2.4T参数的Qwen3.8-Max-Preview,覆盖千问、Qoder与Token Plan。正式版将在近期发布并开源,但架构、跑分和许可证仍待公布。
阿里在今天(2026年7月19日)集中上线了新一代旗舰模型 Qwen3.8-Max-Preview,首批覆盖千问 PC 端与 Web 端、Qoder、QoderWork以及阿里 Token Plan。按照阿里目前给出的时间表,Qwen3.8-Max 正式版将在近期发布并开源,千问 App 也将在正式版推出时同步接入。
Qwen3.8-Max-Preview 是阿里千问3.8系列旗舰模型的预览版本,官方披露的总参数量为2.4T,即2.4万亿参数。 这是目前最值得关注的技术数字,但也是阿里暂时公布的少数硬指标之一:模型架构、实际激活参数、上下文长度、推理模式、基准测试成绩以及正式调用价格均未披露。

这次发布更像是一次面向真实工作负载的公测,而不是一场完整的技术发布会。阿里没有先用十几张排行榜图证明模型能力,而是直接把预览版塞进编程、办公和多智能体产品,让用户通过实际任务验证效果;与此同时,再用最低1折、夜间0.2折起的 Credits 活动迅速扩大试用规模。
2.4T参数很大,但现在还不能直接换算成能力
2.4T参数代表模型训练和存储规模达到万亿参数级别,但不等于每次生成都会调用全部2.4万亿参数。 如果Qwen3.8-Max采用混合专家架构,也就是 MoE,那么每个 Token 可能只激活部分专家参数;如果采用稠密架构,推理成本、显存占用和部署难度则会完全不同。阿里目前没有确认架构,因此不能仅凭2.4T推断其速度、成本或本地部署门槛。
参数规模在今天已经不是判断旗舰模型的充分条件。开发者真正需要观察的是:模型能否稳定完成跨文件修改,能否在长对话里保持目标一致,工具调用失败后能否自我恢复,以及多智能体协作时会不会因为上下文污染而跑偏。这些能力通常比单轮问答分数更接近生产环境,也正是阿里此次反复强调全栈开发、数据分析和 Office 工作流的原因。
阿里将Qwen3.8-Max-Preview定位为面向代码工程、专业办公和长程智能体任务的旗舰模型。 官方称,它相较不久前推出的Qwen3.7-Max有明显提升,并在内部真实任务评测中表现出“匹敌世界前沿模型”的水平,甚至给出了“可能是除了Fable 5外最强大的模型”这一颇为激进的判断。
这句话目前只能视为厂商定位,不能视为已经得到外部验证的排名。阿里尚未公布对应评测集、任务成功率、裁判模型、测试轮数以及与竞品比较时采用的版本和工具配置;在缺少可复现数据的情况下,“最强”更接近发布口径,而不是确定结论。
真正的升级重点,是长程任务而非聊天
长程任务是需要模型连续规划、调用工具、检查结果并修正错误的多步骤工作。 它与普通聊天最大的不同,是一次任务可能持续几十分钟甚至数小时,中间涉及浏览文件、执行命令、处理表格、生成文档以及在多个子任务之间传递状态。
Qwen3.8-Max-Preview瞄准的正是这类场景。比如,让模型为一个现有仓库增加支付功能,并不只是生成一段代码:它要先理解项目结构,再定位接口和数据库模型,修改前后端文件,补齐测试,执行构建,最后根据报错继续调整。任何一步出现幻觉,都会让后续步骤建立在错误基础上。
多智能体任务是由多个具有不同职责的 Agent 协同完成同一目标的工作方式。 在一个数据分析任务中,一个 Agent 可以负责清洗数据,另一个负责生成 SQL,第三个负责制作图表,最后再由主 Agent 汇总报告。模型越擅长任务拆分、状态管理和结果校验,多 Agent 系统才越不容易变成“多个模型一起犯错”。
阿里把Qwen3.8-Max-Preview同时放进Qoder与QoderWork,说明其目标已经从代码补全扩展到完整工作流。Qoder偏向软件工程任务,QoderWork则承接办公和生产力场景;两者都比普通聊天窗口更容易暴露模型在工具调用、长上下文和错误恢复上的短板。
这也是Qwen3.8-Max-Preview此次最有价值的测试方式。传统基准往往测量一道题是否答对,而真实 Agent 系统还要考虑完成时间、工具调用次数、失败重试成本和最终交付物能否直接使用。一个跑分更高但经常陷入循环的模型,未必比能力略低却执行稳定的模型更适合生产环境。
一次上线五个入口,阿里在主动收集真实反馈
Qwen3.8-Max-Preview目前已经进入五类主要入口,覆盖普通用户、开发者和智能体重度用户。 千问 PC 端与 Web 端提供免费体验,Qoder和QoderWork负责代码及办公工作流,Token Plan则面向需要持续消耗模型额度的个人用户。
| 平台或产品 | 当前状态 | 主要使用场景 | 费用与活动 | |---|---|---|---| | 千问 PC 端 | 已上线预览版 | 通用对话、文件处理、桌面生产力 | 可免费体验 | | 千问 Web 端 | 已上线预览版 | 浏览器内对话与任务处理 | 可免费体验 | | 千问 App | 正式版发布时同步上线 | 移动端通用助手 | 暂未公布 | | Qoder | 已首发支持 | 代码工程、仓库级开发、Agent任务 | 模型 Credits 限时1折消耗 | | QoderWork | 已首发支持 | 数据分析、Office与专业办公工作流 | 夜间活动最低0.2折起 | | Token Plan个人版 | 已正式发布 | 多模型与多Agent持续使用 | 39元/月起 |
这种多入口同步上线不是简单地增加曝光,而是给正式版做压力测试。聊天入口能收集通用指令遵循问题,Qoder能暴露跨文件编辑与终端操作缺陷,QoderWork则能检验表格、文档和流程自动化能力。不同产品产生的失败样本,可能会直接影响正式版的后训练与系统调优。
预览版是仍在快速迭代、能力和行为可能发生变化的提前体验版本。 阿里称Qwen3.8-Max正在以“天”为单位持续进化,这意味着开发者不应默认今天测试通过的提示词、Agent流程和输出格式,在正式版上一定保持完全一致。
对于准备把它接入正式业务的团队,现阶段更适合做评测,而不是直接锁定技术方案。尤其要记录模型版本、提示词、工具权限、任务成功率、总耗时和 Credits 消耗,否则正式版上线后很难判断变化到底来自模型升级,还是来自系统配置调整。
Token Plan每月39元起,但Credits不是Token
Token Plan是阿里面向个人用户推出的模型用量订阅方案,以Credits而非直接以Token计算额度。 Lite、Standard和Pro三档套餐分别面向轻量体验、中度Agent工作流和多Agent并发任务,限时价格从39元到499元不等。
| 套餐 | 限时月费 | 原价 | 7天额度 | 5小时额度 | 官方建议并发规模 | |---|---:|---:|---:|---:|---:| | Lite | 39元 | 60元 | 2,500 Credits | 700 Credits | 1~2个Agent | | Standard | 139元 | 180元 | 10,000 Credits | 3,000 Credits | 3~4个Agent | | Pro | 499元 | 600元 | 40,000 Credits | 12,000 Credits | 6~8个Agent |
Lite的39元价格是原价60元的6.5折,Standard的139元约为原价180元的7.7折,Pro的499元约为原价600元的8.3折。三个档位并不是简单按月提供一整桶额度,而是同时设置7天和5小时两个时间窗口,因此重度用户还要关注短周期上限,不能只看月费。
Credits是平台内部用于衡量模型和Agent资源消耗的计费单位,不能在官方未给出换算规则时直接等同于Token。 模型输入、输出、工具调用或复杂任务可能采用不同消耗系数,因此“2,500 Credits”并不意味着固定可处理2,500个Token,也不能直接拿来和其他模型的百万Token价格比较。
Qwen3.8-Max-Preview当前参加限时活动,白天按正常Credits消耗的1折计算,相当于同样额度理论上可获得10倍用量。个人版Token Plan在每日22:00至次日08:00还可在1折基础上再享2折,最终最低为正常消耗的2%,也就是0.2折,理论用量可达到原来的50倍。
这项活动适合开发者集中跑批量评测,但不适合被当成长期成本基线。阿里尚未公布活动结束日期,只表示结束前会提前通知;如果团队按照0.2折设计工作流,活动结束后相同任务的Credits成本理论上可能回到当前的50倍。
和Qwen3.7-Max相比,已知的变化仍然有限
Qwen3.8-Max-Preview是Qwen3.7-Max之后面向智能体任务推出的新旗舰预览模型。 阿里明确强调了复杂任务能力提升,但没有公布两代模型在统一公开基准上的逐项成绩,因此当前只能比较官方已披露的定位,不能给出量化胜负。
| 对比项 | Qwen3.7-Max | Qwen3.8-Max-Preview | |---|---|---| | 产品阶段 | 已上线旗舰模型 | 预览版,正式版即将发布 | | 已披露参数量 | 本次资料未披露 | 2.4T总参数 | | 重点能力 | 编程、办公自动化、长周期任务 | 全栈开发、数据分析、Office工作流、多Agent长程任务 | | 外部公开跑分 | 本次发布未提供统一对照数据 | 尚未公布 | | 开源状态 | 未在本次信息中说明 | 正式版计划近期开放源代码或权重,具体形式待确认 | | 当前入口 | 阿里相关模型与产品平台 | 千问PC/Web、Qoder、QoderWork、Token Plan |
Qwen3.8-Max-Preview的优势目前主要体现在产品覆盖面,而不是已经公开的跑分。它一上线就进入代码、办公和个人订阅体系,测试场景比单一聊天产品更丰富;但在没有第三方盲测和公开任务集结果之前,开发者仍应避免仅凭参数量完成模型选型。
最值得关注的对比指标应该是端到端任务成功率。对于仓库级开发,可以统计首次修复成功率、测试通过率和平均工具调用次数;对于数据分析,可以统计公式正确率、图表一致性与结论可追溯性;对于办公Agent,则要观察格式保持、文件兼容和多轮修改后的内容稳定性。
“即将开源”是最大看点,也是最大悬念
模型开源通常指公开模型权重、推理代码或训练相关资产,但不同项目开放的范围和许可证可能完全不同。 阿里目前确认Qwen3.8-Max正式版将于近期发布并开源,却没有进一步说明会开放完整2.4T权重、量化版本、基础模型、指令模型,还是只开放部分尺寸。
2.4T参数也让这次开源具备现实门槛。即使只按每个参数2字节的BF16或FP16精度粗略估算,完整权重体积也可能达到约4.8TB;如果采用8位量化,理论体积仍在约2.4TB量级;4位量化也可能接近1.2TB。实际文件大小还会受到架构、词表、专家配置和量化格式影响,但无论如何,它都不会是普通消费级显卡可以轻松完整加载的模型。
因此,正式版开源的真正价值未必是“人人在笔记本上运行”,而是让研究机构和有集群资源的团队能够验证架构、进行领域微调,并围绕推理框架做优化。如果阿里同时发布较小的蒸馏版本、低比特量化版本或稀疏推理方案,开源影响力才会进一步扩大。
许可证同样决定开源含金量。开发者需要确认是否允许商业使用、是否对大规模部署设置额外条款、衍生模型能否重新分发,以及训练数据与安全评测是否提供足够说明。在这些信息发布前,“即将开源”值得期待,但还不能直接等同于低成本私有化部署。
这次发布有用,但不该急着喊“最强”
Qwen3.8-Max-Preview目前最清晰的价值,是把2.4T级旗舰模型直接放进真实生产力场景。 免费聊天入口降低了试用门槛,Qoder与QoderWork提供了比普通问答更严格的任务环境,Token Plan则通过1折和夜间0.2折起活动鼓励用户跑长程任务。
这套打法比只发布一个模型名称更有用。开发者可以立刻拿自己的仓库、表格和文档测试,而不是等待厂商挑选后的演示案例;阿里也能在正式版发布前获得大量真实失败数据,从而修正工具调用、指令遵循和长程稳定性问题。
但Qwen3.8-Max-Preview距离“能力已被坐实”仍差一套完整证据。2.4T参数很醒目,官方的竞争定位也足够大胆,可目前缺少公开跑分、架构细节、上下文规格、固定价格和第三方评测。对深度用户而言,现阶段正确姿势是把它当成一个值得立即测试的旗舰候选,而不是已经确定的新王者。
正式版接下来有四个关键信息值得追踪:
- 公开评测数据:是否披露SWE-bench、Terminal-Bench及长程Agent任务的完整成绩与配置。
- 模型架构细节:2.4T是总参数还是激活参数,是否采用MoE,以及单次推理的实际计算规模。
- 开源范围与许可证:是否开放完整权重、基础模型、量化版本和可商用授权。
- 正式成本与稳定性:限时折扣结束后的Credits规则、输出速度、并发限制和版本兼容策略。
如果阿里能在正式版中补齐这些信息,Qwen3.8-Max的意义就不只是千问产品线的一次常规升级。它可能成为2026年少数同时覆盖超大参数、代码Agent、办公工作流与开放权重的旗舰模型之一,并继续把前沿模型竞争从“谁更会答题”推向“谁能稳定交付完整工作”。
参考来源
- IT之家:阿里Token Plan个人版发布,限时优惠每月39元起 —— 包含三档订阅价格、Credits限制、并发规模及夜间优惠信息。
- IT之家:阿里Qoder上线Qwen3.8-Max-Preview模型 —— 介绍Qoder接入情况、限时1折活动及长程任务定位。
- IT之家:千问PC端接入Qwen3.8-Max-Preview —— 确认千问PC端、Web端和后续App的上线安排。
- IT之家:阿里千问Qwen3.8预览版模型上线 —— 披露2.4T参数规模、正式版开源计划与官方能力表述。
- IT之家:Qwen3.6-Max预览版发布 —— 提供千问此前旗舰预览模型在编程、知识和指令遵循方面的演进背景。



