AI 快讯JetBrains发布Mellum 2.1,押注智能体编程
模型上新

JetBrains发布Mellum 2.1,押注智能体编程

2026-10-09T07:03:21.160Z
JetBrains发布Mellum 2.1,押注智能体编程

JetBrains于10月8日发布Mellum 2.1,在延续12B总参数、2.5B激活参数MoE架构的基础上,把强化学习训练扩展到智能体编程核心环节。官方称其高负载推理吞吐量接近Qwen3.5-9B的两倍,模型以Apache 2.0许可开放权重。

JetBrains发布Mellum 2.1:强化智能体编程,开放权重采用Apache 2.0

JetBrains于2026年10月8日发布Mellum 2.1,重点不是把模型做得更大,而是让它更能独立完成软件工程任务:理解代码库、修改文件、根据测试结果定位问题,再检查自己的修复是否有效。Mellum 2.1是JetBrains面向编程与AI工作流推出的开放权重模型,延续Mellum 2的12B混合专家架构、2.5B激活参数规模,并以Apache 2.0许可证发布。

这次更新的核心信号是,JetBrains正在把Mellum从一个“能写代码的模型”往“能参与工程流程的模型”推进。它仍不是Claude Code或Codex那样开箱即用的完整编程产品,而是可以被团队拿去部署、集成和编排的模型底座。对希望把代码留在自有基础设施中的企业来说,这种定位有现实价值;对期待一个装好就能替自己开发的通用智能体的个人用户来说,模型本身并不能替代完整的工具链。

JetBrains Mellum 2.1 发布信息与模型评测对比图

从短期收尾,转向强化学习主训练

强化学习是模型通过执行任务、获得奖励或反馈来调整行为的一类训练方法;在编程场景中,它可以让模型不只模仿答案,还学习怎样调用工具、运行测试和根据结果修正方案。Mellum 2.1最重要的训练变化,正是把强化学习从预训练后的短期收尾阶段,扩展成训练主体的一部分。

JetBrains称,新版本在数学、算法竞赛、科学、工具使用和软件工程等方向补充了训练数据。训练前,团队还筛选开放数据集,剔除存在测试缺陷、答案无法验证或难度不合适的任务。这个步骤听起来不如增加参数醒目,却直接影响强化学习能不能学到可靠行为:如果测试本身有漏洞,模型得到的奖励就可能与真实问题解决能力脱钩;如果任务答案无法验证,训练信号也会变得含糊。

JetBrains还为训练搭建了内部强化学习环境基础设施,在训练期间启动数百万个沙盒,覆盖数千个环境。沙盒可以理解为彼此隔离的任务执行空间,模型在其中尝试操作、接收结果,再据此调整策略。对软件工程模型而言,这类环境不仅用来“跑代码”,更关系到模型是否学会按步骤工作:先查看相关文件,提出修改,执行测试,分析失败信息,然后决定要不要继续改。

这里的变化很关键。单轮代码生成通常只需要把输入映射成一段输出;智能体式编程则要持续处理工具返回的信息,维持任务状态,并在行动失败时重新规划。模型可能先写出看似合理的补丁,但只有在测试通过、行为符合预期后,任务才算真正完成。Mellum 2.1强化的是这段循环,而不只是让模型在空白编辑器里更流畅地补全代码。

能力边界:更像工程执行者,不等于自主开发者

智能体编程是指模型能够围绕目标连续执行多个工程步骤,包括理解代码库、调用工具、修改文件和验证结果,而不是只对单条提示生成代码。JetBrains表示,Mellum 2.1可以探索代码库、编辑文件并检查自身修改;官方称,提升最明显的领域是智能体编程,模型能够识别失败测试的根因、起草修复方案并验证结果。

这套能力对应的是开发者每天会遇到的真实任务。例如,一个测试在重构后失败,模型需要读懂失败信息,追踪相关实现和调用关系,判断是测试预期过时还是代码引入回归,再修改并重新验证。若模型只会生成补丁,却不会观察测试结果,它很容易把“写完代码”误当成“解决问题”。Mellum 2.1的训练重点,至少从设计方向上正面瞄准了这个落差。

不过,“可以完成”不等于“在任意仓库里都可靠”。参考资料没有提供该能力在多少个真实代码库、多少类任务上的成功率,也没有给出独立第三方的复现结果。数百万沙盒说明训练基础设施规模不小,却不能单独证明模型面对复杂生产仓库时的成功率。因此,现阶段更稳妥的判断是:Mellum 2.1把优化重点放到了智能体所需的行为链条上,但实际效果仍需结合公开评测、目标仓库和工具配置验证。

12B总参数,2.5B激活:吞吐优势来自哪里

混合专家模型(Mixture of Experts,MoE)是一种按输入动态选择部分参数参与计算的模型架构。Mellum 2.1总规模为12B参数,但每次推理激活约2.5B参数;这使它保留较大模型的参数容量,同时避免每个请求都让全部参数参与计算。这里的“激活参数”不等于模型文件只有2.5B,部署时仍须考虑完整权重、显存、并发和上下文等资源需求。

JetBrains表示,Mellum 2.1与Mellum 2采用相同架构,基础速度保持不变;新增的多Token预测(MTP)进一步提升响应速度。MTP是一种在生成过程中预测多个后续Token、再通过验证提高生成效率的技术。官方称,在单请求场景下,MTP使速度提高约1.6倍。这个数字描述的是单请求推理速度,不能直接解读成所有硬件、批量大小和任务下都能稳定提升1.6倍。

吞吐量是衡量推理系统在单位时间内生成多少Token的指标,通常与并发负载和服务端整体处理能力相关。JetBrains在相同评估设置下,将Mellum 2.1与Mellum 2、Qwen3.5-9B和Gemma 4 E4B进行比较,并称高负载时Mellum 2.1的推理吞吐Token数量接近Qwen3.5-9B的两倍。官方还称,新模型在编程、算法竞赛、数学、工具调用和通用知识等评估维度上均有提升。

| 对比项 | Mellum 2.1 | Mellum 2 | Qwen3.5-9B | Gemma 4 E4B | |---|---|---|---|---| | 总参数规模 | 12B | 12B | 9B | E4B型号 | | 激活参数 | 2.5B | 2.5B | 参考资料未提供 | 参考资料未提供 | | 架构关系 | 延续Mellum 2的MoE架构 | MoE | 参考资料未提供 | 参考资料未提供 | | 高负载吞吐 | JetBrains称接近Qwen3.5-9B的两倍 | 未提供可比数字 | 作为对比对象 | 作为对比对象 | | MTP单请求速度 | 官方称约提升1.6倍 | 参考资料未提供 | 不适用此项对比 | 不适用此项对比 | | 许可证 | Apache 2.0 | Apache 2.0 | 参考资料未提供 | 参考资料未提供 |

这组数据值得关注,但也需要正确理解。高负载吞吐接近两倍,是JetBrains在其评估设置下给出的结果;参考资料没有披露完整硬件配置、批量大小、上下文长度、量化方式和每项任务的原始分数。因此,它适合作为模型效率的方向性信号,不应当被直接当作跨硬件部署的保证。对企业来说,真正关心的通常不是单个峰值,而是在目标并发量、上下文长度和准确率要求下,每张卡能稳定处理多少任务。

Apache 2.0降低了部署门槛,但不消除工程成本

Apache 2.0是一种宽松的开源许可证,允许使用者在遵守许可证条款的前提下使用、修改和分发相关软件或模型权重。Mellum 2.1开放权重并采用Apache 2.0,意味着企业可以在自有基础设施上运行模型,不必将代码和输入数据交给外部推理服务处理。这对受数据驻留、源码保密或内部合规约束的团队尤其重要。

开放权重的意义不只是“可以下载”。团队能够自行选择部署地点、推理框架、权限边界和日志策略,也能评估模型是否适合接入内部代码搜索、持续集成和开发环境。不过,自托管并不等于零成本:模型权重需要存储和加载,推理服务需要运维,工具调用需要权限管理,模型输出还需要评测和审计。Apache 2.0解决的是许可灵活性,不会替团队解决硬件预算、可靠性和安全治理。

JetBrains称,Mellum 2.1已登陆Hugging Face,可供本地或自有基础设施部署。官方后续还计划推出面向llama.cpp、Ollama和LM Studio的GGUF版本,以及适用于vLLM的MTP推测解码组件。GGUF通常面向本地推理生态,vLLM则常用于服务端推理;这些适配如果按计划交付,会让模型覆盖从个人开发机到团队推理服务的更多部署形态。目前这些仍是后续计划,不能视为已经发布的现成功能。

Mellum 2.1适合谁,竞争力又在哪里

Mellum 2.1最明确的目标用户,是希望把较小模型放进工程流程、并保留基础设施控制权的团队。它可以作为内部工具链中的代码分析或修复模型,也可以承担智能体系统里的子任务:例如先定位相关文件、整理失败测试信息,再由更强的模型或开发者审查方案。2.5B激活参数和官方强调的高负载吞吐,让它有机会在成本和延迟敏感的环节发挥作用。

与闭源前沿编程产品相比,Mellum 2.1的优势不是已被证明的综合能力领先,而是开放权重、Apache 2.0许可和可自托管。与其他开放模型相比,它的看点则集中在JetBrains围绕软件工程任务构建的训练流程,以及强化学习环境的规模。模型是否能在真实工作流里胜出,仍要看评测可复现性、工具调用稳定性和部署成本,而不能只看参数量或单项吞吐结果。

开发者评估时,可以从三类任务入手:第一,模型能否在目标仓库中准确定位相关代码,而不是泛泛给出建议;第二,修改后能否正确运行测试,并根据失败信息继续迭代;第三,在实际并发与上下文条件下,吞吐、延迟和资源占用是否达到团队要求。模型能否可靠完成这三类任务,比一张脱离部署环境的排行榜更能说明它是否适合生产。

判断:这是一次训练方向升级,不是性能数字竞赛

Mellum 2.1最有价值的更新,是JetBrains把强化学习从训练尾声推到核心位置,并用更大规模的执行环境训练模型处理多步骤工程任务。高负载吞吐接近Qwen3.5-9B的两倍、单请求MTP提速约1.6倍,为它提供了效率方面的吸引力;Apache 2.0和可自托管,则把模型交给企业自行评估和集成。

但现有公开信息不足以判断它是否已经达到通用编程智能体的可靠性标准:缺少完整基准数字、硬件条件和独立验证,也没有证明复杂仓库中的端到端任务成功率。更合理的结论是,JetBrains正在把Mellum 2.1做成一个面向工程工作流、强调效率与部署控制的开放模型。它值得进入团队的候选评测名单,但上线前仍应在自有代码库、测试体系和目标推理硬件上做实测。

参考来源

相关推荐

查看全部