MiniCPM5-2B登顶AA榜

面壁智能发布MiniCPM5-2B,以17分拿下AA榜单4B以下模型第一。它把512K上下文、混合思考和智能体能力塞进2B参数,但真实端侧速度仍待开源验证。
MiniCPM5-2B登顶AA榜:2B参数开始抢端侧智能体入口
面壁智能今天把端侧模型的竞争门槛又向上抬了一截。
7月19日,面壁智能联合 OpenBMB 在 2026 世界人工智能大会发布 MiniCPM5-2B,并宣布完成多款芯片适配。据IT之家报道,这款模型在最新一期 Artificial Analysis 榜单中获得 17分,位列全球 4B 参数以下模型第一。
**MiniCPM5-2B 是一款面向手机、PC、智能座舱等本地设备设计的20亿参数端侧大语言模型。**它原生支持混合思考、512K超长上下文、工具调用、深度搜索和代码生成,目标不是只在终端上做问答,而是直接成为本地智能体的基础模型。
这次发布最值得关注的并不是“2B模型又刷新了一个榜单”,而是面壁智能开始把长上下文、推理模式切换和Agent能力同时压进2B规模。过去的小模型往往需要在“能跑”和“聪明”之间二选一,MiniCPM5-2B试图把选择题改成工程题。

17分意味着什么:先看榜单,再看边界
**AA-Index 是 Artificial Analysis 用于综合衡量语言模型能力的独立评测指标。**它通过多项公开能力测试形成聚合分数,适合观察不同模型的相对位置,但不能替代具体业务场景下的准确率、延迟和功耗测试。
MiniCPM5-2B以17分登上4B以下模型首位,说明它在通用知识、数学、代码、指令遵循等综合任务上处于当前同参数档的前列。对2B模型而言,这一成绩尤其重要,因为参数量基本决定了模型权重的存储下限,也直接影响设备能否在不联网的情况下持续运行。
**榜单第一应当被理解为“特定版本AA综合评测中的第一”,而不是所有任务上的绝对最强。**面壁智能此前发布的MiniCPM5-1B曾在当时的AA榜单中得到17.9分,而本次2B模型公布的是17分;这并不意味着新模型反而退步,因为榜单题集、模型集合、评分口径和测试时间可能发生变化,不同快照的数字不能直接横向相减。
公开数据可以整理如下:
| 模型 | 参数规模 | AA公开成绩 | 成绩所处时间 | 思考模式 | 最长上下文 | 当前状态 | |---|---:|---:|---|---|---:|---| | MiniCPM5-2B | 2B | 17分 | 2026年7月最新榜单 | 原生混合思考 | 512K | 已发布,权重即将开源 | | MiniCPM5-1B | 1B | 17.9分 | 2026年5月榜单快照 | 公开资料未完整说明 | 本次资料未披露 | 已开源 | | Qwen3.5-2B | 2B | 16.3分 | 此前公开报道所引榜单快照 | 支持推理类任务 | 此处不作跨版本比较 | 已发布 |
**这张表只能说明MiniCPM系列的能力密度持续提高,不能证明17分一定高于17.9分。**开发者真正需要等待的是同一榜单版本、同一推理配置和同一量化精度下的复测结果,尤其是开启思考与关闭思考后的分项成绩。
面壁智能这次也没有公开各子项分数,因此目前还无法判断17分主要来自数学和代码增强,还是通用知识、长文本与指令遵循的整体改善。综合分适合传播,但对准备落地模型的团队而言,分项能力往往比总分更有价值。
混合思考比单纯“会推理”更适合端侧
**混合思考是指模型能够在快速直接回答与展开多步推理之间切换的工作方式。**简单问题不必生成冗长思维过程,复杂数学、代码和规划任务则可以投入更多计算量,核心是让推理成本随任务难度变化。
这一设计对端侧设备比对云端更重要。云端模型多生成几百个Token,主要增加的是调用时间和服务器成本;手机或汽车座舱多生成几百个Token,则会直接反映为等待时间、芯片占用、温度与耗电量。
例如,用户询问“下一场会议几点开始”时,模型只需要读取日历并快速作答;用户要求“结合邮件、日历和当前位置调整今天的行程”时,模型才需要调用多个工具、检查约束并给出执行计划。两类任务如果始终使用同一种推理深度,要么浪费算力,要么能力不足。
**MiniCPM5-2B的实用价值取决于模式切换是否足够稳定。**官方目前确认它“原生支持混合思考”,但尚未公布切换是由用户显式控制、系统提示控制,还是由模型自动路由,也没有给出两种模式下的首Token延迟、每秒生成Token数和平均输出长度。
这几个指标将决定所谓混合思考究竟是产品能力,还是模型配置项。端侧用户不会因为模型只有2B参数就接受十几秒的停顿,开发者也需要知道深度推理开启后,准确率提升能否覆盖额外的延迟和能耗。
512K上下文很激进,但“装得下”不等于“用得好”
**512K上下文是指模型单次推理最多能够接收约52.4万个Token的输入与输出序列。**按照文本类型和分词方式不同,它可以容纳一部长篇小说、大量工作文档,或者数十万行结构相对简短的代码。
在2B参数模型上提供512K上下文,是MiniCPM5-2B最激进的技术指标之一。长上下文让本地设备有机会直接处理完整项目代码、会议资料、车辆手册和个人知识库,减少切片、检索与多轮拼接造成的信息损失。
但最大上下文长度只代表模型“允许输入多少”,不代表它在整个窗口内都能稳定找到关键信息。长文本能力至少要看三件事:
- 有效检索距离:关键信息放在开头、中间和结尾时,模型能否同样准确地找到;
- 跨段推理能力:模型能否把相隔数十万Token的多条线索组合起来,而不是只做关键词匹配;
- 运行资源消耗:上下文拉长后,内存占用、预填充时间和功耗是否仍适合终端。
**512K在端侧的最大挑战不是模型权重,而是长序列推理产生的运行时开销。**仅按理论权重计算,2B参数使用BF16保存约需4GB空间,INT8约需2GB,4-bit量化约需1GB;这些数字还没有包含KV Cache、运行时缓存、系统内存、工具框架和上下文本身。
模型如果真正读取接近512K的内容,预填充阶段可能比短对话耗时得多。官方尚未公布MiniCPM5-2B的注意力结构、KV Cache优化方式、不同芯片上的内存峰值与长文本吞吐,因此现阶段不能简单理解为“1GB左右权重就能在手机上流畅读完整本书”。
更现实的产品形态可能是分层使用上下文:常规对话保持在较短窗口,只有文档分析和代码仓库理解任务才启用超长窗口,并结合本地检索、缓存和摘要降低重复计算。这比每次都把几十万Token全部塞进模型更符合端侧资源约束。
这次真正补强的是Agent,而不只是聊天
**端侧智能体是能够在本地理解目标、调用设备工具并执行多步骤任务的AI系统。**它与普通聊天模型的区别在于,回答不是终点,读取日历、修改设置、搜索文件、控制车载功能或运行代码才是任务闭环。
MiniCPM5-2B原生具备工具调用、深度搜索和代码生成能力,训练流程也明显围绕Agent展开。按照面壁智能披露的信息,模型依次进行了三阶段强化:
- 200B规模的Agent Midtraining:在基础预训练之后,继续使用约2000亿Token规模的智能体相关数据训练模型,让模型熟悉工具、环境状态和多步任务;
- 百万条高质量轨迹的Agent SFT:通过超过百万条任务执行轨迹进行监督微调,学习何时调用工具、如何填写参数以及如何处理工具返回结果;
- 可扩展的Agent RL:利用强化学习进一步优化任务完成率、执行稳定性和长流程决策。
**Agent Midtraining 是位于通用预训练与任务微调之间、专门注入智能体行为模式的继续训练阶段。**它解决的是“模型是否理解工具和环境”问题,而不是只教模型记住几个固定函数格式。
**Agent SFT 是使用人工筛选或自动生成的高质量执行轨迹监督模型学习行动步骤。**百万条轨迹的意义在于覆盖更多成功、失败、重试和异常分支,避免模型只会在理想输入下调用工具。
**Agent RL 是通过任务结果或过程奖励优化智能体行为的强化学习阶段。**它的目标通常不是让语言更漂亮,而是提高工具选择正确率、参数准确率、任务完成率以及复杂流程中的恢复能力。
这套路线比单独做函数调用微调更完整,也更符合端侧助手的需求。手机助手需要处理权限拒绝,PC助手可能遇到文件不存在,车载助手则必须在安全约束下执行操作;真正可靠的Agent不能只会发出调用,还要知道什么时候不能调用,以及失败后如何停止或改道。
**原生Agent能力仍然不等于设备拿到模型后就能直接工作。**工具调用只负责生成结构化意图,实际执行仍依赖操作系统权限、工具注册、沙箱、安全确认、状态管理和结果回传。深度搜索也需要本地或联网检索组件配合,不能由一个2B权重文件独立完成。
因此,MiniCPM5-2B更准确的定位是端侧Agent的“决策大脑”,而不是完整的端侧助手产品。它降低了模型层门槛,但剩下的系统工程仍然不少。
芯片适配范围很广,性能数字却还缺席
**芯片适配是指模型完成针对特定硬件、推理后端和算子体系的转换、优化与运行验证。**同一个模型能否在不同设备上跑起来,取决于量化格式、算子支持、内存调度和硬件加速接口,而不只是权重文件是否兼容。
面壁智能表示,MiniCPM5-2B已经完成AMD、英特尔、联发科和高通等主流芯片厂商的端侧适配。这一组合覆盖PC处理器、移动SoC及其集成式AI加速单元,说明目标设备并不局限于旗舰手机。
MiniCPM5-2B还联合众智FlagOS社区完成9款芯片的Day 0适配,涉及:
- 华为昇腾
- 海光
- 昆仑芯
- 沐曦
- 摩尔线程
- 平头哥
- 清微智能
- 天数智芯
- 英伟达
适配范围同时延伸至ARM端侧平台。
**Day 0适配是指软件或模型在发布初期即可获得目标硬件的运行支持。**它解决的是开发者拿到模型后不用从零开始转换和补算子的问题,但并不自动代表每个平台都达到最佳性能。
这次发布最明显的缺口,是官方没有同步给出各芯片上的实测数据。目前仍缺少至少四项关键信息:
| 待公布指标 | 为什么重要 | |---|---| | 首Token延迟 | 决定语音助手和座舱交互是否有明显停顿 | | 解码速度(Token/s) | 决定长回答和代码生成的实际等待时间 | | 峰值内存 | 决定模型能否与其他应用同时常驻 | | 持续功耗与温度 | 决定手机、PC和汽车能否长时间运行 |
**没有这些数据,芯片适配目前只能证明“可运行”,还不能证明“好用”。**尤其是512K上下文和深度推理模式,可能让短对话下的漂亮速度失去代表性,后续测试必须区分短上下文、长文档预填充、普通生成和Agent多轮执行。
“即将开源”是这次发布必须加上的限定词
**截至7月19日,MiniCPM5-2B已经发布,但模型权重尚未正式开放下载。**官方表示将在不久后通过Hugging Face、魔搭等平台提供权重,并同步发布不同芯片平台的适配镜像和部署指南。
这意味着开发者目前还无法独立复现17分成绩,也无法验证512K上下文的实际有效性。模型许可证、量化版本、推理框架、思考模式配置和硬件实测结果,同样需要等正式开源后才能确认。
正式开放时,最值得检查的不是下载量,而是以下内容:
- 是否同时提供基础版、指令版或思考版权重;
- 512K是否为默认支持,还是需要特殊推理配置;
- 是否提供INT8、INT4等端侧量化版本;
- 工具调用是否有稳定的结构化输出格式;
- 17分成绩对应哪一版权重、提示模板和推理参数;
- 商业使用、再分发和模型微调受到哪些许可证限制;
- 不同芯片适配镜像是否具备可复现的速度与内存数据。
**只有权重、配置和评测方法同时开放,榜单第一才会转化为开发者可验证的产品优势。**面壁智能此前在MiniCPM系列上积累了较强的开源记录,但本次仍应以实际发布的仓库内容为准。
2B参数的意义,是把Agent从云端功能变成设备能力
**MiniCPM5-2B最有价值的方向,是让部分高频Agent任务摆脱持续联网。**个人文件搜索、会议摘要、设备设置、车内控制和轻量代码辅助,都可以优先在本地完成,只有复杂知识查询或超出能力边界的任务再交给云端模型。
这种混合架构比“所有任务都上云”更符合终端产品逻辑。本地模型负责隐私敏感、实时性强和频率高的任务,云端模型负责知识密集、推理复杂和计算量大的任务,两者之间由路由系统分配。
MiniCPM5-2B目前展示出的优势也很明确:2B规模相对容易量化和常驻,512K上下文扩大了本地数据处理上限,混合思考控制计算开销,Agent训练则让它不止停留在聊天层面。四项能力如果能同时兑现,会比单纯追求某个考试分数更有产业价值。
**这款模型现阶段最大的风险,是发布指标领先于可验证的工程数据。**17分、512K和大范围芯片适配都足够吸引眼球,但端侧模型最终比拼的是同一台设备上的速度、功耗、内存、稳定性和任务完成率,而这些数字暂时没有公开。
我们的判断是,MiniCPM5-2B已经有资格成为4B以下端侧模型的重点候选,但“最强端侧大模型”仍应限定在最新AA综合榜单这一范围内。等权重、许可证、量化模型和芯片实测全部落地后,它才会从榜单冠军变成真正可部署的端侧基座。
参考来源
- IT之家:面壁智能发布端侧模型MiniCPM5-2B——本次发布、AA榜单成绩、512K上下文、Agent训练流程及芯片适配信息来源。
- 知乎:MiniCPM5-1B以1B参数挑战2B模型——用于了解MiniCPM5-1B此前AA榜单成绩及MiniCPM系列能力密度背景;不同时间的榜单分数不可直接比较。
- Hugging Face:OpenBMB组织主页——OpenBMB模型与相关资源的官方托管入口,MiniCPM5-2B权重仍以正式上线情况为准。
- GitHub:OpenBMB开源组织——OpenBMB相关模型、工具链及开源项目入口。



