MiniCPM5-2B开源,端侧Agent成形

面壁智能与 OpenBMB 于 9 月 8 日开源 MiniCPM5-2B。这个仅 20 亿参数的端侧模型在 AA 榜单 4B 以下开源基座模型中排名第一,并在工具调用、搜索和代码任务上展示出通用 Agent 雏形。
MiniCPM5-2B 开源:2B 小模型具备端侧通用 Agent 雏形
面壁智能与 OpenBMB 在 9 月 8 日开源了 MiniCPM5-2B,这是一款参数规模为 20 亿的高密度端侧语言基座模型,重点支持工具调用、深度搜索、代码生成和智能体任务。
它最值得关注的地方,不是又多了一个 2B 模型,而是一个小模型开始能够承担 Agent 工作流中的连续环节:理解任务、拆解步骤、选择工具、读取反馈,并根据结果继续行动。按照 Artificial Analysis Intelligence Index(以下简称 AA 榜单)的最新数据,MiniCPM5-2B 综合得分为 23 分,在全球 4B 参数规模以下的开源基座模型中排名第一;在 Agentic Index 上,它拿到 20 分,远高于多数同尺寸模型。

这不是一次单纯的“权重开源”。面壁智能和 OpenBMB 同步公开了部分训练 Recipe、数据集、自研强化学习框架 Meshy,以及基于奖励的强化学习策略 JustRL II。对于开发者来说,真正有价值的部分可能并不只是下载一个模型,而是观察一个 2B 模型如何被训练成更擅长工具使用和任务执行的模型。
2B 参数拿到 4B 以下综合第一
MiniCPM5-2B 是一款约 20 亿参数的高密度语言模型,高密度意味着绝大多数参数都会参与每次推理,而不是依靠大规模稀疏专家网络降低激活参数量。它的设计目标很明确:在手机、个人电脑、智能座舱和机器人等算力受限设备上,以更低的内存和功耗运行相对完整的语言能力。
根据 AA 榜单最新评测,MiniCPM5-2B 的综合能力得分为 23 分,在全球 4B 参数规模以下的开源基座模型中排名第一。官方披露的 34 项基准测试覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具调用和智能体任务等方向,平均得分为 53.9 分。
这个结果的意义在于,它并非只在一个细分榜单上冲高,而是在多类任务中保持了相对均衡的表现。官方称,MiniCPM5-2B 的平均分领先同级 2B 模型第二名的 33.2 分,也超过 4B 模型中表现最佳的 Qwen3.5-4B。
| 模型或范围 | 参数规模 | AA 综合得分 | 说明 | |---|---:|---:|---| | MiniCPM5-2B | 2B | 23 分 | 全球 4B 以下开源基座模型中排名第一 | | Qwen3.5-4B | 4B | 低于 23 分 | 官方称为 4B 模型中的最佳表现者,但未披露本文所用完整分数 | | Gemma 4 12B | 12B | 22 分 | 补充报道中用于横向比较,参数规模明显更大 | | Qwen3.5 9B | 9B | 22 分 | 补充报道中用于横向比较 | | 同级 2B 模型第二名 | 约 2B | 33.2 分(34 项评测平均分) | 与 MiniCPM5-2B 的 53.9 分对比 |
需要注意的是,AA 综合分、34 项基准平均分和 GDPval-AA v2 的 Elo 分数不是同一套指标,不能简单放在同一条排名轴上比较。23 分是 AA 榜单综合得分,53.9 分是多项任务的平均分,891 分则来自以人类基线 1000 分为锚点的真实工作任务评测。把三者区分开,才能避免“一个模型拿了三个第一”的宣传式误读。
Agentic Index 20 分,领先更值得关注
Agent 是能够围绕目标自主规划并调用外部工具完成多步任务的系统,核心不只是生成一段答案,而是持续执行“计划—行动—观察—修正”循环。
MiniCPM5-2B 在 Agentic Index 上获得 20 分,这一成绩是本次发布最值得关注的指标。根据官方及相关报道,同级模型如 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B 的得分大多为 2 分左右。补充对比中,Granite 4.2 8B 得分为 9 分,Qwen3.5 9B 为 7 分,gpt-oss-20b 为 3 分。
| 模型 | 参数规模 | Agentic Index | 与 MiniCPM5-2B 的关系 | |---|---:|---:|---| | MiniCPM5-2B | 2B | 20 分 | 本次披露的最高成绩 | | Granite 4.2 8B | 8B | 9 分 | 参数约为其 4 倍,但得分不到一半 | | Qwen3.5 9B | 9B | 7 分 | 参数约为其 4.5 倍 | | LFM2.5-2.6B | 2.6B | 约 2 分 | 同尺寸模型,差距明显 | | Granite 4.2 3B | 3B | 约 2 分 | 同尺寸模型,差距明显 | | Mistral 3 3B | 3B | 约 2 分 | 同尺寸模型,差距明显 | | gpt-oss-20b | 20B | 3 分 | 参数约为其 10 倍 |
如果这些榜单结果能够在独立环境中复现,MiniCPM5-2B 的优势并不是传统意义上的“知识量更多”,而是小模型在任务结构化和工具接口使用上的效率更高。一个 2B 模型不需要把所有问题都回答得像云端旗舰模型一样复杂,只要它能准确判断什么时候搜索、调用什么工具、如何读取返回结果,就有机会在具体工作流中发挥作用。
但“具备 Agent 雏形”与“可以独立完成复杂工作”之间仍有距离。Agent 评测通常会受到工具定义、提示词模板、执行环境、失败重试次数和评测集分布影响。20 分说明它在相关测试中显示出明显优势,并不等于它已经能够稳定替代云端模型完成开放世界任务。开发者在实际部署时,仍需要对工具调用格式、异常处理和最大循环次数做严格约束。
891 分接近人类基线,但别把它理解成人类水平
GDPval-AA v2 是面向真实工作任务的评测,使用 Elo 评分,并以人类基线 1000 分作为参照。MiniCPM5-2B 在该评测中获得 891 分,位居 4B 以下模型之首。
补充报道显示,Granite 4.2 8B 得分为 702 分,MiniCPM5-2B 领先近 190 分;同级的 Granite 4.2 3B 和 Ministral 3 3B 分别为 325 分和 286 分。另有报道将其与 Qwen3.5 9B 的 645 分、Gemma 4 12B 的 647 分进行比较。
| 评测对象 | 参数规模 | GDPval-AA v2 得分 | 人类基线差距 | |---|---:|---:|---:| | 人类基线 | — | 1000 分 | 0 分 | | MiniCPM5-2B | 2B | 891 分 | 109 分 | | Granite 4.2 8B | 8B | 702 分 | 298 分 | | Gemma 4 12B | 12B | 647 分 | 353 分 | | Qwen3.5 9B | 9B | 645 分 | 355 分 | | Granite 4.2 3B | 3B | 325 分 | 675 分 | | Ministral 3 3B | 3B | 286 分 | 714 分 |
891 分接近 1000 分,说明模型在评测定义的工作任务中表现不错,但它不是“达到人类水平”的同义词。Elo 分数的实际含义取决于任务类型、评测样本和比较对象。更准确的说法是:在该评测设置下,MiniCPM5-2B 与人类基线的差距小于其他参评小模型,而不是它已经在所有真实工作场景中接近人类。
这组数据仍然给端侧模型提供了一个有价值的信号:当任务被拆解为信息检索、结构化输出、代码修改、工具调用和多轮执行时,参数规模并不是唯一决定因素。训练数据、后训练策略、工具格式和推理时控制同样会影响最终结果。
MiniCPM5-2B 的关键变化:从“会聊天”转向“会做事”
端侧模型过去更常见的定位是离线问答、文本改写、摘要和轻量翻译,而 MiniCPM5-2B 试图把能力边界推向工具调用和多步执行。
它重点覆盖了以下几类 Agent 能力:
- 工具调用:模型能够根据任务选择函数或外部工具,并生成结构化调用参数。
- 深度搜索:模型不只对一次搜索结果做摘要,而是尝试拆分问题、连续检索并整合信息。
- 代码生成与代码推理:包括生成代码、理解代码逻辑,以及在任务流程中利用代码完成计算或处理。
- 长文本处理:在较长上下文中提取约束、保留任务状态,并据此继续执行后续步骤。
- 通用智能体任务:把指令理解、规划、工具调用和结果整理组合到一个工作流中。
这些能力放到云端大模型上并不新鲜,真正的变化是它们被压缩到 2B 参数规模,并尝试在端侧设备上运行。端侧 Agent 是直接运行在手机、PC、车机或其他本地设备上的智能体,优势通常是低延迟、数据不必离开设备,以及在断网或弱网环境下仍能工作。
以手机上的个人信息整理为例,云端 Agent 可能需要把日历、邮件、文件和网页内容上传到服务器,再由大模型统一规划;端侧 Agent 则可以在本地读取经过授权的文件索引,调用系统日历或搜索工具,最后只把用户明确要求的内容输出。这种架构不能解决所有任务,但在隐私和响应速度敏感的场景中更合理。
真正的技术看点在训练配方和数据开放
小模型训练的关键不只是减少参数,而是把有限的参数容量优先用于高价值能力。面壁智能此次同步开放 Meshy、JustRL II、UltraData 系列数据及部分训练 Recipe,说明团队希望把重点从“模型权重竞赛”推进到“训练方法可复现”。
Meshy 是面壁智能与 OpenBMB 开源的强化学习框架,目标是为语言模型的多阶段训练和强化学习提供基础设施。强化学习框架本身不等于模型能力,但它决定了奖励计算、样本生成、并行训练和策略更新等环节能否稳定运行。
JustRL II 是此次配套公开的基于奖励的强化学习策略,面向小语言模型的推理和 Agent 能力训练。它的核心价值在于,模型不再只通过模仿高质量答案学习,而是通过任务结果获得奖励:调用是否成功、答案是否满足约束、工具参数是否正确、最终任务是否完成,都可以成为训练信号。
面向 Agent 的强化学习比普通问答对齐更难,因为一次任务可能包含多个动作。模型第一步选错工具,后面即使语言表达很好,也可能无法完成任务。因此训练过程需要处理长轨迹、稀疏奖励、失败样本和多轮信用分配问题。对 2B 模型而言,这种训练尤其重要:它没有足够大的参数冗余去“靠猜”修正早期错误,只能依赖更精细的数据和奖励设计。
公开资料还提到 UltraX,这是一个函数调用式的数据精炼框架。它使用约 0.6B 参数的轻量模型预测结构化编辑操作,包括保留、删除、替换和插入,再由确定性执行器把操作应用到原始文本上。
这种方法区别于传统的文档级过滤。文档级过滤通常先判断整篇网页是否值得保留,低质量页面直接丢弃;UltraX 更像是在一份混杂了广告、重复段落和有效信息的文档上做“外科手术”,尽量删除噪声而保留局部高价值内容。对于参数规模有限的模型,高质量训练数据往往比盲目扩大数据量更重要。
对开发者意味着什么
MiniCPM5-2B 最适合被看作端侧 Agent 的一个可部署起点,而不是云端旗舰模型的全面替代品。
第一类场景:本地、低延迟、隐私敏感
手机助手、桌面自动化、离线知识库、车载语音和机器人控制,都对响应速度和数据留存有要求。2B 模型的内存占用和计算成本更容易被消费级设备承受,也更适合在本地完成意图识别、任务分发和简单工具调用。
第二类场景:作为云端 Agent 的前置控制器
端侧模型不一定要独立完成全部任务。它可以先在本地判断用户意图、提取敏感信息、执行简单操作,再把确实需要复杂推理的部分交给云端。这样做能够降低云端请求量,也能减少原始数据上传。
第三类场景:特定工作流的垂直 Agent
对于文件重命名、代码片段修改、设备控制、表格填充等边界清晰的任务,小模型往往比开放式聊天更容易达到可用标准。开发者可以通过严格的工具 schema、有限的动作空间和可验证的结果检查,把模型的错误范围控制在系统能承受的范围内。
开源生态方面,公开报道显示 MiniCPM5-2B 已适配 LLaMA-Factory、ms-swift 等微调工具,并支持 vLLM、SGLang、llama.cpp 和 Ollama 等推理框架。不同框架的具体支持状态、量化格式和上下文长度仍应以模型仓库最新说明为准,不能仅凭媒体报道直接推断所有功能都已达到生产可用水平。
仍需验证的三个问题
第一,端侧速度和功耗尚未被充分说明。 2B 参数规模通常意味着更低的部署门槛,但实际体验还取决于量化方案、上下文长度、KV Cache、芯片算力和内存带宽。开发者最关心的不是参数量本身,而是在具体设备上每秒生成多少 token、连续运行多久会降频,以及多轮 Agent 任务的总耗时。
第二,Agent 评测领先能否迁移到开放环境。 榜单中的工具集合和任务边界相对明确,真实世界则充满网页变化、工具异常、权限限制和模糊需求。MiniCPM5-2B 能否在没有精心设计提示词的情况下稳定完成任务,还需要更多第三方复现。
第三,开源是否足够完整。 这次开放了模型、数据、训练框架和部分 Recipe,开放程度高于只发布权重的常见做法。但完整复现实验仍需要训练数据规模、数据许可、硬件配置、超参数、奖励模型细节和训练日志等信息。对于企业开发者来说,商业授权、数据合规和模型输出责任同样重要。
OpenBMB 生态再向端侧推进一步
截至 2026 年 8 月,公开报道显示 MiniCPM 系列模型累计开源下载量已突破 5000 万次,并被用于手机、车载座舱和具身机器人等场景。下载量不能直接证明模型质量,但它至少说明 MiniCPM 已经拥有较大的开发者测试基础。
MiniCPM5-2B 的发布把这个生态进一步推向 Agent 方向:模型不再只追求在聊天和知识问答榜单上击败同尺寸竞品,而是把工具调用、搜索、代码和强化学习放到同一套训练目标中。对于端侧模型而言,这条路线比单纯追求更长上下文或更高知识覆盖更有现实价值,因为设备上的 AI 最终要连接系统能力,替用户完成动作,而不是只生成一段漂亮文字。
我们的判断是,MiniCPM5-2B 目前最值得期待的不是“2B 击败 20B”这一传播口号,而是它证明了一个更具体的方向:在数据治理、工具格式和强化学习都围绕任务完成度设计的情况下,小模型也可以具备可用的 Agent 行为。它距离真正可靠的通用端侧 Agent 还有工程和评测上的距离,但已经足以成为开发者搭建本地智能体原型时值得优先测试的开源模型。
模型、数据与代码已通过以下入口公开:
- Hugging Face:MiniCPM5 系列模型集合,包含 MiniCPM5-2B 及相关资源。
- GitHub:OpenBMB/MiniCPM,提供模型项目和配套说明。
- GitHub:OpenBMB/Meshy,提供自研强化学习框架。
结论
MiniCPM5-2B 是一款 2B 参数的高密度端侧语言基座模型,官方披露其在 AA 榜单 4B 以下开源基座模型中综合得分第一,并在 Agentic Index 上获得 20 分。它的核心价值不在于用更小参数复刻云端大模型,而在于把工具调用、搜索、代码生成和强化学习训练组合起来,探索端侧通用 Agent 的可行路径。
对普通用户而言,它意味着未来手机、PC 和车机上的 AI 可能不再只是离线聊天机器人;对开发者而言,它提供了一个可以本地部署、微调和接入工具链的实验对象。接下来真正决定 MiniCPM5-2B 影响力的,将是第三方跑分、真实设备吞吐、长任务成功率,以及开源社区能否把这个“Agent 雏形”继续打磨成可靠产品。
参考来源
- IT之家:面壁智能开源 MiniCPM5-2B AI 模型 —— 提供发布时间、模型规模、AA 榜单成绩、开源组件及官方项目链接。
- MiniCPM5 Hugging Face 模型集合 —— 模型权重、配置和相关资源的官方发布入口。
- OpenBMB/MiniCPM GitHub 仓库 —— MiniCPM 系列模型代码、文档与部署信息。
- OpenBMB/Meshy GitHub 仓库 —— Meshy 强化学习框架的开源代码与说明。
- 知乎:国产 2B 小模型与端侧 Agent 相关报道 —— 补充 MiniCPM5-2B 的榜单表现、训练方法和端侧 Agent 背景。



