Featured image of post 2B参数 MiniCPM5-2B开源:国产端侧“小钢炮”登顶4B以下模型榜首

2B参数 MiniCPM5-2B开源:国产端侧“小钢炮”登顶4B以下模型榜首

面壁智能联合OpenBMB开源2B参数模型,智能密度超越6倍于它的Gemma 4 12B。

面壁智能开源MiniCPM5-2B:端侧Agent能力新标杆

面壁智能开源MiniCPM5-2B:端侧Agent能力新标杆
面壁智能开源MiniCPM5-2B:端侧Agent能力新标杆|新闻截图

  • 发布时间:2026年9月8日( News reported on this date)
  • 新版本:MiniCPM5-2B,参数规模2B(20亿)
  • 权重开放:是,模型权重、训练配方、强化学习框架与数据集全部开源
  • 可用性:即时可用,已接入主流开发工具链
  • 硬件适配:完成英特尔、瑞芯微、Arm等芯片平台首日原生适配

智能密度惊人:2B模型击败更大参数规模对手

智能密度惊人:2B模型击败更大参数规模对手
智能密度惊人:2B模型击败更大参数规模对手|新闻截图

MiniCPM5-2B由北京端侧大模型企业面壁智能联合OpenBMB开源社区共同发布。该模型虽仅20亿参数,但在权威评测机构Artificial Analysis榜单上以23分位列全球4B以下开源模型第一,甚至超过参数量约为其6倍的谷歌Gemma 4 12B(该模型得分为14分)。

关键反差数据在于:Gemma 4 12B消耗约12.6万个Token(估算自原文精神——其12B参数消耗远高于MiniCPM5-2B的21k Token),智力得分为647分;而MiniCPM5-2B仅用21k Token(1.4k思考+7k答案)即实现891分的真实任务评测得分——更少的推理开销达成更高的任务完成度,凸显其智能密度优势。

在34项基准评测中,MiniCPM5-2B平均得分为53.9分,覆盖代码推理、数学推理、指令遵循、综合知识、长文本处理、工具调用和Agent任务等方向,平均表现优于Qwen3.5-4B等更大参数模型。

智能体指标Agentic Index上,MiniCPM5-2B得分20分,而同级模型均低于10分,初步展现出通用Agent能力雏形。团队称,随端侧Agent能力提升,其在办公与生活场景中的使用成本有望进一步降低。

模型参数规模Artificial Analysis得分Token消耗智力得分(真实任务评测)主要对比维度
MiniCPM5-2B2B2321k (1.4k+7k)891工具调用、深搜、代码生成
Gemma 4 12B12B14≈126k(估算)647更大规模,低智能密度
Granite 4.2 3B3B未提具体分数19k (12k+7k)14思维链长但效率低
LFM2.5-2.6B2.6B未提具体分数21k (14k+7k)11同参数段较低效率

强化学习框架与训练配方同步开放

除主模型外,面壁智能与OpenBMB开源了三大核心组件:

  • Meshy框架:自研强化学习训练框架,取消中央控制器和Ray依赖,支持同步、异步与全异步三种训练模式切换,便于扩展
  • JustRL II:为GRPO算法引入Critic实现词元级信用分配,解决长思维链强化学习中的数据质量与信用分配难题,使MiniCPM5-2B在后训练中获得显著性能提升
  • 完整训练配方:配套数据集(含UltraData系列)、训练策略与框架代码,确保技术路径可复现、可验证

该模型已接入LlamaFactory、ms-swift(微调)、SGLang、vLLM、llama.cpp、Ollama、Hugging Face Transformers(推理部署)及面壁自研Arclight CPU推理框架,开发者可根据设备特性灵活选择。

多平台Day0原生适配

多平台Day0原生适配
多平台Day0原生适配|新闻截图

为加速产业落地,MiniCPM5-2B已完成三大平台Day0适配:

  • 英特尔平台:依托酷睿Ultra系列CPU/GPU/NPU异构资源与OpenVINO工具套件,优化算子、图融合与内存调度,支持AI PC本地部署
  • 瑞芯微平台:兼容RK3588与RK1828双芯平台,通过RKNN3工具链完成量化与算子优化,支持推理与工具调用等完整任务链
  • Arm平台:适配启用SME2技术的Armv9移动设备,预填充与解码性能分别提升约1.7倍与1.2倍,为移动端部署铺平道路

读者落地建议

读者落地建议
读者落地建议|新闻截图

适合立即尝试的用户

  • 嵌入式/边缘设备开发者:模型已在瑞芯微、Arm平台完成优化,适合开发轻量级本地智能体应用
  • 端侧Agent研究者:Agentic Index指标领先,是探索工具调用与长推理链任务的优质基座
  • 技术验证与教学场景:完整训练配方与Meshy框架开源,为强化学习教学与实验提供理想载体

建议再等等的用户

  • 生产环境对推理延迟极度敏感的应用:虽性能提升明显,但具体延迟数据未披露,建议先小规模压测验证
  • 依赖特定国产芯片生态(如华为昇腾、寒武纪)的团队:适配信息未提及,需等待后续支持

写在最后

MiniCPM5-2B的发布标志着端侧大模型从"参数竞赛"转向"智能密度优化"新阶段。当2B模型在多项指标上战胜12B模型,模型压缩与训练方法创新的价值被重新定义——计算效率正成为下一代本地化AI的核心竞争力。