模型与研究 · 深度报道

MiniCPM5-2B开源:将工具调用与多步推理带到边缘设备

OpenBMB 与 ModelBest 在9月7-8日前后公开了 MiniCPM5-2B,一款约25.2亿参数、面向边缘设备的稠密语言模型,重点支持本地部署、工具调用和多步推理。该项目同时开源训练数据与训练链路,并通过独立评测显示在智能体任务上具备优势,但在知识、编码和长上下文等任务上仍有短板。

AIFluxNews AIFlux 编辑2026 年 9 月 10 日阅读约 5 分钟
MiniCPM5-2B开源:将工具调用与多步推理带到边缘设备

OpenBMB 与 ModelBest 在9月7-8日前后公开了 MiniCPM5-2B,一款约25.2亿参数、面向边缘设备的稠密语言模型,重点支持本地部署、工具调用和多步推理。该项目同时开源训练数据与训练链路,并通过独立评测显示在智能体任务上具备优势,但在知识、编码和长上下文等任务上仍有短板。

OpenBMB 与 ModelBest 在9月7日至8日前后公开 MiniCPM5-2B。这是一款约25.2亿参数的稠密语言模型,面向个人电脑、手机、机器人和物联网设备等资源受限环境,重点支持本地部署、工具调用、代码生成和多步推理。

从项目公开资料看,MiniCPM5-2B的重点并不只是把模型做小,而是试图在较低的内存和算力需求下,保留一部分面向智能体工作流的能力。官方仓库将它描述为 MiniCPM5 系列的第二个模型,前身是今年5月发布的 MiniCPM5-1B。

不过,模型发布方对“智能体能力”和“全栈开放”的表述,仍需要与独立评测及具体部署条件区分开来。现有数据显示,它在部分智能体任务和小模型比较中表现突出,但在知识、编码和长上下文任务上并非全面领先。

一个面向本地部署的2B级稠密模型

根据 OpenBMB 的官方 GitHub 仓库,MiniCPM5-2B采用标准 LlamaForCausalLM 架构,共有25.1675648亿个参数,其中非嵌入参数约19.82亿。模型包含42层,使用分组查询注意力,并支持最多131072个 token 的上下文窗口。

官方仓库同时提供 BF16、GGUF、MLX、GPTQ 和 DSpark 等版本或配套资源,并给出了 Transformers、vLLM、SGLang、llama.cpp、Ollama、LM Studio 和 MLX 等部署路径。这意味着开发者可以根据硬件条件选择服务器推理、CPU/GPU本地运行或 Apple Silicon 部署,而不必依赖单一推理框架。

在工具调用方面,项目文档建议使用 SGLang。模型生成 XML 风格的工具调用,SGLang 的 MiniCPM5 解析器则可将其转换为兼容 OpenAI 接口的 tool calls。官方还公布了面向本地助手、编程代理和工具使用工作流的部署说明。

DSpark则承担了另一项任务。项目方为 MiniCPM5-2B发布了一个草稿模型,并可在 SGLang 中启用推测解码,以尝试提高生成速度。官方文档强调,这一方式的目标是在保持目标模型输出不变的前提下加速解码;实际收益仍取决于硬件、推理引擎和任务类型。

“开放”不仅包括模型权重

MiniCPM5-2B的发布范围还包括训练数据和训练方法。官方仓库列出的 UltraData 家族包含用于网页预训练的 UltraX、分层代码数据集 UltraData-Code、包含约50万条智能体训练样本的 UltraData-SFT-Agent-2609,以及覆盖数学、代码、常识和长上下文推理的8万多条强化学习样本 UltraData-RL-2609。

训练流程被划分为基础训练、中期训练和后训练三个阶段。后训练又包括监督微调、强化学习和 On-Policy Distillation(OPD)。项目方表示,强化学习阶段训练了面向数学、代码、智能体任务和写作等领域的专门教师模型,再通过 OPD 将多个教师模型的能力蒸馏回一个发布版本。

官方称,OPD整合了16个强化学习专家模型,其中包括5个面向智能体任务的模型;在其列出的基准中,强化学习与OPD使推理和通用能力平均提高10.96分,智能体能力提高6.96分。这些数字来自项目方披露的训练和评测结果,尚不等同于跨机构独立复现的结论。

模型及相关代码以 Apache 2.0 许可证发布。需要注意的是,许可证开放、权重可下载与完整训练链条是否能够被外部团队复现,是三个不同问题。公开数据和训练配方扩大了可检查范围,但真实复现仍需要相应的计算资源、数据处理流程和工程实现。

独立评测显示:智能体任务是优势,但并非全面领先

Artificial Analysis 的独立评测于9月7日发布了对 MiniCPM5-2B的分析。该机构称,模型在 Intelligence Index v4.2 中得分15,在其评估的4B参数以下开放权重模型中排名最高;其 GDPval-AA v2 Elo为831。

Artificial Analysis还指出,MiniCPM5-2B在 GDPval-AA v2 中领先于同一比较组中的部分小模型,在 τ³-Banking 测试中与 Ling 3.0 Tiny 并列第一,得分为21%。在 AA-Briefcase 这项智能体知识工作评测中,它以438的 Elo 排名第二,仅次于 Ling 3.0 Tiny的485。

这些结果解释了为什么项目方将工具使用和智能体任务作为模型的主要卖点。对于边缘设备而言,模型是否能够处理多个步骤、调用外部工具并完成相对结构化的任务,可能比单纯的聊天能力更接近实际应用价值。

但同一份评测也显示了模型的限制。MiniCPM5-2B在 Humanity’s Last Exam 中得分9%,在 Terminal-Bench v2.1 中得分9%,在 CritPt 中得分为0%;在 AA-LCR v1.1 长上下文评测中得分59%,位列比较组中游。Artificial Analysis因此认为,模型在知识、编码和长上下文任务上存在明显短板。

该机构还特别提醒,MiniCPM5-2B在 Intelligence Index v4.1.1中的得分为23,而 v4.2中的得分为15。由于两个版本使用了不同的评测组合和权重,这两个分数不能直接比较。对于任何小模型排行榜,都需要先确认评测版本、输入设置和是否存在模型方自选基准,不能把单一分数理解为普遍能力结论。

AIFlux此前关于 BenchMIRT 的报道也指出,模型基准分数往往混合了推理、知识、任务执行和安全等多种能力。MiniCPM5-2B的案例说明,所谓“同尺寸模型中的领先”必须放回具体测试和部署目标中解释。

边缘设备的价值取决于完整工作流

MiniCPM5-2B的发布,反映出小模型竞争正在从参数规模转向“单位资源能完成什么任务”。一个2B级模型如果可以在本地完成代码辅助、工具调用和多步任务,就可能减少对云端 API 的依赖,也有助于在隐私、延迟或网络连接受限的环境中运行。

但本地部署并不意味着部署成本消失。用户仍需要处理模型量化、内存占用、推理速度、上下文管理、工具权限和日志安全等问题。对于机器人和物联网设备,还要考虑功耗、散热、设备寿命以及模型更新方式。模型本身能够被下载,只是整个工作流落地的起点。

这一趋势也与本地推理基础设施的发展相互呼应。英伟达发布的 PAIR试图把多台个人电脑连接起来,为本地智能体提供推理调度能力。MiniCPM5-2B则从模型一侧降低了运行门槛。两者共同指向一种更分散的 AI 架构:模型、推理引擎和工具可以在用户自己的设备上组合起来。

在实际使用中,MiniCPM5-2B是否优于更大的云端模型,将取决于任务类型。如果应用需要低延迟、离线运行、数据不出设备,或者需要在多种低功耗硬件上部署,那么参数规模和本地可运行性可能具有较高价值;如果任务集中在复杂代码、专业知识或长文档推理,独立评测暴露出的短板则需要被纳入选型考量。

发布日期存在表述差异

公开时间线目前并不完全一致。OpenBMB仓库的更新日志将 MiniCPM5-2B标为2026年9月7日发布,仓库页面显示与该模型相关的提交在9月8日前后更新;ModelBest通过 PR Newswire 发布的新闻稿则标注为9月8日,同时在正文中提到9月9日。

因此,更稳妥的说法是:MiniCPM5-2B在9月7日至8日前后公开,9月8日前后完成主要仓库和部署资料更新。PR Newswire的新闻稿属于发布方材料,其中关于“降低成本”“全栈开放”和边缘设备能力的表述,应与官方仓库的可验证内容及独立评测结果分开理解。

眼下,MiniCPM5-2B最清晰的定位不是一个在所有任务上取代大模型的通用系统,而是一个将工具调用、推理和本地部署结合起来的2B级开放权重模型。它能否真正成为手机、机器人和物联网设备上的实用基础模型,还要看不同硬件上的速度、功耗、稳定性和长期维护成本,以及更多独立团队对其公开结果的复现。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。