端侧小模型早让我失望透顶,直到 MiniCPM5-2B 把 Agent 拉到 20 分:同尺寸全是 2 分

端侧小模型早让我失望透顶,直到 MiniCPM5-2B 把 Agent 拉到 20 分:同尺寸全是 2 分 封面

说实话:我对端侧小模型早就免疫了

这几年端侧小模型的发布会我看了几十场,每次都是同一个剧本:参数漂亮,跑分亮眼,评论区一片欢呼。

你兴冲冲下载下来,问两句天气还行,问到第三步就开始胡说八道。多轮对话一崩,工具调用一崩,长文档直接失忆。这玩意儿跑是能跑,就是没用。

所以 2026 年 9 月 8 日面壁智能联合 OpenBMB 开源社区放出 MiniCPM5-2B 的时候,我第一反应也是划走。2B 参数,能掀起什么浪。

结果呢,Artificial Analysis 的 Agentic Index 那一栏,MiniCPM5-2B 拿了 20 分。同尺寸的 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B,清一色 2 分。

十倍。不是小数点后两位的领先,是两代产品之间的断层。我盯着那张表看了很久,脑子里只有一句话:2B 的小模型,第一次长出了 Agent 的骨头。

数字不会撒谎:23 分对 2 分,这是两代产品的断层

先把三组最关键的数字摆出来,你再决定要不要继续往下读。

  • 榜单排名:Intelligence Index 23 分,全球 4B 参数以下开源基座模型第一。34 项基准平均 53.9 分,2B 级第二名只有 33.2 分,连 4B 级最佳的 Qwen3.5-4B(51.1)都被它压在身后。
  • Agent 能力:Agentic Index 20 分,同尺寸对手全是 2 分。真实任务评测它拿 891 分(人类基线 1000),参数量约为它 6 倍的谷歌 Gemma 4 12B 只有 647 分。
  • Token 效率:拿 23 分只烧 21k token(14k 思考加 7k 答案)。Granite 4.2 3B 烧掉约 19k 只有 14 分,LFM2.5-2.6B 烧掉 21k 只有 11 分。

分项也很能打。代码上 LiveCodeBench v6 拿到 69.1(Qwen3.5-4B 是 56.4),SWE-bench Verified 46.4(Qwen3.5-4B 33.6)。数学上 AIME 2025 和 2026 都是 86.5,MATH-500 是 94.6。工具调用 τ²-Bench Telecom 97.1,BFCL v4 66.6,τ³-Bench Banking 20.8 与 Ling 3.0 Tiny 并列第一。长上下文 NoLiMa 68.1,LongBench v2 43.7,AA-LCR 59.0。

看到 2B 打 4B,第一反应多半是”又来刷分了”。你把约束条件摆出来,逻辑就变了:手机、车机、树莓派这些地方,显存和功耗是死门槛,参数想堆也堆不上去。这条路上唯一能卷的,就是每个参数到底挤出多少智能。

换个说法你就懂了。同样烧掉两万多个 token,Granite 4.2 3B 拿 14 分,LFM2.5-2.6B 拿 11 分,它拿 23 分。端侧的胜负手不是谁更会想,是谁想得更值。2B 的体量,智能密度压过 Qwen3.5 9B,也压过参数量约为它 6 倍的谷歌 Gemma 4 12B。

如果你看过我们之前写的 Qwen3.8-Flash-Next 这篇小模型文章,会发现小模型硬刚大模型的那条曲线,现在又陡了一截。

说白了:它到底能替你干哪些活

它是 dense Llama 架构,42 层,总参数约 2.52B,非 embedding 约 1.98B(所以 Hugging Face 上可能显示成 3B,其实是同一个 checkpoint)。原生上下文 131,072 tokens,标准 Llama 架构,不需要任何自定义算子。Apache 2.0 许可证,可以商用。

这几个条件凑在一起,指向一件很具体的事:你手里那台笔记本,终于能跑一个会自己拆任务、自己调工具、自己收尾的 Agent,而不是一个只会接话的聊天框。

它能干什么?本地函数、本地数据库、本地文件系统,它可以直接调,不用绕到别人的服务器。深度搜索这类多步任务,它能基于本地检索跑完整条链路。代码生成更不用提,修个 bug、补个测试、写个小脚本是真能用的。Agent 任务上 GDPval-AA v2 拿到 19.6,Claw-Gym 59.2,BrowseComp-ZH 43.5。

我最在意的还是数据不出本机这件事。公司内网资料、病历、合同草案,这些东西你本来就不该往云端传。想在本地把数据彻底锁死,可以看看我们写过的 Ollama 本地部署,思路是相通的。

但天花板也得认。别指望它替你做完一整个季度的战略分析,那是脑子发热。

一套权重跑在笔记本、手机、车机和边缘盒子上
一套权重跑在笔记本、手机、车机和边缘盒子上

动手吧:几条命令把它装进你的笔记本

先下载,三条命令对应三种用途,别下错了。

# BF16,给 Transformers / vLLM / SGLang 用
modelscope download –model OpenBMB/MiniCPM5-2B

# GGUF,给 llama.cpp / Ollama / LM Studio 用
modelscope download –model OpenBMB/MiniCPM5-2B-gguf

# MLX,Apple Silicon 专用
modelscope download –model OpenBMB/MiniCPM5-2B-MLX

想省事就两条 Ollama 命令,拉下来直接开聊:

ollama pull openbmb/minicpm5-2b
ollama run openbmb/minicpm5-2b

想要 128K 上下文对齐加全量卸载,用 llama.cpp 起服务:

./llama-server -m MiniCPM5-2B-Q4_K_M.gguf -c 131072 -ngl 99

想要 OpenAI 兼容接口,上 vLLM:

vllm serve openbmb/MiniCPM5-2B –port 8000 –max-model-len 131072

走 Transformers 的话先把依赖升上去,官方推荐采样参数 temperature=1.0、top_p=0.95,并且支持 enable_thinking=True:

pip install -U “transformers>=5.6” accelerate torch

体积和门槛说清楚:GGUF 的 Q4_K_M 约 1.56GB,Q8_0 约 2.68GB,F16 约 5.04GB。显存大约 4 到 8GB 就能跑,把 131K 上下文开满最多也就 8GB 左右。

芯片适配是 Day0 首日就给的:Intel 酷睿 Ultra 系列走 CPU+GPU+NPU 异构加 OpenVINO;瑞芯微 RK3588+RK1828 双芯走 RKNN3 工具链;Arm SME2(Armv9 移动设备)官方给的提升是 prefill 约 1.7 倍、decode 约 1.2 倍。

工具调用闭环:感知、决策、调用、执行、回流,全程不出本机
工具调用闭环:感知、决策、调用、执行、回流,全程不出本机

光会调工具不算 Agent:链路得这么串

很多人以为给模型挂几个函数就叫 Agent,那是想多了。真正的完整链路是五件事:判断该不该调、调哪一个、参数对不对、结果回来之后要不要继续调、什么时候收尾。

MiniCPM5-2B 这一块是专门训过的。官方开源的 UltraData-SFT-Agent-2609 有约 50 万条样本,覆盖工具调用、网页搜索、代码生成、Office 文档、数据库交互;UltraData-RL-2609 有 8 万多条。不是拿通用语料硬凑出来的能力。

部署上有个点先说死:用 SGLang 起服务,工具调用必须带 parser,不然根本解析不出来。

python -m sglang.launch_server –model openbmb/MiniCPM5-2B –tool-call-parser minicpm5

如果你还没理清 Agent 那套循环到底怎么搭,建议先补一下我们的 AI Agent 全景解读,回头再看这段代码会顺畅很多。

给你一组最直接的判断:如果你只是想找个本地聊天搭子,别用它,随便一个 7B 都更舒服;如果你要在本地跑工具调用、做多步任务编排,现在就可以试,这个尺寸里没有对手;如果你要在生产环境吃广博常识,先看完下面这章再决定。

别急着上生产:五个坑我先替你踩了

坑 1:常识广度不够。MMLU-Pro 只有 70.8,Qwen3.5-4B 是 78.0。现象是遇到偏门学科就卡壳,根因是 2B 的容量就摆在那,广度换不来。解法是给它配检索,别让它裸考。

坑 2:超难题直接崩。HLE 只有 8.9 分。这本来就是给顶级大模型准备的卷子,现象是答非所问还特别自信,根因是推理深度不够。解法很简单,别拿它当高难度推理的主模型。

坑 3:指令遵循不是强项。IFEval 86.7,低于 LFM2.5-2.6B 的 93.4。现象是格式要求一复杂就飘,根因是复杂约束的对齐训练不足。解法是把格式约束写死进 prompt,能上 JSON Schema 就上。

坑 4:没有多模态。它只支持纯文本输入输出,图片音频都进不去。现象是你丢张图它装死,根因是模型定位如此。解法是要图就换 MiniCPM-V,别硬掰。

坑 5:量化会改变性格。BF16 的成绩不能直接套到 Q4 上。现象是量化后指令遵循、代码准确率、工具调用语法全变了,根因是低比特压缩对结构化输出最不友好。解法是拿你自己的场景跑一遍自己的小评测,别照抄榜单。

还有一条隐性的:2B 模型在冷门事实上,比大模型更容易一本正经地胡说。关键业务一定加校验。

说点真心话:小模型这次长对了骨头

这行干了几年,我见过太多”跑起来了”的狂欢,最后都死在同一个问题上:能干什么。

MiniCPM5-2B 让我改观的地方,不是它又刷了多少分,而是它把力气花对了地方。不是把参数堆大,而是让每一亿参数都更值钱。官方把这套方法也全开源了:RL 框架 Meshy 去掉了中央控制器和 Ray 依赖,把训练、推理、奖励计算建模成对等服务,用 TransferQueue 的数据就绪状态驱动控制流,同步、异步、全异步三种模式随便切;策略 JustRL II 在数据侧做了三阶段流水线筛选校准,算法侧给 GRPO 加 Critic 实现词元级信用分配;数据集 UltraX 约 100B 词元、1.14 亿条样本,UltraData-Code 分 L0 到 L3 级,L2 算法代码精筛约 400B 词元,L3 任务导向合成约 150B 词元。

顺带一句,MiniCPM 系列累计下载量到 2026 年 8 月已经突破 5000 万次。这个盘子,不小了。

工具链也是齐的:训练微调支持 LlamaFactory、ms-swift,推理部署支持 SGLang、vLLM、llama.cpp、Ollama、Transformers,还兼容自研的 Arclight CPU 推理框架。

端侧 AI 的胜负手,从来不是能不能跑,而是跑起来之后有没有用。

这一次,有用了。

关注圈圈,持续带你玩转 AI 工具。

© 版权声明
THE END
喜欢就支持一下吧
点赞129 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容