
说实话:我对端侧小模型早就免疫了
这几年端侧小模型的发布会我看了几十场,每次都是同一个剧本:参数漂亮,跑分亮眼,评论区一片欢呼。
你兴冲冲下载下来,问两句天气还行,问到第三步就开始胡说八道。多轮对话一崩,工具调用一崩,长文档直接失忆。这玩意儿跑是能跑,就是没用。
所以 2026 年 9 月 8 日面壁智能联合 OpenBMB 开源社区放出 MiniCPM5-2B 的时候,我第一反应也是划走。2B 参数,能掀起什么浪。
结果呢,Artificial Analysis 的 Agentic Index 那一栏,MiniCPM5-2B 拿了 20 分。同尺寸的 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B,清一色 2 分。
十倍。不是小数点后两位的领先,是两代产品之间的断层。我盯着那张表看了很久,脑子里只有一句话:2B 的小模型,第一次长出了 Agent 的骨头。
数字不会撒谎:23 分对 2 分,这是两代产品的断层
先把三组最关键的数字摆出来,你再决定要不要继续往下读。
- 榜单排名:Intelligence Index 23 分,全球 4B 参数以下开源基座模型第一。34 项基准平均 53.9 分,2B 级第二名只有 33.2 分,连 4B 级最佳的 Qwen3.5-4B(51.1)都被它压在身后。
- Agent 能力:Agentic Index 20 分,同尺寸对手全是 2 分。真实任务评测它拿 891 分(人类基线 1000),参数量约为它 6 倍的谷歌 Gemma 4 12B 只有 647 分。
- Token 效率:拿 23 分只烧 21k token(14k 思考加 7k 答案)。Granite 4.2 3B 烧掉约 19k 只有 14 分,LFM2.5-2.6B 烧掉 21k 只有 11 分。
分项也很能打。代码上 LiveCodeBench v6 拿到 69.1(Qwen3.5-4B 是 56.4),SWE-bench Verified 46.4(Qwen3.5-4B 33.6)。数学上 AIME 2025 和 2026 都是 86.5,MATH-500 是 94.6。工具调用 τ²-Bench Telecom 97.1,BFCL v4 66.6,τ³-Bench Banking 20.8 与 Ling 3.0 Tiny 并列第一。长上下文 NoLiMa 68.1,LongBench v2 43.7,AA-LCR 59.0。
看到 2B 打 4B,第一反应多半是”又来刷分了”。你把约束条件摆出来,逻辑就变了:手机、车机、树莓派这些地方,显存和功耗是死门槛,参数想堆也堆不上去。这条路上唯一能卷的,就是每个参数到底挤出多少智能。
换个说法你就懂了。同样烧掉两万多个 token,Granite 4.2 3B 拿 14 分,LFM2.5-2.6B 拿 11 分,它拿 23 分。端侧的胜负手不是谁更会想,是谁想得更值。2B 的体量,智能密度压过 Qwen3.5 9B,也压过参数量约为它 6 倍的谷歌 Gemma 4 12B。
如果你看过我们之前写的 Qwen3.8-Flash-Next 这篇小模型文章,会发现小模型硬刚大模型的那条曲线,现在又陡了一截。
说白了:它到底能替你干哪些活
它是 dense Llama 架构,42 层,总参数约 2.52B,非 embedding 约 1.98B(所以 Hugging Face 上可能显示成 3B,其实是同一个 checkpoint)。原生上下文 131,072 tokens,标准 Llama 架构,不需要任何自定义算子。Apache 2.0 许可证,可以商用。
这几个条件凑在一起,指向一件很具体的事:你手里那台笔记本,终于能跑一个会自己拆任务、自己调工具、自己收尾的 Agent,而不是一个只会接话的聊天框。
它能干什么?本地函数、本地数据库、本地文件系统,它可以直接调,不用绕到别人的服务器。深度搜索这类多步任务,它能基于本地检索跑完整条链路。代码生成更不用提,修个 bug、补个测试、写个小脚本是真能用的。Agent 任务上 GDPval-AA v2 拿到 19.6,Claw-Gym 59.2,BrowseComp-ZH 43.5。
我最在意的还是数据不出本机这件事。公司内网资料、病历、合同草案,这些东西你本来就不该往云端传。想在本地把数据彻底锁死,可以看看我们写过的 Ollama 本地部署,思路是相通的。
但天花板也得认。别指望它替你做完一整个季度的战略分析,那是脑子发热。

动手吧:几条命令把它装进你的笔记本
先下载,三条命令对应三种用途,别下错了。
modelscope download –model OpenBMB/MiniCPM5-2B
# GGUF,给 llama.cpp / Ollama / LM Studio 用
modelscope download –model OpenBMB/MiniCPM5-2B-gguf
# MLX,Apple Silicon 专用
modelscope download –model OpenBMB/MiniCPM5-2B-MLX
想省事就两条 Ollama 命令,拉下来直接开聊:
ollama run openbmb/minicpm5-2b
想要 128K 上下文对齐加全量卸载,用 llama.cpp 起服务:
想要 OpenAI 兼容接口,上 vLLM:
走 Transformers 的话先把依赖升上去,官方推荐采样参数 temperature=1.0、top_p=0.95,并且支持 enable_thinking=True:
体积和门槛说清楚:GGUF 的 Q4_K_M 约 1.56GB,Q8_0 约 2.68GB,F16 约 5.04GB。显存大约 4 到 8GB 就能跑,把 131K 上下文开满最多也就 8GB 左右。
芯片适配是 Day0 首日就给的:Intel 酷睿 Ultra 系列走 CPU+GPU+NPU 异构加 OpenVINO;瑞芯微 RK3588+RK1828 双芯走 RKNN3 工具链;Arm SME2(Armv9 移动设备)官方给的提升是 prefill 约 1.7 倍、decode 约 1.2 倍。

光会调工具不算 Agent:链路得这么串
很多人以为给模型挂几个函数就叫 Agent,那是想多了。真正的完整链路是五件事:判断该不该调、调哪一个、参数对不对、结果回来之后要不要继续调、什么时候收尾。
MiniCPM5-2B 这一块是专门训过的。官方开源的 UltraData-SFT-Agent-2609 有约 50 万条样本,覆盖工具调用、网页搜索、代码生成、Office 文档、数据库交互;UltraData-RL-2609 有 8 万多条。不是拿通用语料硬凑出来的能力。
部署上有个点先说死:用 SGLang 起服务,工具调用必须带 parser,不然根本解析不出来。
如果你还没理清 Agent 那套循环到底怎么搭,建议先补一下我们的 AI Agent 全景解读,回头再看这段代码会顺畅很多。
别急着上生产:五个坑我先替你踩了
坑 1:常识广度不够。MMLU-Pro 只有 70.8,Qwen3.5-4B 是 78.0。现象是遇到偏门学科就卡壳,根因是 2B 的容量就摆在那,广度换不来。解法是给它配检索,别让它裸考。
坑 2:超难题直接崩。HLE 只有 8.9 分。这本来就是给顶级大模型准备的卷子,现象是答非所问还特别自信,根因是推理深度不够。解法很简单,别拿它当高难度推理的主模型。
坑 3:指令遵循不是强项。IFEval 86.7,低于 LFM2.5-2.6B 的 93.4。现象是格式要求一复杂就飘,根因是复杂约束的对齐训练不足。解法是把格式约束写死进 prompt,能上 JSON Schema 就上。
坑 4:没有多模态。它只支持纯文本输入输出,图片音频都进不去。现象是你丢张图它装死,根因是模型定位如此。解法是要图就换 MiniCPM-V,别硬掰。
坑 5:量化会改变性格。BF16 的成绩不能直接套到 Q4 上。现象是量化后指令遵循、代码准确率、工具调用语法全变了,根因是低比特压缩对结构化输出最不友好。解法是拿你自己的场景跑一遍自己的小评测,别照抄榜单。
还有一条隐性的:2B 模型在冷门事实上,比大模型更容易一本正经地胡说。关键业务一定加校验。
说点真心话:小模型这次长对了骨头
这行干了几年,我见过太多”跑起来了”的狂欢,最后都死在同一个问题上:能干什么。
MiniCPM5-2B 让我改观的地方,不是它又刷了多少分,而是它把力气花对了地方。不是把参数堆大,而是让每一亿参数都更值钱。官方把这套方法也全开源了:RL 框架 Meshy 去掉了中央控制器和 Ray 依赖,把训练、推理、奖励计算建模成对等服务,用 TransferQueue 的数据就绪状态驱动控制流,同步、异步、全异步三种模式随便切;策略 JustRL II 在数据侧做了三阶段流水线筛选校准,算法侧给 GRPO 加 Critic 实现词元级信用分配;数据集 UltraX 约 100B 词元、1.14 亿条样本,UltraData-Code 分 L0 到 L3 级,L2 算法代码精筛约 400B 词元,L3 任务导向合成约 150B 词元。
顺带一句,MiniCPM 系列累计下载量到 2026 年 8 月已经突破 5000 万次。这个盘子,不小了。
工具链也是齐的:训练微调支持 LlamaFactory、ms-swift,推理部署支持 SGLang、vLLM、llama.cpp、Ollama、Transformers,还兼容自研的 Arclight CPU 推理框架。
端侧 AI 的胜负手,从来不是能不能跑,而是跑起来之后有没有用。
这一次,有用了。
关注圈圈,持续带你玩转 AI 工具。
暂无评论内容