
第一章 2.78 万亿参数的模型,在一台笔记本上”跑”起来了
先说个听起来像吹牛的事:一个 2.78 万亿参数的大模型——月之暗面的 Kimi K3——整套完整权重,跑在了一台只有 64GB 内存的 MacBook Pro 上。
不是蒸馏版,不是剪枝版,是原模原样的 896 专家版 Kimi K3,参数一个没少。
做到这点的,是 SQLiteAI 团队刚开源的推理引擎 WASTE。它 7 月 30 号发布,直接把”顶级模型必须上集群”的迷信砸了个稀碎。
当然,代价是速度——约 0.5 token/s,被网友戏称为”电子盆栽”。但重点从来不是快,是它能跑。今天咱就拆开看它到底怎么做到的,以及普通人能不能用。
第二章 WASTE 的核心魔法:专家不用的,就别占内存
要懂 WASTE,先得懂 Kimi K3 是啥结构。它是 MoE(混合专家)模型:896 个专家,但每个 token 经过时,只激活其中 16 个。翻译成人话——任意时刻,只有约 4% 的权重在干活,剩下 96% 全是闲着的。
传统做法:不管用不用,全塞进内存。982GB 的模型,内存根本装不下,只能上服务器。
WASTE 的脑洞:闲着的权重不需要在内存里,只需要”能及时读到”就行。
于是它把模型的”主干”留在内存,把 896 个专家权重常驻在 NVMe 固态硬盘上,哪个专家被调用,才从硬盘流式读进来。这叫 expert streaming(专家流式加载)。瓶颈从”内存大小”转移到了”硬盘读写速度”。
第三章 硬盘带宽,才是新的天花板
这步很关键,直接决定你能不能跑得动。每个 token 要从硬盘读约 17GB 的专家数据。
开发者实测:
笔记本内置 SSD:12.78 GB/s
USB 外接硬盘:只有 0.94 GB/s(差距来自 USB 接口,不是硬盘本身)
看到没?同样的活,外接硬盘比内置慢了 13 倍。所以 WASTE 明确要求:模型必须放内置 NVMe 硬盘,别想着塞个移动硬盘凑合。
内存调优也有讲究:引擎默认留 46GB 预算(64GB 机器上),因为分太多会逼系统开内存压缩和分页,反而更慢。连 GPU 的 Metal 后端都因为比 CPU 慢 22% 而默认关掉了。每一个数字,都是实测踩出来的。
第四章 上手跑起来:命令就一行
WASTE 是个纯 C 写的嵌入式推理引擎,零第三方依赖,已支持 macOS、Linux、Windows。去 GitHub 搜 sqliteai/waste 拉下来。
准备好转换好的模型容器(Kimi K3 转换后约 982 GiB),一条命令开跑:
waste run ~/models/k3.waste '你的问题'
不指定预算的话,它会自动用约 45GB 内存、留 17GB 左右当专家缓存。实测问”意大利首都是哪”,约 27 个 token、24 秒出结果,速度 0.6 token/s 上下。
⚠️ 实话实说:这个速度没法拿来聊天、更别提跑 Agent。它现在证明的是”能加载、能答对”,不是”能日用”。别指望拿它当日常助手。

第五章 慢归慢,但它”答得对”
流式读取听着玄乎,但 WASTE 把正确性焊死了:每一层都拿 PyTorch 参考实现校验过。
最终输出的 logits 跟参考模型误差只有 3.6e-06,视觉塔的误差 3.3e-06。换句话说,它慢,但没变傻。模型的智能和准确性,在流式过程中完整保住了。
对比一下同门师弟 Kimi-Linear(480 亿参数):它只要 19GB 容器,在同硬件上能跑 8.9~11.7 token/s,比 K3 快近 28 倍。差距不是”万亿参数”这个噱头,而是从硬盘流式读权重的代价。
所以结论很清楚:WASTE 不是让你拿 K3 当主力,而是证明”万亿模型本地可加载”这扇门,被推开了一条缝。
第六章 它真正的价值:隐私 + 成本 + 工程红线
既然这么慢,图啥?三个字:不出云。
① 隐私:不用付 API 账单,不用联网,敏感数据全程本地算。对医疗、法务、金融这类碰不得外传数据的场景,这是刚需。
② 成本:万亿模型不再等于 H100 集群。你手里现有的消费级设备,就能”够得着”前沿大模型。
③ 工程意义:它把行业思路从”堆内存”扭向”盘感知(disk-aware)”。未来可能出现一整类”流式推理引擎”——最大化利用现有硬件的 I/O,而不是无脑加内存条。
这条工程可行性红线,是 WASTE 划下的。哪怕它自己还不够快,后来者有了明确的方向。

第七章 普通人现在该关注吗?我的判断
直接说结论:想日用,现在别碰 K3 这条路径。0.5 token/s 你试一次就知道了,是真·电子盆栽。
但下面这几类人,我建议现在就把 WASTE 加进收藏:
① 做端侧 / 隐私推理的团队:它是”大模型本地化”最硬核的可行性证据;
② 硬件 / 系统工程师:expert streaming 这套”以空间换可行性”的思路,值得深读源码;
③ 好奇党:想亲手在笔记本上”召唤”一个万亿模型,就为那一声”它真的答对了”——这体验,独一份。
一句话总结:WASTE 今天慢得像盆栽,但它证明的事——顶级模型不一定非得关在机房里——会比它快不快,重要得多。本地大模型时代的第一道门,被它撬开了。
暂无评论内容