
第一章 先说结论:2.8 万亿参数的开源核弹
2026 年 8 月,AI 圈最炸的不是新手机,是一个开源模型:Kimi K3。月之暗面 7 月 27 号把完整权重开源,上线 48 小时请求量直接打满集群,逼得官方暂停了 C 端会员订阅。这是全球第一个 3 万亿级参数的开源模型落地。
数字有多离谱?总参数 2.8 万亿,采用 Stable Latent MoE 稀疏混合专家架构,896 个专家、每次只激活 16 个。听起来吓人,但因为是稀疏激活,单次推理成本反而比同规模稠密模型低得多。
更关键的是性能。前端代码 Arena Elo 拿到 1679 分,超过了 Claude Fable 5 的 1631 和 GPT-5.6 Sol 的 1618,登顶全球第一。SWE Marathon、BrowseComp、ProgramBench 多个榜单它都是第一。这不是”又多了一个模型”,这是国产开源模型第一次在全球范围内把闭源旗舰拉下马。
第二章 它凭什么:MoE + 百万上下文 + 视觉闭环
K3 敢开 100 万 token 上下文(1,048,576),靠的是 KDA 混合线性注意力(Kimi Delta Attention)。传统 Transformer 注意力复杂度随序列长度平方增长,100 万上下文直接爆显存。KDA 用混合线性注意力把长序列成本压下来,再靠注意力残差让梯度传播更稳,训练 2.8T 参数的模型不至于崩。
视觉方面,它内置 MoonViT-V2 视觉编码器,原生支持看图,不用来回走 OCR 管线。这带来一个很爽的能力叫”视觉闭环”:它看运行截图 → 定位 bug → 改代码 → 再看新截图验证。游戏开发、前端设计、CAD 场景实测特别顺手。
还有个让人头皮发麻的 demo:有开发者用 K3 单文件手搓了一个”星系碰撞”N-body 模拟。没有任何第三方引擎,只用一个 HTML 文件,同时渲染 6000 多个粒子、两个相互旋转的旋涡星系,碰撞时还拉出真实的潮汐尾结构——背后跑的是真引力演算,不是贴图动画。
第三章 最快上手:换一个 Base URL 就行
K3 提供 OpenAI 兼容接口,所有支持自定义 Base URL 的工具都能零代码改动直接接入。这一步是它对新手最友好的地方。
标准用法,Python 加 OpenAI SDK:把 base_url 指到 https://api.moonshot.ai/v1(或 https://api.kimi.com/v1),模型名填 kimi-k3,其余代码一字不动。如果你之前用过 GPT,这里几乎没有新东西要学。
更爽的是工具链。Cursor、Trae、Chatbox、Cherry Studio、Open WebUI、Continue——只要在设置里把 OpenAI Base URL 改成上面那个地址,模型名选 kimi-k3,立刻就能用。注意别在 URL 后面多带 /chat/completions,只填到 /v1,工具会自动补全,填错会报 404。
价格也良心:输入每百万 token 3 美元,缓存命中只要 0.30 美元,输出 15 美元。编码场景缓存命中率能到 90% 以上,实际成本只有标价的零头。

第四章 核心实操:把整个代码库一次性喂进去
百万上下文最实用的玩法,不是显摆长度,是真能把整个项目塞进去分析。比如你接手一个陌生仓库,想找循环依赖和内存泄漏点。
做法:把项目文件清单读进来,直接作为上下文发给 K3。代码大致是这样——打开项目树文件,截到 80 万字符左右(留足输出空间),然后问它”找出循环依赖、潜在内存泄漏点、给出重构顺序”。它能基于全库上下文给你一份有优先级的诊断,而不是瞎猜某个文件。
多模态也一样简单。写个函数把 bug 截图 base64 编码,和”这个页面渲染有问题,看截图定位 bug,给出修复方案”一起发过去,K3 能看图定位问题。注意视觉输入只接受 base64 或 ms:// 文件 ID,公开 URL 不支持,别直接丢一个图床链接过去。
顺手记一个坑:多轮对话和 Agent 工作流里,API 返回的 reasoning_content 和 tool_calls 必须原样回传,不能丢掉思考痕迹。K3 是在保留思考历史的前提下训练的,你把它中间推导截了,后续任务质量会断崖式下跌。
第五章 进阶:自进化 Agent 与推理档位
K3 的 reasoning_effort 分 low / high / max 三档,默认 max。日常问答可以调到 low 提速;长程复杂任务保持 high 或 max。官方榜单成绩都是在默认档下测的,横向比较时注意统一档位。
最震撼的案例是”16 天自主编程”:K3 在无人工干预下,从零搭出一个 Hermes 级别的自进化智能体框架”oh-my-cli”,在 GitHub 上产出了 265 次代码提交。一句”创建一个自进化的智能体 Harness”,它就自己编排循环工程、自动领任务、自己执行,人类工程师还能通过钉钉提新要求。
另一个硬核例子:单次 48 小时自主运行,K3 设计出一颗芯片(146 万标准单元、0.277MB SRAM、INT4 MAC 阵列),在 100MHz 下时序收敛,解码吞吐 8700+ token/s。一个模型设计芯片,去服务跑在它自己架构上的纳米模型——这闭环有点科幻。

第六章 避坑清单:新手最容易踩的 5 个坑
- 高峰期官方接口打不进去:48 小时打满集群不是段子。没卡的中小团队建议走多通道网关自动故障切换,或等开源权重自部署。
- 100 万上下文 ≠ 无脑全塞:输入按量计费,全塞又慢又贵。实操建议先做检索(RAG),只喂相关片段;缓存命中率高的前提是复用相同前缀,别每次重组 prompt。
- 模型名写错:接口名是
kimi-k3,不是 kimi-k3-2.8t,也不是老接口 moonshot-v1-128k。写错直接 400 model_not_found。 - 视觉用公开 URL:K3 看图只认 base64 和 ms:// 文件 ID,丢 http 图床链接会被拒。
- 开源协议没看清:权重开放、可商用,但再分发和对外提供 API 服务要遵守具体条款,别想当然。
还有一点:K3 训练时被设定得”过度主动”,有时候会自作主张多做一步。Agent 场景里给它明确边界,比指望它自己收敛更稳妥。
第七章 要不要自部署:按需三选一
个人开发者:直接 API 接入,编码场景成本极低,缓存命中 90% 以上,先把活干完再说。中小团队:API 为主 + 高峰期多通道备选,别自己扛 GPU。
有大算力的团队:可以本地部署开源权重,数据不出内网。K3 拆成 118 个二进制段、96 个专家分片,即便 MXFP4 量化也需要多卡集群。推荐引擎 vLLM、SGLang、TokenSpeed,社区还出了 11 个适配 llama.cpp、Ollama、LM Studio、Jan 的量化版本,官方 Docker 镜像也有。
一句话总结:2026 年 8 月,开发者该怎么做?能 API 就别硬上自部署,把 K3 塞进你的 Agent、客服、代码助手,长上下文加视觉闭环就是你的差异化。这个月,你用上 K3 了吗?
暂无评论内容