别再迷信模型了,壁垒长在Harness上-Codex论坛-AI工具-圈圈AI一站式AI资源分享平台

别再迷信模型了,壁垒长在Harness上

前 OpenAI 研究主管 Lilian Weng 最近抛了个判断,我觉得是这段时间最值得琢磨的一句话。

她说:短期内真正实用的递归自我改进,靠不上模型权重自己更新,而要靠模型外面那层 Harness——也就是模型跟真实世界打交道的部署层。

她进一步说,Claude Code、Codex 这些顶尖编程 Agent 的核心壁垒,正长在这一层,而不是模型里。

有个数据把这事儿钉死了

SWE-bench Pro 上,只换外部框架、模型一个字没动,GLM-5.2 的 pass@1 从 23% 干到了 52%。

翻倍还多。

你想想常规的模型迭代,一代提升几个点就能开发布会了。换个 Harness 直接 +29 个点——这已经不是”优化”,是原来的能力根本没被释放出来。

Harness 到底是什么?说人话

就是模型之外,所有让它能真正干活的那些东西:

· 上下文怎么组装、什么时候压缩、哪些信息该留

· 工具怎么描述、调用失败怎么重试、报错信息怎么喂回去

· 任务怎么拆、子智能体怎么派、结果怎么汇总

· 沙箱边界、权限分级、什么操作必须停下来问人

这些没有一条写在模型权重里。全在外面那层工程里。

顺手看看三大编码智能体的现状

8 月这份对比刚出来:Terminal-Bench 2.1 上 Claude Code(Opus 5)86.7%、Meta Muse Code 82.9%、Codex(GPT-5.6 Terra)81.8%;DeepSWE 1.1 上分别是 65.0%、59.3%、64.8%。

Claude Code 两项都第一。但评测里那句话更值得看——Muse Code 的核心优势不在分数,在崩溃安全运行时和子智能体设计,而这两项现有基准根本量化不了。

这不正好印证了 Weng 的判断?决定体验的东西,跑分跑不出来。

对我们意味着什么

如果你在选工具:别只看它接了哪个模型,看它的会话管理、上下文策略、失败恢复做得怎么样。同一个模型在两个 Harness 里,能差出一倍。

如果你在自己搭:把精力从”换个更强的模型”挪到”把外层工程做扎实”,投入产出比高得多。

模型是发动机,Harness 是整辆车。发动机再猛,变速箱和底盘不行,照样跑不快。

—— 圈圈

请登录后发表评论

    没有回复内容