
别再让AI读半个仓库才动手!Cognition SWE-2实测:三档effort一调,账单砍掉七成
说实话,我对”更强编码模型”这五个字早就免疫了。
从 Claude Code 到 Cursor,每一个都号称要颠覆工作流。结果呢?账单涨了,代码质量没跟上,唯一稳定增长的是我盯着进度条发呆的时间。
所以 9 月 10 号 Cognition 发布 SWE-2 那天,我第一反应是想划走。直到看见一组数字。
改代码之前,SWE-2 中位只用 18 步。上一代 SWE-1.7 要 48 步。
我当场拍了大腿。这两个数字之间差的不是智商,是克制。
第一章 先搞清楚:SWE-2 不是”更强”,是”更会省”
Cognition 就是做 Devin 的那家公司,全球首个自主 AI 软件工程师出自他们手。这次的 SWE-2 已经上线 Devin Desktop、CLI、Web 和 Fusion,全线铺开。
先把话说在前面:它并不是分数最高的那个。Cognition 官方 FrontierCode 1.1 主榜上,SWE-2 拿 50.0%,Fable 5.1 是 50.9%,GPT-6 Astra 53.3%。SWE-2 排第三。
真正让我坐直身子的,是官方那句自我检讨。Cognition 直接承认 SWE-1.7 “tended to over-explore and overthink simple tasks”,翻译过来就是:简单任务它也非要全局搜一遍,不搜完不动手。
你以前花的那笔钱,买的根本不是它改代码的时间,是它”思考人生”的时间。
这一代真正的增量在这里:effort level。medium、high、max 三档旋钮,交到你手上,你自己拧。
第二章 三档 effort 怎么选:我的一套判断表
先给表,照着抄就能用。
| 任务长什么样 | 档位 | 为什么 |
|---|---|---|
| 改配置、修 typo、补个单测、改字段名 | medium | 定位明确,模型不需要探索,多走一步都是浪费 |
| 单文件重构、已定位的 bug 修复 | medium 起步,卡住再升 high | medium 档已经比上代 SWE-1.7 还强 |
| 跨模块改动、要跑通整条链路才有反馈 | high | 需要它自己建上下文,省不掉 |
| 跨天的大工程、需求本身就模糊 | 别硬撑,换模型或换人 | 见第五章那个 27.3% |
· 如果你 30 秒内能说清”改哪个文件的哪一段”,那就 medium。
· 如果你得先解释业务背景才能说清要改什么,那就 high。
· 如果你自己都不确定这活要干几天,那就别交给 SWE-2。
这里还有个技术细节,我觉得比分数重要。Cognition 在单次 RL 训练里加了线性成本惩罚,一次训练直接训出三档,而不是分开训三个模型。多走一步就有价码,模型自然学会”够用就停”。
效果有多猛?medium 档比上代 SWE-1.7 分数更高,还少 58% 的 turn,平均成本低 81%。
devin run –effort medium “修复 user.service.ts 里 token 过期未刷新的竞态”
# 跑不通再升档,别一上来就 max
devin run –effort high “重构 auth 模块,把 session 逻辑抽成独立中间件”
# max 留给真难题:定位不明、需要跨模块推理的那种
devin run –effort max “排查结算金额偶发错位的根因,给出修复方案”

第三章 实战场景:一个真实 bug,medium 档十分钟跑完
讲个我这周真遇到的。登录态偶发掉线,我怀疑是 refresh token 的竞态,但不确定。
旧习惯:开最大档,让它全局搜 auth,我去泡杯咖啡。回来一看,它读了十几个文件,PR 倒是出了,但改了一堆不相干的边界处理,我还得回滚。
新做法:medium 档 + 直接点名文件。
十分钟出 PR。我 review 完直接合了。
官方管这个指标叫”首次真正改代码”的中位步数:SWE-2 是 18 步,SWE-1.7 是 48 步。落到体感上,就是从”泡杯咖啡”变成”盯着看十分钟就完事”。
提效点在哪?不是模型突然开窍了,是你终于不用为它的好奇心买单。
第四章 18 步 vs 48 步:为什么”少读代码”反而更强
这一章是我最想说的,因为它反直觉。
我们默认以为,模型读的上下文越多,判断越准。其实不是。1M 上下文是它的能力上限,不是每次的默认用量。
读得越多,噪声越多。无关文件里的相似命名、废弃的兼容分支、三年前的注释,全都会被当成线索。模型在这些线索里绕圈,绕着绕着就把简单任务做成了复杂任务。
SWE-2 的解法很朴素:给每一步标价。RL 里加了线性成本惩罚之后,”再读一个文件确认一下”这件事有了成本,模型学会了在信息够用的时候停手。
结果直接写在短任务榜单上。Terminal-Bench 2.1,SWE-2 拿 92.8%,反超 Fable 5.1 的 91.4% 和 Astra 的 89.9%。

第五章 数据摊开看:它赢在哪,输在哪
我把官方给的数全摊在这儿,你自己判断。
| 模型 | FrontierCode 1.1 Main | Terminal-Bench 2.1 | Terminal-Bench 4 |
|---|---|---|---|
| SWE-2 | 50.0% | 92.8% | 27.3% |
| Fable 5.1 | 50.9% | 91.4% | 55.8% |
| GPT-6 Astra | 53.3% | 89.9% | 57.9% |
| Grok 4.6 | 48.0% | 未公布 | 未公布 |
| GPT-5.6 Sol | 47.5% | 未公布 | 未公布 |
| Kimi K3(基座) | 44.2% | 未公布 | 未公布 |
| SWE-1.7(上代) | 42.0% | 未公布 | 未公布 |
另外 DeepSWE 1.1 上,SWE-2 是 73.0%。
赢的地方很清楚:Terminal-Bench 2.1 第一。短、边界清、反馈快的任务,它是目前最稳的选择。
输的地方必须讲明白。主榜 50.0%,排在 Fable 5.1 和 GPT-6 Astra 后面。更要命的是 Terminal-Bench 4,那个测长周期艰难任务的榜:SWE-2 只有 27.3%,Fable 5.1 是 55.8%,Astra 是 57.9%。
不到人家的一半。这个数字我没法替它洗。
对了,它的底座是 Moonshot AI 的 Kimi K3,2.8 万亿参数的开源模型,Cognition 做后训练,RL 那部分加了 5 到 6 分。这没什么丢人的,站得住。
第六章 它不完美:我也踩过坑
坑 1:长周期任务会崩。
现象:让它做跨三天的大重构,前两小时像模像样,之后开始自我推翻,把上午写的判定成错的,重来一遍。
根因:Terminal-Bench 4 的 27.3% 就是这件事的量化结果,长程规划能力确实没跟上。
解法:拆。一个 session 只干一件事,干完开新 session。跨天的活直接交给 Fable 5.1 或者你自己写。
坑 2:没有独立 API。
现象:我想把它接进自己的 harness,接不进去。
根因:SWE-2 只活在 Devin Desktop、CLI、Web、Fusion 这套产品里,没开源权重,也没有独立 API。
解法:要么接受 Devin 的工作流,要么继续用别的模型。社区那句抱怨我举双手赞成:I don’t want to use your CLI. I already have my own harnesses.
坑 3:档位选错反而更贵。
现象:我图省事一律开 max,月底账单比上个月还高。
根因:max 在简单任务上多走的每一步都在烧钱,而 medium 档的水平已经压过上代了。
解法:默认 medium,跑不通再升。把 max 留给那种你自己也得想半天的难题。
第七章 我的真心话
先说钱。Devin Pro 每月 20 美元起,Pro 及以上 unlimited 用 SWE-2。Pro、Max、Teams 的订阅者,首月 SWE-2 用量不计配额。
官方口径是:同分情况下比 Fable 5.1 低 64%,大概是 GPT-6 Astra 的四分之一。推文里喊得更响,说 up to 70%。
我信一半。成本优势是真的,但那个 70% 是理想工况,你档位乱开的话照样贵。
再说说我的立场。Cognition 现在估值 480 亿美元,它当然想让你多用、多烧。但这次它做了一件反商业直觉的事:把”少花钱”的旋钮明确交给了用户,还在官方文档里告诉你哪一档最省。
就冲这一点,我愿意给它好评。
回到开头。我依然对”颠覆”这两个字免疫,但看到 18 步对 48 步那个数字,我是真的拍了大腿。
这一代模型卖的不是智商,是克制。知道什么时候停手,比知道怎么继续想下去,难太多了。
关注圈圈,持续带你玩转 AI 工具。
暂无评论内容