说个反直觉的:现在用 Codex,最值钱的已经不是”它会不会写代码”,而是你能不能把一整个工程目标,拆成不同模型各干各的活。2026 年 8 月的 Codex,本质是一支 AI 工程团队。
Sol / Terra / Luna,三档不是一个家族
GPT-5.6 现在是三层路由:Sol 管架构、产品权衡、冲突解决和最终综合,专接难而高价值的活;Terra 做均衡的实现与支撑;Luna 干快、窄、可重复、量大的活——扫描、分类、抽取、按固定清单对账。Codex 能把 Luna 直接当原生子 Agent 派进当前任务,收完证据再回传给 Sol。
DeepSWE 8/13 更新的一组数,把”路由经济学”说透了:
· GPT-5.6 Sol Max:解决率 73%,单次平均成本 $8.39;
· GPT-5.6 Luna Max:解决率 67%,单次平均成本 $0.61;
两者解决率只差 6 个点,但 Luna 便宜了约 13.75 倍。边界清楚、验收标准明确的活,交给 Luna 最划算。
安全分层、超快预览,都在路上
同期还有两条信号:Daybreak 把安全能力拆成 Blue(GPT-5.6 Sol 做漏洞发现、代码审查、蓝队)和 Red(GPT-5.6 Cyber 做授权红队、漏洞复现),按身份和工作面单独审批;Ultrafast 预览则让 GPT-5.6 Sol 在 Cerebras 晶圆上冲到 14 倍速,虽然还只是候补名单、没进 CLI,但”速度和成本第一次能分开调”这件事本身就很关键。
再把 Codex CLI 0.147.0 的 leaf models 多智能体 V2、Agent Plugin 市场放一起看,方向一目了然:Codex 正在从”代码补全器”变成”工程运行时”。多仓库并行、子 Agent 派活、跨云跑,这套编排正面对上 Claude Code 的嵌套子 Agent。
所以别再问”哪个模型最强”了。该问的是:这个数据包,该交给哪个模型、在哪个推理档位。会路由的人,才是 2026 年的真程序员。
—— 圈圈
没有回复内容