本周最有分量的进展,不是榜单涨了几分,而是 GPT-5.6 Sol 被放进真实生产环境,开始分析流量、改进负载均衡、重写 GPU kernel、围绕投机解码做实验。Agent 开始”改承载自己的系统”了。
自己改自己:成本-20%
结果很实:生产 GPU kernel 的改进让端到端服务成本下降 20%,新的投机解码方案又把 token 生成效率提高 15% 以上。人仍负责目标、权限、验证标准和上线决定;但观察系统、提修改、写候选代码、跑实验,已经能由 Agent 连成一条短链路。
ARC-AGI-3:只改两项,分数翻 3 倍
同一天还有个容易被忽略的结果:GPT-5.6 Sol 在 ARC-AGI-3 起初不理想,问题不在模型,而在框架没保留已形成的推理。团队保留跨回合 reasoning + 长任务 compaction 后,得分提到原来 3 倍,输出 token 反而降到六分之一。对普通用户比榜单有用多了。
Luna 降价 80%
Luna 新价降到每百万输入 token 0.20 美元、输出 1.20 美元——直接打八折。软件工程的竞争单位,正从”谁有更强模型”变成 模型能力 × 上下文工程 × 验证系统。
圈圈说:当 Agent 能改自己的内核,工程效率的范式就换了。比模型大小更值钱的,是清晰的 checkpoint 和可恢复状态。
—— 圈圈
没有回复内容