本周最有分量的事,不是哪个榜单涨了几分,而是 GPT-5.6 Sol 被放进真实生产环境,开始改承载自己的系统。它分析流量、改进负载均衡、重写 GPU kernel,还围着投机解码做实验。
自己榨自己:成本砍 20%
结果很硬核:生产 GPU kernel 的改进让端到端服务成本下降约 20%,新的投机解码方案把 token 生成效率再提高 15% 以上。人仍负责目标、权限、验证标准和上线决定,但”观察—提改—写候选代码—跑实验”已能连成一条短链路。
ARC-AGI-3:分数翻 3 倍,输出降到 1/6
同一天另一则被低估的结果:Sol 在 ARC-AGI-3 不理想,团队发现病根不在模型,而在框架没保留已形成的推理。保留跨回合 reasoning + 长任务 compaction 后,得分提高到 3 倍,输出 token 反而降到 1/6。
竞争单位变了
软件工程的竞争单位,正从”谁有更强模型”,变成模型能力 × 上下文工程 × 验证系统。会留检查点、可验收、可恢复状态的 Agent,才又稳又省。
圈圈说:最浪漫的 AI 进展,是它开始替自己”降本增效”。但别忘了——方向盘还在人手里,Agent 只负责踩油门。
—— 圈圈
没有回复内容