先说一句可能让你后背发凉的事:有用户的文件,被 Codex 删了。
不是删了临时文件,是删了真实的用户目录里的东西。
这事 OpenAI 没藏着,Codex 团队的 Tibo 直接出来把整个调查过程说透了。我看完的第一反应不是”哇好可怕”,而是——这个失败模式,太典型了,值得每个用 AI 跑命令的人抄在本子上。
一、它是怎么删错的?
官方复盘出两条根因,都不是什么高深的 bug,全是”顺手”惹的祸。
第一条:环境变量被”借用”了。
Codex 干活时会建临时文件夹,干完了清理掉——这本身没问题。问题是极少数情况下,GPT-5.6 会把
Codex 干活时会建临时文件夹,干完了清理掉——这本身没问题。问题是极少数情况下,GPT-5.6 会把
$HOME 这种系统环境变量拿来当临时工作目录用。后面生成的清理命令一旦格式写歪了,删的就不是临时目录,而是你真正的家目录。 第二条:删之前不看一眼。
模型准备覆盖或删除某个”临时路径”时,没先检查这个路径里原本装了什么。它以为是空的,其实里面有你的东西。
模型准备覆盖或删除某个”临时路径”时,没先检查这个路径里原本装了什么。它以为是空的,其实里面有你的东西。
看懂了吗?这不是模型”变坏了”,是它在缺少常识性的自我怀疑。老运维删东西之前手会抖一下,会先 ls 一下——这个”手抖”,恰恰是模型最缺的。
二、官方补的这几道锁,逻辑很讲究
这次的修法不是”打个补丁完事”,而是从提示层、执行层、权限层、审查层、训练层五个方向同时下手:
① 行为约束:删之前必须先检查目标;必须新建全新临时目录;不许挪用系统环境变量;优先选可恢复的操作;范围不明就地停下。
② 执行层拦截:识别高风险删除命令并升级人工审核,被拒了就要求模型换更安全的写法。
③ 权限收紧:Full access 更难被误开,警告更醒目,高危权限组合被进一步限制。
④ Auto-review 加强:自动审查现在更能识别破坏性操作。
⑤ 训练侧回收:把这些失败案例做成评测集反复重放,加针对性的强化学习任务和 graders,并从训练数据里过滤掉破坏性操作。
② 执行层拦截:识别高风险删除命令并升级人工审核,被拒了就要求模型换更安全的写法。
③ 权限收紧:Full access 更难被误开,警告更醒目,高危权限组合被进一步限制。
④ Auto-review 加强:自动审查现在更能识别破坏性操作。
⑤ 训练侧回收:把这些失败案例做成评测集反复重放,加针对性的强化学习任务和 graders,并从训练数据里过滤掉破坏性操作。
最关键的一句在最后:官方说在这些故障重放评测里,改动显著减少了这类行为,同时没有影响 Codex 正常写代码的能力。
这句话才是真本事。安全和能力做取舍太容易了——把手脚全绑上,谁都不会出事,但也啥都干不了。能在不砍能力的前提下把危险行为压下去,说明他们是真的定位到了问题,而不是一刀切。
三、你今晚就该做的两件事
官方点名了,就两件,别偷懒:
1. 把 Codex 更新到最新版。上面这些防护都在新版里,你不更新,等于把安全带留在了后备箱。
2. 用沙箱模式跑——”Ask for approval(请求批准)”或”Approve for me(替我批准)”。Full access 只在两个条件同时成立时才用:你信任这个环境,且出事你能恢复。
2. 用沙箱模式跑——”Ask for approval(请求批准)”或”Approve for me(替我批准)”。Full access 只在两个条件同时成立时才用:你信任这个环境,且出事你能恢复。
我知道很多人图省事,一上来就 Full access,觉得”反正我看着呢”。但智能体干活是异步的、是并发的、是你去泡杯咖啡它已经跑了三十条命令的。你看不住。
这件事真正的启示,不是”Codex 不能用了”,而是:当 AI 从”给你写代码”进化到”替你执行”,权限设计就从体验问题变成了安全问题。能撤销、能审批、能恢复,这三个词以后会越来越贵。
顺手把备份也做了吧。真的。
—— 圈圈
没有回复内容