
说实话我对更强模型早免疫了,直到Fable 5.1连干三天自己纠错
说实话,我对”更强模型”已经免疫了
之前 GPT-5.6、Claude Opus 5 一个个往外蹦,我的反应都是”哦,又强了”。测评榜上多涨几个点,跟我有什么关系?真到了干活的时候,还是干两下就停下来等你喂。
直到 9 月 1 日,Anthropic 把 Fable 5.1 甩出来。我第一眼以为是常规升级,结果越看越不对劲。它干了一件以前模型干不了的事:连续几小时、甚至跨好几天,自己规划、自己派小弟、自己验证、自己改优先级。
我愣了三十秒。这玩意儿不是来陪你聊天的,是来替你上班的。如果你还没用过 Claude Opus 5,建议先看那篇上手实测,再回来对比,你会明白这次迭代的跨度有多大。
Fable 5.1 真正的杀招,不是”更聪明”是”更耐干”
先把它的三大能力拆开看,别被”性能提升”四个字糊弄过去:
第一,长期自主干活。以前模型是短跑选手,跑几分钟就断、就等你。Fable 5.1 是第一个为”长期自主任务”而生的模型。你在 Claude Code 里把一个跨天的活整个丢给它,它自己分阶段、自己派子 agent、干到达标才停,中间不喊你。
第二,自己查自己。干完不急着交差,先写测试、跑测试、抓出错误、修完,才说一声”做完了”。一个”让 AI 检查自己”的动作,抵得上换半代模型。Anthropic 内部的说法更直接:现在团队花更少时间确认”活干没干完”,更多时间确认”它挑的活对不对”。
第三,读得懂密集图表。财报表、PDF 里嵌的图、架构图、仪表盘截图,以前 Opus 偶尔认错列、看混坐标轴,Fable 5.1 能稳定读对。这对研究、分析类工作含金量很高。
最实在的一点是价格:典型任务比上一代 Fable 5 便宜约 25%,缓存读取价格砍了 75%,重度 Agent 任务最高能降 45%。贵,但这次贵得有理。

两个命令,把聊天机器人变成”员工”
这里有个残酷的真相:大多数人拿 Fable 5 当普通 Claude 用,等于花两倍的钱买了个聊天框。真正值钱的能力,藏在 Claude Code 里的两个命令:/goal 和 /loop。
分工口诀就三句:有明确终点,用 /goal;按周期重复,用 /loop;要一直跑到某个条件达成,两个叠着用。
/goal:你定义终点,它奔着跑,到了自己停。铁律只有一条,把”完成标准”写具体,而且必须给一条失败退路。
改进这段代码
# 好目标(每一条都能核对)
/goal: 让 /tests/ 下所有测试通过;只许改 /src 里的文件;
修 3 次还不过就停下来汇报,不要偷偷扩大改动范围
/loop:按点反复跑,直到你喊停。比如每 30 分钟查一遍错误日志,把严重级别的挑出来用大白话汇报;或者每小时扫一遍收件箱,摘要新邮件、把该回的草稿先拟好。
放手之前,先封顶花费。一个没封顶的 /goal 撞上难题,token 烧得飞快,一天烧掉两百多美元不是段子。
实战:我把一个跨天的项目整个甩给了它
说个真事。我有个老数据管道要迁移,逻辑乱、依赖多,正常得我盯两三天。这次我直接把验收标准丢给 Fable 5.1,让它自己跑。
目标:把 legacy_etl 迁移到 new_pipeline
完成标准:
1. 新管道跑通样例数据,输出与旧管道一致
2. pytest 全部通过
3. 只改 pipeline/ 目录,不动 core/
4. 修 5 轮不过就停下写报告
5. 每阶段结束写一行 changelog
结果呢?它分阶段规划、派子 agent 干重活、每段跑测试、最后交了一份带 changelog 和自审的迁移。我周末只看两次,周一收工,测试全过。
按”我盯屏幕的时间”算,原来两三天 约等于 6 倍提效。关键不是快,是我不用一直在线。想搭这种长周期执行平台的,可以看我写的 DeepSeek Harness 进阶实战,思路是通的。

三个坑,我替你踩过了
别光看爽,坑也得讲。诚实踩坑,你才信我的优点。
坑1:没封顶的 /goal。现象:撞到一个难题,模型原地空转,token 烧到一天 250 美元。根因:没有 turn 数或时间上限,模型会loop到天荒地老。解法:一定写 max_iterations 或时间上限,比如”修 5 轮不过就停”。
坑2:评估条件写”感觉对”。现象:模型汇报”重构好了”,其实只动了表面。根因:给评判模型的证据没进对话,它只能凭感觉打分。解法:条件写成可机器校验。”npm test 退出 0 且 git status 干净”,比”代码更整洁”强一百倍。
坑3:啥都上 Fable。现象:日常问答也用 Fable,月底账单爆炸。根因:贵模型用错了位置。解法:barbell 策略,贵模型放在边缘(规划加验证),便宜模型放中间干苦力。日常聊天丢 Sonnet,五分之一的价。一句话记住:Fable 负责想清楚和验收,中间苦力交给便宜模型。
给你一个判断框架:如果你是新手,从单个 /goal 任务开始跑通;如果你已经用过 Claude Code,直接上 /loop 加 barbell 策略,先把一个重复活甩出去,再决定要不要 All in。
我的真心话
如果你只记一句话,记这句:指令越具体,它干得越靠谱;标准越可验,它跑得越久。
回到开头那句,对”更强模型”免疫,是因为以前它们只是更会聊。Fable 5.1 不一样,它把”自己定目标、自己验证、自己交差”这件事做实了。回到”自己干”这件事,越来越难了,但把脏活累活交给它,你就能去做只有人能做的事。
想从 Claude Code 基础玩法起步的,看这篇 Claude Code 实测。关注圈圈,持续带你玩转 AI 工具。
暂无评论内容