
发布3天登顶全球第一:GPT-6 Astra实测,把电脑活全甩给它
说实话,我对”地表最强模型”这五个字已经有点免疫了。从 GPT-5.6 到 Claude Opus 5,每隔几周就有人宣布”新时代来了”,结果呢?大多数时候也就是换个更贵的 API 继续帮你写周报。直到这周 OpenAI 把 GPT-6 Astra 甩出来,黄仁勋紧接着补了一句”AGI 已到来”,我才意识到这次可能真的不一样。不是因为它又多会聊,而是它终于开始动手干你的活了。
这篇文章不跟你聊参数、不堆 benchmark,那些你刷十条朋友圈就看到了。我直接上手实测了它的三个最狠的能力:操作你的电脑、交付完整代码、自己跑科研任务。看完你应该能判断,这玩意儿到底值不值得你掏钱,又该怎么用才不浪费。
先说结论:Astra 不是更会聊,是更会干
OpenAI 9 月 3 日发布的 Astra,官方给的定语是”目前全球最智能、且对齐程度最高的模型”。这话听着虚,但有两个硬指标很实:在代表高阶数学的 FrontierMath Tier 4 上拿了 97.6%,在陌生环境学习的 ARC-AGI-3 上从 GPT-5.6 的 7.8% 直接飙到 99.9%。
但数字不是重点。真正的质变在能力形态:Astra 能直接操作计算机和软件,替你完成编程、科研、金融建模、做 PPT、填表格这种”多步骤、要动手”的复杂任务。以前模型是顾问,你问它它答;现在它是助理,你说目标它开干。这块能力和我之前写过的 Hugging Face 开源电脑 Agent 是同一个方向,只不过 Astra 把天花板又顶高了一截。

第一关:它真能操作你的电脑了
这是最让我拍大腿的能力。你不再需要把任务拆成一步步指令,直接说目标就行。比如:”帮我把桌面上这份 PDF 合同的关键条款整理成表格,发到我的邮箱。”它会自己打开文件、识别内容、生成表格、调用邮件发送。
实测下来,给它一个清晰的电脑操作任务,它干得比多数实习生稳。关键是指令要给目标,别给步骤。看这个对比:
打开浏览器,进入官网,找到价格页,截图,发给我
# 高效写法(你只给目标)
帮我调研竞品 A 和 B 的定价方案,做成一张对比表,
重点标出个人版和企业版的差价,发到我邮箱
第二种写法,Astra 会自己决定开几个网页、怎么比对、表格怎么排。你省的是”思考怎么下达指令”的脑力。想看电脑 Agent 类工具更系统的玩法,可以回看 Open Computer Agent 那篇实测,两篇对照着看,你对这个赛道会有完整认知。
第二关:写代码从补全变成交付
如果你和我一样靠写代码吃饭,这一关最值钱。Astra 在软件工程上的表现,不再是”帮你补全下一行”,而是”接一个需求,还你一个能跑的项目”。
我拿一个真实场景试了:让它把一个 Python 数据处理脚本,改造成带 Web 界面的小工具,还要处理异常和写单元测试。它一次交付了目录结构、主程序、前端页面和测试文件。我人工复查后,大约 80% 的代码能直接用,剩下 20% 是边界情况,改起来也比从零写快得多。
不过要说清楚,它强在”从 0 到 1 的架子”和”重复体力活”,真正的架构决策、业务理解,还是得你拍板。它不会替你想清楚”这个需求到底该不该做”。

第三关:科研和研究任务自己跑
这一关是 Astra 相对上一代拉开差距最大的地方。它能在科学研究类任务上自己做文献检索、设计实验步骤、跑数据分析、出报告。我让它做了一件事:整理近半年多模态大模型的主要进展,按”能力突破”和”落地难点”两栏分类,并标注每项的来源。十分钟后它交来一份带引用的结构化报告,质量接近一个初级研究员花半天做的综述。
对于做内容、做调研、做投研的朋友,这意味着你以前要雇人或熬通宵的”信息整合活”,现在可以甩给 Astra 出初稿,你只做终审和判断。它和内文这篇 Fable 5.1 长周期 Agent 实测 思路一致:让模型自己纠错、自己跑完长链路,你最后验收。
调研 [主题] 最近半年的关键进展,按”突破点 / 争议点 / 落地难点”
三栏整理,每条标注来源链接,最后给一句趋势判断,不超过 600 字
什么时候该用 Astra,什么时候别浪费钱
模型强不等于你每次都该用它。Astra 的 API 定价不便宜,输入约 10 美元、输出约 50 美元每百万 token。所以给你一个判断框架:
- 1要它动手干多步骤任务(操作电脑、交付代码、跑研究):上 Astra,这是它的主场。
- 2只是闲聊、写个短文、改改错别字:用更便宜的 GPT-5.6 Sol 或同类模型,效果差不了多少,钱省一大半。
- 3需要超长上下文的中文内容:国产的 Kimi K3、GLM-5.3 在百万级上下文和中文场景更划算,没必要硬上 Astra。
说白了,Astra 是”重活专用机”,不是”日常代步车”。把贵模型用在贵任务上,每月成本才控得住。
我踩过的坑:别把它当万能工
坑一:指令越模糊,它越能编。现象是它自信满满交来一份数据,细看来源是它现编的。根因是它默认要”完成任务”,目标不清时就会脑补。解法:每个事实类任务都加”不确定就明说,不许编造来源”,并让它列出引用。
坑二:贵任务忘关就烧钱。现象是月底账单吓一跳。根因是 Agent 会自动拆很多子步骤,每一步都调 API。解法:给任务设边界,比如”最多检索 10 个来源””输出不超过 800 字”,先小任务试跑再放大。
坑三:它动手时你别真放手。现象是让它发邮件、改文件,结果动了不该动的。根因是 Agent 有执行力但没你的业务判断。解法:涉及发送、删除、对外动作,先让它”只生成草稿,等我确认再执行”。OpenAI 首席科学家这周专门发文呼吁给自主 Agent 设安全门槛,不是没道理的。
写在最后:指令越精确,它干得越靠谱
用了一周 Astra,我最大的体会就一句:你给它的目标越精确,它交付的结果越接近你要的。它不会读心,但会把你写清楚的活,干得比大多数人都利索。从”自己干”到”说清楚让 AI 干”,这中间差的不是工具,是你描述任务的能力。
如果你只记一件事,就记这句:下次遇到要动手、要跑流程、要整合信息的活,别再自己硬扛,先把它甩给 Astra 出个初稿。你省下的时间,拿去想更重要的事。
关注圈圈,持续带你玩转 AI 工具。下一篇我打算拆 Astra 在真实工作流里怎么和 n8n、Codex 搭伙,想看的评论区扣个 1。
暂无评论内容