600B 参数只激活 27B:阶跃 Step 5 Preview 全量开放 API,单任务成本只有 Opus 5 的八分之一


600B 参数只激活 27B:阶跃 Step 5 Preview 全量开放 API,单任务成本只有 Opus 5 的八分之一

600B 参数只激活 27B:阶跃 Step 5 Preview 全量开放 API,单任务成本只有 Opus 5 的八分之一 封面

你让模型跑了一整晚的长任务,早上起来打开后台,账单三位数。结果呢?任务还卡在第四步。

说实话,这两年大家挑旗舰模型的方式一直挺离谱的:盯榜单分数,谁分高买谁。分数是爽了,钱包空了!

可真正吃掉预算的从来不是分数,是单价乘以长度。9 月 20 日阶跃星辰放出 Step 5 Preview,官方披露的一堆信息里,最值得重算的就是这笔账。

600B 的块头,27B 的胃口:稀疏 MoE 这笔效率账怎么算

先看架构。Step 5 Preview 是稀疏 MoE,总参数 600B,激活参数只有 27B。

什么意思?打个比方:一家 600 人的公司,每次开会只叫 27 个人进会议室。知识储备按 600 人算,干活开销按 27 人算。

这就是它能把价格压下去的物理基础。稠密模型要么块头大、要么便宜,二选一;稀疏 MoE 把这俩拆开了。说白了,架构决定成本天花板,定价只是结果。

再补一刀:账单上跟钱直接挂钩的是激活参数,不是总参数。前推时每个 token 只过 27B 的那条通路,600B 的剩余部分是躺着的知识库。你拿到的是大模型的知识面,付的是小模型的推理费。

44 分排进全球开源前三:但分数真不是今天的重点

Artificial Analysis Intelligence Index 得分 44 分,位居全球开源模型前三,和 Kimi K3 Max 持平。

再看几个硬指标:Terminal-Bench 4.0 上 Step 5 Preview 是 33%,Kimi K3 是 13%;SciCode 上两家都是 59%,打平。

在 ALE-CLI、FrontierFinance、DRACO 这几项上,官方披露仅次于 GPT-6 Astra 或 Claude Opus 5,领先其他参评开源模型。

跑分你大概已经在别处看过了。今天要算的不是分,是钱。

单任务成本 1/8:Opus 5 的钱到底花在哪了

官方口径很直接:单任务成本仅为 Claude Opus 5 的 1/8。

拆开看 AA 的计价:输入 1.00 美元/百万 tokens,输出 2.70 美元/百万 tokens,缓存折扣 95%,输出速度 100 tokens/s。AA 跑完整套 Intelligence Index 总成本 918.34 美元,指数任务平均 0.71 美元一项。

换成国内开放平台的人民币价更直观:普通输入 7 元/百万 tokens,输出 20 元/百万 tokens,缓存命中 0.35 元/百万 tokens。

盯住这个 0.35。它比普通输入低 95%,等于 20 倍差。长任务里 system prompt、工具定义、历史上文全在反复复用,这玩意儿的命中率有多高,决定了你真实账单有多低。

算一笔具体的。一个反复调用的长任务,输入侧按 100 万 tokens 算:全命中缓存是 0.35 元,全不命中是 7 元,差 6.65 元。看着不多?跑一千次就是 6650 元。该省的钱就这么从指缝里漏掉了。

600B 总参只激活 27B,稀疏 MoE 把能力和开销拆成了两笔账
600B 总参只激活 27B,稀疏 MoE 把能力和开销拆成了两笔账
长程 Agent 的真实形态:一条不断自我纠错的连续工作流
长程 Agent 的真实形态:一条不断自我纠错的连续工作流

1M 上下文不是拿来炫的:长程任务才是它的主场

100 万 Token 上下文窗口,原生支持文本与视觉输入,输出文本。这个配置单看没感觉,得看它拿去干什么。

另外别忽略视觉输入这四个字。原生支持文本加视觉输入、输出文本,意味着截图、界面图、表格截图可以直接丢进去当上下文,不用先转一道文字。做设备调试和 UI 走查这类活,省掉的是一整条预处理链路。

官方披露的三个长程案例,一个比一个离谱:

  • 在单张 NVIDIA H100 上连续 24 小时优化 MLA GPU Kernel,约 22 小时后达到 508 TFLOPS,Claude Opus 5 是 493 TFLOPS
  • 自动化后训练实验里,把 Qwen3-30B-A3B 在 AIME24 上的准确率从 53.3% 提到 60%
  • 按一句自然语言需求自主读 ESP32 设备与 API 文档,把一块 ESP32-S3 开发板改成支持蓝牙按键与语音输入的 Vibe Coding 键盘,中途访问串口、取截图、调摄像头、模拟鼠标,按真实设备返回的状态和报错持续改代码,连续执行超过 3 小时

据同花顺的实测报道,一次财报交付类的长任务跑了 88 分钟,模型能持续推进,遇到问题自己再修。

还有个细节值得留意:官方自建了 StepCodeBench,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言。敢把代码能力摊到这个规模上测,说明对长程执行是有底气的。

手把手接进去:从开 API 到把缓存吃满

入口就这几个,按你的位置挑:

  • 想先看效果:Studio 在线体验 studio.stepfun.com
  • 国内调用:开放平台 platform.stepfun.com,Token Plan 49 元起
  • 海外调用:platform.stepfun.ai
  • 想啃技术细节:Model Blog 的 step-5-preview 页面

怎么切,看你现在的状态。如果你是新手,先去 Studio 把同一份长文档丢进去连问几轮,感受 1M 上下文的手感,别急着写集成;如果你已经在跑 Agent 流水线,那就只改两处,BASE_URL 和模型名,第一周别的都别动,只盯后台的缓存命中率。

省钱三招,按收益从高到低排。

第一招,把 system prompt、工具定义、长文档全塞进前缀,让它稳定命中缓存。输入价从 7 元掉到 0.35 元/百万,这是最大的一笔。

前缀越长越稳,缓存是按前缀匹配的,中间插一句变量就前功尽弃。多轮对话里尤其要小心,别把每轮的会话 ID 拼进前缀。

第二招,长任务拆 checkpoint,中间结果落盘,别每次从头重放。

第三招,管住输出。输出 20 元比输入 7 元贵一大截,能少说一句是一句。让它在结尾先给结论再给过程,实在要详细就分章节吐出来。啰嗦本身不是毛病,啰嗦乘以 20 元每百万就是毛病了。

第三招为什么单独拎出来?往下看。

坑都在这了:啰嗦、超时、还有那个拿不到的 95%

下面这些坑,官方不会用大字写在首页,但每一条都够让你的账单翻一倍。

坑 1:账单比预估高出一大截。根因是它真的啰嗦。AA 的公开标注写得很明白,这个模型回答非常冗长,评测里生成了 160M tokens,而中位数是 90M,冗长度排名 #65/200。速度 100 tokens/s 比中位数 65 快,但成本优势被长度吃回去了。解法:在 system prompt 里写死输出格式和长度上限,明确要求结论先行,超长部分直接截断。

坑 2:缓存折扣没生效,输入还按 7 元算。根因通常是前缀里混了动态内容,时间戳、随机数、每次现拼的 few-shot 样例,只要前缀字节级变了,缓存就整体失效。解法:动态部分全挪到后缀,前缀做成固定模板,一次都别动。

坑 3:长任务跑到一半断了。根因是单次请求超时,或者上下文被塞满。解法:每完成一个子任务就把结果摘要落盘,下一轮拿摘要续接,别硬撑 1M。

坑 4:以为 1M 就该全塞进去。根因是把上下文窗口当传送门,塞得越多注意力越散,命中也越贵。解法:先检索筛一遍,再喂 100K 精料,效果往往比全塞更好。

10 月 15 日开源权重:现在该怎么下注

今天起 API 全量开放,模型权重 10 月 15 日开源释放。这个节奏意味着什么?先用 API 验证它适不适合你的链路,三周后权重到手,再决定要不要自己扛部署。

如果你只是想找个能扛长任务、花钱不心疼的底座,这个月的 API 已经够用了,先接进去跑两周看命中率。如果你团队有自建推理集群的打算,那就等 10 月 15 日,权重到手再压一遍单位成本。两条路不冲突,先走第一条。

回到开头那张让你心疼的账单。旗舰模型的账,按单位智能成本算,不按榜单分数算。分数决定它能不能干,成本决定你能不能一直干下去。

Step 5 Preview 交出来的答案是:44 分的智能,27B 的激活开销,八分之一的价格。

关注圈圈,持续带你玩转 AI 工具。

© 版权声明
THE END
喜欢就支持一下吧
点赞146 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容