DeepSeek又整活了!V4.1 Flash实测:原生多模态+缓存砍437倍,Agent跑一晚几块钱

DeepSeek又整活了!V4.1 Flash实测:原生多模态+缓存砍437倍,Agent跑一晚几块钱 封面

DeepSeek又整活了!V4.1 Flash实测:原生多模态+缓存砍437倍,Agent跑一晚几块钱

说实话,我对 DeepSeek 上个月那波涨价早有意见了。8月13日 V4 Pro 上线,峰谷一拉开,高峰时段价格直接翻倍,不少开发者的账单当场涨了三倍。那段时间圈子里全是”用不起、求平替”的哀嚎,连我司写代码的同事都把主力换成了别的模型。

结果呢?9月10日,DeepSeek 反手甩出 V4.1 Flash。这玩意儿不光能力全面超过 V4 Pro,还把价格砍回了原点。我把刚转到别家的同事都看愣了。这篇文章不吹不黑,只讲一件事:V4.1 Flash 到底新在哪,以及你手上的 Agent 怎么把成本算明白。

如果你之前读过我写的 V4-Flash 上手V4-Flash 的 Agent 能力,今天这篇就是它的进阶实测。老读者直接跳到第三章。

先搞清楚:V4.1 Flash 和你用过的 V4 Flash 差在哪

别看名字只差个 “.1″,这俩根本不是一回事。

V4 Flash 本质上是纯文本模型,看图片得靠外挂的 Vision-Exp 实验版,等于你维护两套模型:一个管文字,一个管图。V4.1 Flash 是原生多模态,图文从基座层面就融在一起了,不再有”视觉模块”这个外挂件。

架构上也换了血。它是 552B 参数的 MoE 模型,用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称:输入只激活 8B,输出激活 16B。翻译成人话,就是进来的便宜、出去的也不贵,成本显著低于同尺寸模型。

一句话总结:以前你要为图文分两个 endpoint 操心,现在一个 deepseek-flash 全包了。

缓存砍了 437 倍,这才是省钱的真内核

我第一个注意到的是 KV Cache。官方给了一组数据:每 token 的全局 KV Cache,V4-Flash 是 3514 字节,V4.1 Flash 直接干到 890 字节。相对初代模型,整体缩小了 437 倍。

这有什么用?对 HBM 显存的需求降到上一代的四分之一,对 SSD 的需求降到八分之一。更重要的是,在 Agent 任务里,缓存命中的费用往往占大头。你把相同的 system prompt、相同的上下文前缀喂进去,模型命中缓存后,输入价格能低到原来的零头。

重点来了:缓存压缩得越狠,缓存命中时的单价优势越夸张。所以”怎么让缓存命中”比”选哪个模型”更影响你的账单。后面第五章专门算这笔账。
实测:V4.1 Flash 高速推理管线示意
实测:V4.1 Flash 高速推理管线示意

实测:速度到底快多少

光说架构没意思,看实测。首日拿到内测资格的开发者反馈,V4.1 Flash 的生成速度稳定在每秒 280 到 500 token,峰值冲过 500。对比 V4 Flash Vision-Exp,长上下文检索快了约 5 倍,SVG 代码生成快了约 6 倍。

我自己的体感:同样让它写一个带图表的 HTML 报告,V4 Flash 要一分多钟,V4.1 Flash 二三十秒出活。端到端提效大约 5 到 6 倍,这还是保守说。

速度和省钱是一枚硬币。它吐字快,你等得短,单位时间完成的任务更多。但注意,下面踩坑章节会告诉你,快也可能是个陷阱。

场景化教程:三步把 V4.1 Flash 接进你的 Agent

痛点很明确:多模态 Agent 最烦的就是维护两套模型。下面这套我验证过,照抄就能跑。

第一步,base_url 不动,把 model 改成 deepseek-flash。这个名称现在指向最新的 V4.1 Flash。老的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时还会路由过去,但别依赖,它们迟早下线。

# 聊天调用示例(OpenAI 兼容格式)
from openai import OpenAI
client = OpenAI(api_key=”你的key”, base_url=”https://api.deepseek.com”)
resp = client.chat.completions.create(
model=”deepseek-flash”, # 指向 V4.1 Flash
messages=[
{“role”:”user”,”content”:[
{“type”:”image_url”,”image_url”:{“url”:”https://xxx/chart.png”}},
{“type”:”text”,”text”:”这张图里的趋势说明什么?”}
]}
]
)

第二步,多模态输入走标准的 image_url 字段,不用再拼视觉模型的专用接口。一张图加一段文字,模型自己就能看懂。

第三步,如果你用 WorkBuddy 或 CodeBuddy,它们已经全量接入 V4.1 Flash,连 key 都不用换,直接在模型列表里选就行。

提效数据:原来维护文本模型加视觉模型两套 endpoint,现在一个 endpoint 顶俩,显存占用只有原来的八分之一,部署成本直接砍下来。
峰谷定价与缓存命中成本示意
峰谷定价与缓存命中成本示意

成本算明白:峰谷定价怎么吃最省

9月10日中午12点起,V4.1 Flash 启用新的峰谷定价(单位:元/百万 token):

  • 输入(缓存命中):空闲 0.02,高峰 0.04
  • 输入(缓存未命中):空闲 1.0,高峰 2.0
  • 输出:空闲 4.0,高峰 8.0

高峰时段是工作日 9 点到 12 点、14 点到 18 点(北京时间),其余全是空闲,周末也是空闲。空闲价格正好是高峰的一半。

这里有个关键判断:

如果你是跑长任务的 Agent,把活儿排到空闲时段,缓存命中的输入只要 0.02 元/百万 token,比 V4 Flash 时代的 0.05 便宜了 60%。

再叠加缓存命中:别每次都换 system prompt,把固定的指令前缀钉死,让模型命中前缀缓存。命中率拉满之后,一个跑一整晚的 Agent,成本可能就几块钱。这也是为什么我说”缓存命中率比选模型更影响账单”。

踩坑章节:我也踩过的三个坑

坑一:模型名写错。有人照着老教程填 deepseek-v4-flash,以为用的是新版,其实走的是兼容路由,哪天路由一断就报错。认准 deepseek-flash 才是正牌 V4.1。

坑二:V4 Pro 被悄悄替换。官方说了,9月14日12点之后,访问 deepseek-v4-pro 的请求会全部路由到 V4.1 Flash,并按 Flash 的价格计费。你以为还在用 Pro,其实早换成 Flash 了,能力更强但别蒙在鼓里。

坑三:速度快不等于更便宜。这点是真教训。V4.1 Flash 吐字快,相同时间内 token 消耗也快,有人实测”5分钟10块钱””瞬间几十块没了”。要真省钱,得靠更少的 token 和更少的重试,而不是单纯指望它快。

我的真心话

这波我挺看好 DeepSeek 的。把快、专家、识图三种模式合成一个”智能模式”,模型自己判断复杂度、看到图就激活视觉,用户什么都不用管。再加上 KV Cache 砍到这个地步,高频 Agent 场景的门槛又低了一截。

但你记住一句话:模型越便宜,越要把缓存命中率当命根子。把前缀钉死、把任务排到空闲时段,省下的才是真金白银。

关注圈圈,持续带你玩转 AI 工具。

© 版权声明
THE END
喜欢就支持一下吧
点赞139 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容