
DeepSeek又整活了!V4.1 Flash实测:原生多模态+缓存砍437倍,Agent跑一晚几块钱
说实话,我对 DeepSeek 上个月那波涨价早有意见了。8月13日 V4 Pro 上线,峰谷一拉开,高峰时段价格直接翻倍,不少开发者的账单当场涨了三倍。那段时间圈子里全是”用不起、求平替”的哀嚎,连我司写代码的同事都把主力换成了别的模型。
结果呢?9月10日,DeepSeek 反手甩出 V4.1 Flash。这玩意儿不光能力全面超过 V4 Pro,还把价格砍回了原点。我把刚转到别家的同事都看愣了。这篇文章不吹不黑,只讲一件事:V4.1 Flash 到底新在哪,以及你手上的 Agent 怎么把成本算明白。
如果你之前读过我写的 V4-Flash 上手 和 V4-Flash 的 Agent 能力,今天这篇就是它的进阶实测。老读者直接跳到第三章。
先搞清楚:V4.1 Flash 和你用过的 V4 Flash 差在哪
别看名字只差个 “.1″,这俩根本不是一回事。
V4 Flash 本质上是纯文本模型,看图片得靠外挂的 Vision-Exp 实验版,等于你维护两套模型:一个管文字,一个管图。V4.1 Flash 是原生多模态,图文从基座层面就融在一起了,不再有”视觉模块”这个外挂件。
架构上也换了血。它是 552B 参数的 MoE 模型,用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称:输入只激活 8B,输出激活 16B。翻译成人话,就是进来的便宜、出去的也不贵,成本显著低于同尺寸模型。
一句话总结:以前你要为图文分两个 endpoint 操心,现在一个 deepseek-flash 全包了。
缓存砍了 437 倍,这才是省钱的真内核
我第一个注意到的是 KV Cache。官方给了一组数据:每 token 的全局 KV Cache,V4-Flash 是 3514 字节,V4.1 Flash 直接干到 890 字节。相对初代模型,整体缩小了 437 倍。
这有什么用?对 HBM 显存的需求降到上一代的四分之一,对 SSD 的需求降到八分之一。更重要的是,在 Agent 任务里,缓存命中的费用往往占大头。你把相同的 system prompt、相同的上下文前缀喂进去,模型命中缓存后,输入价格能低到原来的零头。

实测:速度到底快多少
光说架构没意思,看实测。首日拿到内测资格的开发者反馈,V4.1 Flash 的生成速度稳定在每秒 280 到 500 token,峰值冲过 500。对比 V4 Flash Vision-Exp,长上下文检索快了约 5 倍,SVG 代码生成快了约 6 倍。
我自己的体感:同样让它写一个带图表的 HTML 报告,V4 Flash 要一分多钟,V4.1 Flash 二三十秒出活。端到端提效大约 5 到 6 倍,这还是保守说。
速度和省钱是一枚硬币。它吐字快,你等得短,单位时间完成的任务更多。但注意,下面踩坑章节会告诉你,快也可能是个陷阱。
场景化教程:三步把 V4.1 Flash 接进你的 Agent
痛点很明确:多模态 Agent 最烦的就是维护两套模型。下面这套我验证过,照抄就能跑。
第一步,base_url 不动,把 model 改成 deepseek-flash。这个名称现在指向最新的 V4.1 Flash。老的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时还会路由过去,但别依赖,它们迟早下线。
from openai import OpenAI
client = OpenAI(api_key=”你的key”, base_url=”https://api.deepseek.com”)
resp = client.chat.completions.create(
model=”deepseek-flash”, # 指向 V4.1 Flash
messages=[
{“role”:”user”,”content”:[
{“type”:”image_url”,”image_url”:{“url”:”https://xxx/chart.png”}},
{“type”:”text”,”text”:”这张图里的趋势说明什么?”}
]}
]
)
第二步,多模态输入走标准的 image_url 字段,不用再拼视觉模型的专用接口。一张图加一段文字,模型自己就能看懂。
第三步,如果你用 WorkBuddy 或 CodeBuddy,它们已经全量接入 V4.1 Flash,连 key 都不用换,直接在模型列表里选就行。

成本算明白:峰谷定价怎么吃最省
9月10日中午12点起,V4.1 Flash 启用新的峰谷定价(单位:元/百万 token):
- 输入(缓存命中):空闲 0.02,高峰 0.04
- 输入(缓存未命中):空闲 1.0,高峰 2.0
- 输出:空闲 4.0,高峰 8.0
高峰时段是工作日 9 点到 12 点、14 点到 18 点(北京时间),其余全是空闲,周末也是空闲。空闲价格正好是高峰的一半。
这里有个关键判断:
再叠加缓存命中:别每次都换 system prompt,把固定的指令前缀钉死,让模型命中前缀缓存。命中率拉满之后,一个跑一整晚的 Agent,成本可能就几块钱。这也是为什么我说”缓存命中率比选模型更影响账单”。
踩坑章节:我也踩过的三个坑
坑一:模型名写错。有人照着老教程填 deepseek-v4-flash,以为用的是新版,其实走的是兼容路由,哪天路由一断就报错。认准 deepseek-flash 才是正牌 V4.1。
坑二:V4 Pro 被悄悄替换。官方说了,9月14日12点之后,访问 deepseek-v4-pro 的请求会全部路由到 V4.1 Flash,并按 Flash 的价格计费。你以为还在用 Pro,其实早换成 Flash 了,能力更强但别蒙在鼓里。
坑三:速度快不等于更便宜。这点是真教训。V4.1 Flash 吐字快,相同时间内 token 消耗也快,有人实测”5分钟10块钱””瞬间几十块没了”。要真省钱,得靠更少的 token 和更少的重试,而不是单纯指望它快。
我的真心话
这波我挺看好 DeepSeek 的。把快、专家、识图三种模式合成一个”智能模式”,模型自己判断复杂度、看到图就激活视觉,用户什么都不用管。再加上 KV Cache 砍到这个地步,高频 Agent 场景的门槛又低了一截。
但你记住一句话:模型越便宜,越要把缓存命中率当命根子。把前缀钉死、把任务排到空闲时段,省下的才是真金白银。
关注圈圈,持续带你玩转 AI 工具。
暂无评论内容