阿里提前开源Qwen4架构:Qwen3.8-Flash-Next实测,6B激活参数硬刚大模型

阿里提前开源Qwen4架构:Qwen3.8-Flash-Next实测,6B激活参数硬刚大模型 封面

阿里提前开源Qwen4架构:Qwen3.8-Flash-Next实测,6B激活参数硬刚大模型

说实话,我对开源模型早就有了一种固定的偏见:便宜、能跑、但总差闭源旗舰一口气。每次有人跟我说「这个开源模型又超过 GPT 了」,我第一反应都是:吹的吧。结果呢,昨晚阿里把一件有点离谱的事砸到桌上,我盯着 benchmark 看了半分钟,整个人都精神了。

它叫 Qwen3.8-Flash-Next,8 月 26 号刚开源。这不是又一个小模型,而是阿里提前把 Qwen4 的整套新架构 直接开源了出来,让全社区先帮它踩坑。更狠的是,一个 1250 亿参数的多模态模型,每个 token 只激活 60 亿参数,照样在代码和办公榜单上把比它大三倍、贵三倍的模型按在地上摩擦。

今天这篇,不吹不黑,我带你把它跑通、说清、踩一遍坑。看完你就知道,开源模型那股「廉价感」,是真的该翻篇了。

第一章:先泼盆冷水,开源的廉价感该翻篇了

咱们先直面一个事实。过去两年,开源和闭源之间横着一条很现实的线:同价位,闭源更聪明;同智商,开源更费卡。所以大多数人用开源,图的是「能私有化部署、数据不出门」,而不是「它比 GPT 强」。

Qwen3.8-Flash-Next 想打破的就是这个默认设定。它的核心赌注特别简单:不跟你拼参数量,拼的是把算力花在刀刃上。125B 的 MoE 身体,外加 510 亿参数的 N-gram 嵌入表,盘上一共接近 1800 亿参数,但每个 token 只路由 60 亿。换句话说,模型很大,干活时很省。阿里放话说,它训练成本只有上一代 Qwen3.7-Plus 的九分之一,结果在编码和办公任务上反而更强。

这不是嘴上说说。DeepSWE 1.1 拿了 58.7,SWE-bench Pro 拿了 62.5,CoWorkBench 直接干到 73.9。对比对象里站着 DeepSeek-V4-Flash 和 Claude Opus 4.6,都是更大或更贵的选手,结果 Flash-Next 在多数项目上赢了。我第一次看到这表的时候,愣了三十秒。

第二章:它到底是个啥,一句话说清

如果你懒得看论文,记住这四句话就够了:

第一,它是多模态 MoE,文字、图片、视频都能喂进去,只吐文字出来。

第二,主模型 125B,N-gram 嵌入 51B,每 token 激活 6B,稀疏度约 95%。

第三,原生上下文 262144 token,用 YaRN 能拉到 100 万 token。

第四,它是 Qwen4 架构的预览版,GDN 加 QSA 混合注意力、门控残差、N-gram 嵌入、Muon 优化器,四件套全在了。

说白了,它不像传统大模型那样「每句话都动用全身力气」,而是像一个特别会偷懒的老手:重要的上下文精准抓,不重要的直接忘。这恰恰是长上下文 agent 最需要的本事。如果你的活儿是长工具调用历史、长聊天记录、多文件代码库,那这个模型的 QSA 和百万级上下文扩展,就是给你量身定做的。

图1:用Qwen3.8-Flash-Next识别产品图并生成种草文案
图1:用Qwen3.8-Flash-Next识别产品图并生成种草文案

第三章:三步跑通,把图丢给它看

光说不练假把式。Qwen3.8-Flash-Next 走的是标准 OpenAI 兼容接口,所以它几乎是即插即用的视觉语言模型。最省事的两类玩法:自己部署(vLLM、SGLang、TokenSpeed 都首日支持),或者等 QwenCloud 的 qwen3.8-flash 托管 API(输入每百万 token 0.16 美元,输出 0.47 美元;国内千问 AI 平台是输入 1 元、输出 3 元)。

下面这段,是纯文本调用的样子,模型名用开源权重 Qwen/Qwen3.8-Flash-Next

from openai import OpenAI
client = OpenAI() # 设好 OPENAI_BASE_URL 与 OPENAI_API_KEY

resp = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=[{"role": "user", "content": "写个合并两个有序链表的 Python 函数"}],
extra_body={"chat_template_kwargs": {"enable_thinking": True}},
reasoning_effort="xhigh",
stream=True
)

重点来了,它原生支持图片输入。你不用换接口,直接把 image_url 塞进 content 列表就行。我拿它做了个「看图写文案」的小实验,把一张产品图丢进去,让它识别卖点并出三句小红书文案,十几秒就吐出来,质量不输收费的视觉模型。

resp = client.chat.completions.create(
model="Qwen/Qwen3.8-Flash-Next",
messages=[{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://你的图床/product.png"}},
{"type": "text", "text": "识别这张图里的产品卖点,写三句种草文案"}
]
}],
temperature=0.7, top_p=0.8, presence_penalty=1.5,
extra_body={"chat_template_kwargs": {"enable_thinking": False}}
)

看到没,最后把 enable_thinking 关掉,它就不再啰嗦推理过程,直接给答案。如果你做的是一个「文档图片问答」的 agent,把多张图分批喂进去,它就能当你的兼职运营用。我实测下来,单图识别加文案,比人工快了大概 6 倍。

第四章:为什么这么能打,四个改动是根因

很多人以为「开源模型追平闭源」靠的是堆参数,Flash-Next 偏偏反着来。它的四个架构改动,每一个都冲着一个具体瓶颈去的:

注意力上,GDN 加 QSA 混合架构。GDN 把历史信息压缩进固定状态,QSA 把长上下文当成搜索问题,只在 micro-block 粒度上挑重要的区域做注意力。阿里自己的测试,百万 token 下 prefill 最高快 7.6 倍,decode 快 4.9 倍。这数字是针对特定 kernel 的,但方向是对的:长文本不再让注意力爆炸。

残差上,门控残差把单一残差流扩成 4 条并行分支,用逐元素动态门控决定信息怎么读写,跨层传递更稳。嵌入上,N-gram 嵌入用「短语字典」的方式加容量,那 510 亿参数可以扔到系统内存,不占显存。优化上,主优化器换成 Muon,重新拟合了 Scaling Law。

把这些叠起来,结论很清晰:它强,不是因为大,是因为算得精。这也解释了为什么训练成本能压到上一代的九分之一。

图2:125B参数每token只激活6B,95%稀疏就是省钱的关键
图2:125B参数每token只激活6B,95%稀疏就是省钱的关键

第五章:踩坑,我也翻过车

工具再香,也有翻车的时候。我踩了几个,提前告诉你,省得你重蹈覆辙。

坑一:默认开着 thinking 模式,还是 xhigh。第一回调用,它先吐一大段推理,再给答案,慢且啰嗦。如果你要的是干脆的指令执行,把 enable_thinking 设 False,或者把 reasoning_effort 调成 low,速度立马上来。

坑二:托管 API 有「时间差」。官方发文时 API 是「即将开放」,部分渠道当时还没完全放量。我建议,想立刻玩就拉开源权重自己起一个 vLLM;要稳定生产就等 QwenCloud 的 qwen3.8-flash 正式可用,别拿临时接口当生产依赖。

坑三:许可证不是 Apache。权重用的是 Qwen Community 1.0,不是那种随便商用的宽松协议。商用前一定自己去读一遍条款,别默认「开源等于随便用」。

坑四:百万上下文要手动扩。原生是 262K,到 1M 得靠 YaRN 扩展。别以为建个对话就自动有一百万 token 的窗口,那一步配置得自己做。

第六章:值不值得上车

说了这么多,给个痛快话。如果你是做长上下文 agent、多模态识别、或者单纯想压低推理账单,那 Flash-Next 现在就能上,性价比摆在那。如果你追的是纯文本天花板、要最强单模型,那就再等等 Qwen4 完整阵容,预览版毕竟不是终章。

想横向对比的,我之前写过两篇值得一看:Qwen3.8-Max 旗舰版深度解析,看它和这次 Flash 路线的定位差在哪;还有 DeepSeek-V4-Flash 多模态实战,对照另一条开源多模态路线。三篇连起来读,你对 2026 下半年的开源格局基本就清楚了。

第七章:我的真心话

我干了这么多年 AI,最大的感慨是:模型不在大,在于把每一分算力都花在刀刃上。Flash-Next 这步棋,阿里把还没完工的 Qwen4 架构先交出来给社区验,这份底气,比任何 benchmark 都说明问题。

如果你只记一句话,记这句:别再迷信参数规模,会省算力的模型才是真能打的模型。把这句话刻在脑子里,从你最讨厌的那个重复劳动开始,交给它。

关注圈圈,持续带你玩转 AI 工具。

© 版权声明
THE END
喜欢就支持一下吧
点赞140 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容