FLUX 3:Black Forest Labs 的多模态世界模型,一次生成带原生音频的 20 秒视频

FLUX 3

官方背景

FLUX 3 是德国 Black Forest Labs 于 2026 年 7 月 23 日发布的多模态基础模型,由 FLUX.1 / FLUX.2 图像系列升级而来。它不再只是图像生成器,而是用统一架构联合学习图像、视频、音频,并延伸到机器人动作预测(FLUX-mimic,与 Mimic Robotics 合作,已在奥迪产线测试)。训练基于自研 Self-Flow 自监督流匹配框架,是 BFL 迈向”视觉智能”世界模型的关键一步,官方称其目标是让模型真正学会”世界如何运作”。

核心能力

文生视频单次最长 20 秒,且同一次生成内配同步原生音频(对白、音效、环境声),支持多语言对白;② 文生视频 / 图生视频 / 视频生视频 / 音视频续写 / 关键帧转视频 / 多镜头串联;③ 物理真实感(质量、惯性、碰撞与声音绑定,读起来像实拍);④ 角色一致性(一张参考图贯穿数分钟序列);⑤ 图像生成与情境内编辑(继承 Flux Kontext 血统);⑥ FLUX 3 Dev 开放权重计划(图像 / 视频 / 音频 / 动作统一主干)。

应用场景

影视与广告(带原生音频的短片、品牌系列内容、多镜头广告);产品影片与科普讲解(物理一致的运动);老素材定点编辑与跨场景主体迁移;机器人动作预测(与 Mimic 合作的柔性装配,奥迪门封安装,响应约 101ms);开发者通过 API 与早期私有权重接入。官方人工评测显示,FLUX 3 视频对比 Seedance 2.0、Gemini Omni Flash 胜率各 52%,对比 Grok Imagine Video 胜率 69%。

定价与可及性

2026-07-23 以 Early Access 形式发布:视频与动作(FLUX-mimic)通过 API 与私有权重向精选合作伙伴开放;图像能力随 FLUX 2 Pro / API 路线逐步开放。开放权重版 FLUX 3 Dev 计划在 API 与私有权重早期体验之后推出。Web 体验可经 Morphic 等聚合平台接入 FLUX 家族。

立即体验 FLUX 3 →

FLUX 3 · FLUX 3 是德国 Black Forest Labs 于 20…

© 版权声明
THE END
喜欢就支持一下吧
点赞72 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容