通义万相(Tongyi Wanxiang / Wan)是阿里巴巴通义实验室(Tongyi Lab of Alibaba Group)推出的 AI 视觉生成套件,也是目前业内首个以 Apache 2.0 协议开源的视频生成大模型系列,GitHub 累计 Star 数已突破 3.3 万。Wan 系列覆盖文生图、文生视频、图生视频、首尾帧控制、视频扩展(Outpainting)、画质超分等全栈视觉生成能力,是全球开源生态最活跃的视频生成模型之一。
核心能力
通义万相提供从轻量到顶配的多档模型,满足不同场景需求:
- Wan 2.7(最新版本):支持指令视频编辑(按文本指令重绘画面、剧情与场景)、创意视频迁移(一键复刻复杂人物动作和电影级运镜)、无限时长时间扩展(帧引导续写 + 无限视频外延)、人像定制(骨骼/眼睛/面部细节)、12 种语言长文本渲染、多图融合(最多 9 张图融合为一个创意)、连续故事生成(最多 12 张风格一致的序列图像)、像素级框选编辑(精确指定创意意图)。
- Wan 2.2(广泛部署版):业内首创 Mixture-of-Experts(MoE)视频扩散架构,将去噪过程分配给不同时间步的专家模型,在不增加推理成本的前提下显著提升运动控制能力;支持 720P / 24 fps 高清输出,提供 1.3B(轻量)和 14B(高质量)双参数版本,兼容消费级 GPU。训练数据相较前代扩增 65.6% 图像 + 83.2% 视频,复杂运动渲染跻身全球第一梯队。
- 数字人 Wan 2.2-s2v:基于单张图片 + 一段音频即可生成动作自然的说话、唱歌或表演视频,支持肖像 / 半身 / 全身画幅,输出 480P / 720P,覆盖真人或卡通形象,是国内最具性价比的数字人视频方案之一。
应用场景
通义万相凭借”全栈能力 + 开源可商用”,在以下场景被大量采用:
- 广告与电商营销:商品展示视频、动态海报、社交媒体短素材批量生成,大幅降低短视频制作成本。
- 短视频与自媒体:电影感镜头语言精细控制(光影/色彩/构图),让故事化短片、人物短片表现力大幅提升。
- 数字人与虚拟主播:单图 + 音频即可生成会说话、会唱歌的虚拟形象视频,适合企业宣传、虚拟客服、教育内容。
- 教育与科研:开源模型可本地部署,适合学术研究、复现实验、二次开发和教学演示。
- 游戏与动画预演:人物动作预演、镜头预演、概念图迭代,缩短前期制作周期。
定价与可及性
通义万相提供多层级的接入方式,覆盖从个人体验到企业生产:
- 网页端免费体验:访问 wan.video 即可试用 Wan 2.7 全功能(文生视频、图生视频、指令编辑、视频扩展等),无需注册即可生成。
- 阿里云百炼 API(按量付费):Wan 2.2 1.3B 文生视频约 $0.12 / 次;14B 文/图生视频约 $0.28 / 次;数字人 wan2.2-s2v 480P 0.5 元/秒、720P 0.9 元/秒,新用户有 100 秒免费额度。
- 开源本地部署:Wan 系列权重与推理代码以 Apache 2.0 协议开源,开发者可下载权重在消费级显卡上自行部署,完全免费、可商用。
无论你是想零门槛在线体验,还是需要API 批量接入到生产流水线,亦或是希望自托管深度定制,通义万相都是当前开源 AI 视频赛道里最成熟的选择之一。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END
暂无评论内容