通义万相

通义万相 Logo

通义万相(Tongyi Wanxiang / Wan)是阿里巴巴通义实验室(Tongyi Lab of Alibaba Group)推出的 AI 视觉生成套件,也是目前业内首个以 Apache 2.0 协议开源的视频生成大模型系列,GitHub 累计 Star 数已突破 3.3 万。Wan 系列覆盖文生图、文生视频、图生视频、首尾帧控制、视频扩展(Outpainting)、画质超分等全栈视觉生成能力,是全球开源生态最活跃的视频生成模型之一。

核心能力

通义万相提供从轻量到顶配的多档模型,满足不同场景需求:

  • Wan 2.7(最新版本):支持指令视频编辑(按文本指令重绘画面、剧情与场景)、创意视频迁移(一键复刻复杂人物动作和电影级运镜)、无限时长时间扩展(帧引导续写 + 无限视频外延)、人像定制(骨骼/眼睛/面部细节)、12 种语言长文本渲染多图融合(最多 9 张图融合为一个创意)、连续故事生成(最多 12 张风格一致的序列图像)、像素级框选编辑(精确指定创意意图)。
  • Wan 2.2(广泛部署版):业内首创 Mixture-of-Experts(MoE)视频扩散架构,将去噪过程分配给不同时间步的专家模型,在不增加推理成本的前提下显著提升运动控制能力;支持 720P / 24 fps 高清输出,提供 1.3B(轻量)14B(高质量)双参数版本,兼容消费级 GPU。训练数据相较前代扩增 65.6% 图像 + 83.2% 视频,复杂运动渲染跻身全球第一梯队。
  • 数字人 Wan 2.2-s2v:基于单张图片 + 一段音频即可生成动作自然的说话、唱歌或表演视频,支持肖像 / 半身 / 全身画幅,输出 480P / 720P,覆盖真人或卡通形象,是国内最具性价比的数字人视频方案之一。

应用场景

通义万相凭借”全栈能力 + 开源可商用”,在以下场景被大量采用:

  • 广告与电商营销:商品展示视频、动态海报、社交媒体短素材批量生成,大幅降低短视频制作成本。
  • 短视频与自媒体:电影感镜头语言精细控制(光影/色彩/构图),让故事化短片、人物短片表现力大幅提升。
  • 数字人与虚拟主播:单图 + 音频即可生成会说话、会唱歌的虚拟形象视频,适合企业宣传、虚拟客服、教育内容。
  • 教育与科研:开源模型可本地部署,适合学术研究、复现实验、二次开发和教学演示。
  • 游戏与动画预演:人物动作预演、镜头预演、概念图迭代,缩短前期制作周期。

定价与可及性

通义万相提供多层级的接入方式,覆盖从个人体验到企业生产:

  • 网页端免费体验:访问 wan.video 即可试用 Wan 2.7 全功能(文生视频、图生视频、指令编辑、视频扩展等),无需注册即可生成。
  • 阿里云百炼 API(按量付费):Wan 2.2 1.3B 文生视频约 $0.12 / 次14B 文/图生视频约 $0.28 / 次;数字人 wan2.2-s2v 480P 0.5 元/秒、720P 0.9 元/秒,新用户有 100 秒免费额度。
  • 开源本地部署:Wan 系列权重与推理代码以 Apache 2.0 协议开源,开发者可下载权重在消费级显卡上自行部署,完全免费、可商用

无论你是想零门槛在线体验,还是需要API 批量接入到生产流水线,亦或是希望自托管深度定制,通义万相都是当前开源 AI 视频赛道里最成熟的选择之一。

© 版权声明
THE END
喜欢就支持一下吧
点赞135 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容