CogVideo:智谱开源文生视频模型,CogVideoX 2B 单卡 16G 可跑,ICLR 2025 入选

CogVideo

官方背景

CogVideo 是智谱 AI 与清华大学 THUDM 实验室推出的开源文本生成视频模型家族,当前主力版本为 CogVideoX。在 Sora 掀起视频生成热潮、而绝大多数强模型都闭源的背景下,CogVideoX 把可用级别的视频生成能力完整开源了出来——权重、推理代码、微调代码全给。相关论文已被 ICLR 2025 接收,是学术与工程双认可的一条技术线。

核心能力

3D 因果 VAE 做时空压缩,显著降低显存与算力开销;② Expert Transformer 专家块把文本与视频两种模态深度对齐,动作连贯、不「糊成一团」;③ 提供 CogVideoX-2B 与 5B 两档——2B 版单卡 16GB 显存即可推理,消费级 4090 就能玩;④ 支持生成约 6–10 秒视频片段;⑤ 除文生视频外还支持图生视频(I2V)与视频续写;⑥ 官方开放 SAT 与 diffusers 两套推理路径,并给出完整微调脚本。

应用场景

短视频创作者做分镜验证与素材填充;广告团队做 idea 阶段的动态概念稿;游戏与影视做前期预演;开发者本地部署搭私有视频生成服务;研究者拿它做视频生成方向的 baseline 与二次微调(这是它相对闭源模型最大的价值);教学场景里让学生真正看到扩散视频模型的内部结构而非只调 API。

定价与可及性

开源免费,代码与权重托管在 GitHub(github.com/THUDM/CogVideo)与 Hugging Face,本地推理零调用费。若不想折腾环境,也可用智谱 BigModel 开放平台的商业版视频模型 API 按次计费调用。硬件门槛是当下开源视频模型里最低的一档:2B 版 16GB 显存起步,让「自己在家跑视频生成」第一次变得现实。

立即体验 CogVideo →

CogVideo · CogVideo 是智谱 AI 与清华大学 THUDM 实验室推出的开源文本生成视频模型家族,当前主…

© 版权声明
THE END
喜欢就支持一下吧
点赞109 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容