![]()
官方背景
CogView 是智谱 AI(Zhipu AI)与清华大学 THUDM 实验室联合研发的文本生成图像模型系列,从 CogView、CogView2、CogView3 一路迭代到最新的 CogView-4。它和 ChatGLM 出自同一支团队,走的是彻底的开源路线——CogView-4 以 Apache 2.0 许可发布权重,可自由商用、可本地部署,这在同级别文生图模型里相当罕见(对比 SD3 的受限许可)。这是国产开源多模态生成能力的代表作之一。
核心能力
① 约 6B 参数的 DiT(Diffusion Transformer)架构,配合中英双语文本编码器;② 首个能在图中正确渲染中文汉字的开源文生图模型——海报、封面、带字设计不再乱码;③ 支持 512×512 至 2048×2048 任意分辨率与任意长宽比;④ 在 DPG-Bench 综合指标上取得开源模型第一,长提示词遵循能力强;⑤ 支持超长中文提示词输入,语义理解不截断;⑥ 权重在 Hugging Face / ModelScope 开放,也可通过智谱 BigModel 开放平台 API 直接调用。
应用场景
中文海报、公众号封面、电商主图这类必须把字写对的设计需求,是 CogView-4 最锋利的场景;设计师做概念图与风格探索;开发者本地部署做私有化生图服务,数据不出域;企业接 API 批量生成营销素材;研究者拿 Apache 2.0 权重做二次微调、做 LoRA 风格模型。想要「免费商用 + 中文强 + 能写字」的组合,它基本是当下唯一解。
定价与可及性
开源权重完全免费(Apache 2.0),本地部署零调用费,消费级显卡即可跑起来。云端可通过智谱 BigModel 开放平台(bigmodel.cn)按张 / 按 token 计费调用,新注册账号有免费额度可试。文档见 docs.bigmodel.cn,代码与权重在 GitHub(THUDM)与 Hugging Face 同步开放,从个人玩票到企业私有化都能低成本起步。
CogView · CogView 是智谱 AI(Zhipu AI)与清华大学 THUDM 实验室联合研发的文本生成图像…
暂无评论内容