![]()
官方背景
GLM-4V(又名 GLM-V)是智谱 AI 与清华大学 THUDM 联合推出的开源多模态视觉语言模型,基于 GLM-4-9B 底座扩展而来。它不是纯文本模型加点图像接口的简版,而是从训练阶段就做了中英双语、图文混合的打磨,尤其在中文 OCR 与文档理解上做了专项优化——对中文场景下的表格、公式、招牌、扫描件识别明显强于通用视觉模型。以 MIT 许可开源权重,可自由商用与本地部署,是国产多模态开源里的主力选手之一。
核心能力
① 1120×1120 高分辨率输入:原生支持高分辨率图像,看文档、看图表细节不丢;② 中英双语多轮图文对话,中文 OCR / 文档理解专项优化;③ 9B 参数的紧凑规模,FP16 权重约 18GB,BF16 推理至少 24GB 显存(RTX 3090 / 4090 / A10 / A100 可跑),4-bit 量化后降至约 9–11GB,RTX 3060 / 4070 这类消费级卡也能跑;④ MMMU 评测约 48.3;⑤ 支持 ModelScope / Hugging Face 下载,可用 vLLM 起 OpenAI 兼容服务,吞吐数倍于原生 Transformers。
应用场景
中文文档 / 票据 / 表格识别:拍张发票或论文页,直接问核心观点与数字;教育辅导:上传数学题 / 化学方程式截图解析步骤;电商与内容:商品图自动生成卖点文案;无障碍:为视障用户描述照片内容;私有化部署:对数据敏感的企业把模型放在内网,做智能安检、医疗影像辅助等。想「免费 + 中文强 + 消费级显卡能跑」的多模态模型,GLM-4V 是很务实的选择。
定价与可及性
开源权重完全免费(MIT),本地部署零调用费,消费级显卡即可起步——FP16 需 24GB 显存,4-bit 量化约 9GB 即可。云端可通过智谱 BigModel 开放平台(bigmodel.cn)按 token 计费调用(参考价输入约 $0.05 / 百万 token、输出约 $0.25 / 百万 token)。权重与推理代码在 ModelScope(ZhipuAI/glm-4v-9b)与 Hugging Face 同步开放,按官方保姆级教程用 transformers≥4.44 + 一张 4090 就能本地跑起来。
GLM-4V · GLM-4V(又名 GLM-V)是智谱 AI 与清华大学 THUDM 联合推出的开源多模态视觉语言模…
暂无评论内容