![]()
核心能力
HiDream-O1-Image 是由 HiDream-ai 在 2026 年 5 月 8 日以 MIT 协议开源的 8B 参数图像生成模型。它最关键的差异化是把 VAE、文本编码器、扩散主干三件套压缩进一个Pixel-level Unified Transformer(UiT)——直接在原始 RGB 像素 patch 上做生成,不再经过潜空间压缩,这就让 2K 输出里没有”重建失真”,文字、边缘、色彩都更锐利。
关键能力包括:原生 2,048×2,048 输出;推理型 Prompt Agent(基于 Gemma-4-31B 或任意 OpenAI 兼容接口)会在生成前先”想一遍”复杂空间/多对象/多行文字描述;同一套权重原生支持文生图、指令编辑、主体个性化、长文本渲染与分镜续作。Dev 变体(28 步)适合快速迭代,完整版 50 步 + CFG 5.0 出最佳画质。
应用场景
由于没有 VAE 瓶颈,HiDream-O1-Image 在中文长文本渲染上比 FLUX.2[dev] 高出约 22 分(LongText-ZH),海报、招贴、电商详情页里的多区域多语种排版可以直出。DPG-Bench 89.83、HPSv3 10.37、GenEval 0.90 三项榜单都跑赢 GPT Image 2 与 DALL·E 3,适合品牌视觉、营销 KV、产品场景图。8B 的体量也让它可以塞进 24GB 显存的消费级 GPU 做自托管,机构内部出图成本几乎为零。
定价与可及性
HiDream-O1-Image 没有官方托管 API,主路径是从 Hugging Face 下载权重(HiDream-ai/HiDream-O1-Image 与 Dev 版)、本地或自有基础设施部署;MIT 协议允许任意商业使用,无任何限制。完整版需要 50 步推理 + 24GB+ 显存,Dev 28 步更轻;网页端可以直接到 hidreamai.app 免费试玩(带水印),商用需购买 Credit Pack 以获得授权;Pro 200B+ 版本据技术报告在内部测试,GenEval 已达 0.92,但尚未公开发布。
暂无评论内容