HiDream-O1-Image

HiDream-O1-Image

核心能力

HiDream-O1-Image 是由 HiDream-ai 在 2026 年 5 月 8 日以 MIT 协议开源的 8B 参数图像生成模型。它最关键的差异化是把 VAE、文本编码器、扩散主干三件套压缩进一个Pixel-level Unified Transformer(UiT)——直接在原始 RGB 像素 patch 上做生成,不再经过潜空间压缩,这就让 2K 输出里没有”重建失真”,文字、边缘、色彩都更锐利。

关键能力包括:原生 2,048×2,048 输出;推理型 Prompt Agent(基于 Gemma-4-31B 或任意 OpenAI 兼容接口)会在生成前先”想一遍”复杂空间/多对象/多行文字描述;同一套权重原生支持文生图、指令编辑、主体个性化、长文本渲染与分镜续作。Dev 变体(28 步)适合快速迭代,完整版 50 步 + CFG 5.0 出最佳画质。

应用场景

由于没有 VAE 瓶颈,HiDream-O1-Image 在中文长文本渲染上比 FLUX.2[dev] 高出约 22 分(LongText-ZH),海报、招贴、电商详情页里的多区域多语种排版可以直出。DPG-Bench 89.83、HPSv3 10.37、GenEval 0.90 三项榜单都跑赢 GPT Image 2 与 DALL·E 3,适合品牌视觉、营销 KV、产品场景图。8B 的体量也让它可以塞进 24GB 显存的消费级 GPU 做自托管,机构内部出图成本几乎为零。

定价与可及性

HiDream-O1-Image 没有官方托管 API,主路径是从 Hugging Face 下载权重(HiDream-ai/HiDream-O1-Image 与 Dev 版)、本地或自有基础设施部署;MIT 协议允许任意商业使用,无任何限制。完整版需要 50 步推理 + 24GB+ 显存,Dev 28 步更轻;网页端可以直接到 hidreamai.app 免费试玩(带水印),商用需购买 Credit Pack 以获得授权;Pro 200B+ 版本据技术报告在内部测试,GenEval 已达 0.92,但尚未公开发布。

立即体验 HiDream-O1-Image →

 

© 版权声明
THE END
喜欢就支持一下吧
点赞149 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容