视频看了这么久,今天终于能”玩”了!智象HiDream-O1-World实操:全球首款可交互世界模型,逛一遍世界还替你记着

视频看了这么久,今天终于能

第一章 视频看了这么多年,今天终于能”玩”了

你有没有想过一个问题:我们看了三年的 AI 视频,可从来没”进去”过。

文生视频的逻辑是单向的——你给提示词,它吐一段画面,你看。哪怕生成得再逼真,你始终是观众,进不去那个空间,改不了那个世界,更没法让它接着演。

8 月 17 号,智象未来(HiDream.ai)甩出一个狠角色:HiDream-O1-World,全球首款原生全模态交互式世界模型。注意这两个词——”交互式”和”世界模型”。它不生产一段视频,它造一个你能逛、能改、能持续推演的世界。

一句话区别:视频生成关心”下一帧像不像”,世界模型还得关心”下一步对不对”。这中间的鸿沟,比你想的大得多。

第二章 三个模式:逛、改、控

HiDream-O1-World 给了你三件套:漫游、编辑、交互,输入方式也随意——一段文字、一张图片、甚至直接上手拖,都能一键生成结构完整、质感细腻的世界。

先看漫游模式。你像真进了那个世界,屏幕左下角有移动控件,能驱动角色前进、转向,还能第一人称和第三人称自由切换。官方给的例子是登雪山:人往前走,前方的路和周围景物实时更新;你原路返回,刚才的地形居然还在——没有重置,没有穿帮。

再看编辑模式,这个更上头。你能让角色当场抓取、奔跑、下蹲、跳跃,也能调度环境:触发一场雨、让物体砸落。有个骑行案例:输入”天气变成雷雨天”,晴天瞬间电闪雷鸣、雨点砸地溅起水花;再输入”变成太阳雨”,阴云渐亮、湿路面反射阳光。整个画面是统一变化的,不是局部贴图,音视频还同步。

风格也管够:写实城市、自然地貌、室内空间,到二次元、幻想异世界、3A 游戏渲染;角色从人类、动物到虚构异兽,每种都踩准自己的运动节奏。

Memory 维护一张持续更新的空间地图,TTT 每次转视角实时校准——人走了,世界还在
Memory 维护一张持续更新的空间地图,TTT 每次转视角实时校准——人走了,世界还在

第三章 凭什么不漂移、不失忆

交互式世界模型有个老大难:镜头一转,物体就漂移、变形、甚至凭空消失;视角稍微动一动,刚生成的物件就没了。这叫”世界没有记忆”。

HiDream-O1-World 的杀手锏,是底层那套自研的 UiT(原生全模态)架构。传统多模态是”拼接”的——文本一个编码器、图像一个 VAE、视频一个模块,各干各的再翻译。UiT 直接把这些全扔了,把图像像素、文本、视频、音频、动作、空间坐标统一塞进同一个 Token 空间,让一套 Transformer 同时理解、生成、推理。

在这个架构上,它用 Memory + TTT 双机制 解决”记不住”的毛病:

  • Memory(3D 先验记忆注入):生成时同时维护一张持续更新的”空间地图”,记着几何结构、物体位置和遮挡关系——人走了,世界不刷新;
  • TTT(Test-Time Training 推理在线自适应):每次移动、每次转视角,模型用轻量 LoRA 实时校准自己,让生成严格贴合 3D 几何约束。

说白了:Memory 负责记住这个世界,TTT 负责在变化里不断校准这个世界。两者合力,才换来那句最实在的承诺:人走了,世界还在

第四章 物理一致性:下一步对不对

光空间不漂还不够,物理得讲理。世界模型最怕的是什么?人物穿墙、物体悬浮、碰撞反重力——一眼假,沉浸感瞬间崩塌。

智象在物理一致性上是”数据和架构双轮驱动”:训练阶段往里猛灌物理难例数据——刚体碰撞、流体运动、柔性形变、重力抛射、光影变化,让模型反复学”状态变了之后结果该是什么样”;推理阶段再用 TTT 针对当前场景的材质和物体在线微调。

效果有多实在?官方披露:在”画面运动是否符合常识物理”的视觉合理性评测里,比行业平均提升 13.6%;在更难的因果保真度评测里提升 12.7%

记住那句话:视频关心下一帧像不像,世界模型还要关心下一步对不对。这 12.7% 的差距,就是”会动的画面”和”真实的世界”之间的距离。

WBench Navi 分榜登顶 80.9,物理维度 73.3 第一、一致性维度 88.0
WBench Navi 分榜登顶 80.9,物理维度 73.3 第一、一致性维度 88.0

第五章 一上来就登顶 WBench

光自己说强没用,得有第三方基准。由美团 LongCat 团队和复旦大学联合推出的 WBench,是业内首个面向交互式世界模型的系统性评测基准(289 个多轮交互案例、22 项指标)。

HiDream-O1-World 首次参评就登顶 Navi 分榜(聚焦空间导航与视角控制),关键分数:

  • 综合平均 80.9,分榜第一;
  • 物理维度(Physical)73.3,直接超过腾讯混元 1.5、阿里”快乐生蚝”;
  • 一致性维度(Consistency)88.0,长时程记忆和空间结构稳得离谱。

同场竞技的还有腾讯 HY-World、阿里 Wan、Kling 3.0 等一众选手,它把”物理一致性”这条差异化标签焊死在自己身上。相关核心技术论文 DreamWorld 已被 ECCV 2026 录用,过了学术同行评审这一关。

第六章 它能拿来干什么

如果只把它当个更自由的视频播放器,那就小看它了。世界一旦具备”持续状态 + 物理一致 + 实时交互”,它就开始抢游戏引擎、3D 软件、仿真平台的一部分活儿。

AI 互动影游:观众不再是被动看剧情,而是主动参与者,世界随你探索沿不同分支演进,多重结局随便逛。具身智能仿真:一键搭出高度还原、遵循物理的城市、工厂、室内空间,给机器人训练、自动驾驶、智能制造当虚拟试验场,把高成本高风险实景测试替掉。3D 场景生产:3D 手办、家居、艺术空间说生就生,甚至向微观延伸——模拟细胞行为、蛋白互作,给药物发现开数字仿真的新路。

顺带提一句公司背景:智象未来 7 月刚完成 15 亿 C 轮融资,三个月累计超 21 亿,正式跨进独角兽行列。发这个模型,等于从”多模态生成公司”正式迈入”世界模型”赛道。

第七章 普通人现在能怎么上手

说了这么多,落到你身上怎么玩?

模型今天(8 月 17 日)刚发布,主打”低门槛造世界”:一段文字描述、一张照片,或者简单拖几下,就能生成可漫游、可编辑的交互世界。想最快尝鲜,就从你手边的一张室内照片开始——上传它,看模型怎么把整间房的数字孪生空间补全,再切到第一人称进去走走,感受一下”回头场景还在”的奇妙。

想玩出花,试试编辑模式:先生成个晴天街景,再输入”变成雷雨天”,看整座城怎么统一地暗下来、湿起来。这种”我改一下,世界就跟着变”的掌控感,是过去所有文生视频都给不了的。

一句话收尾:当物理世界能被一键生成、自由交互,很多行业都值得被重新想象一遍。而这一遍,从今天开始。

(本文为实操科普分享,具体功能与开放时间以智象未来官方公告为准。)

© 版权声明
THE END
喜欢就支持一下吧
点赞90 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容