第一破圈:无限时长。智象未来甩出 vivago R1
以前 AI 视频多长?15 到 30 秒,顶天了。一段想讲完的故事,得切成八瓣,还得祈祷每一瓣人设不崩。
智象未来(HiDream.ai)在 WAIC 上发了 vivago R1——一个”无限时长内容创作多模态智能体”。注意,不是生成一段素材,是自主跑完一整条链路:理解任务 → 构思故事线 → 创作分镜 → 生成素材 → 输出长视频。
核心就三个字:长、长、稳。
• 无限时长:打破行业 15—30 秒短镜头限制,短剧、专题片、品牌宣传片全品类长视频连续生成;
• 长任务思考:自主完成叙事构思、镜头排布、风格校准,专治画面跳变、人设崩塌;
• 高稳定生成:依托 HD-AgentOS 调度,商业可用成功率干到 85%。
• 无限时长:打破行业 15—30 秒短镜头限制,短剧、专题片、品牌宣传片全品类长视频连续生成;
• 长任务思考:自主完成叙事构思、镜头排布、风格校准,专治画面跳变、人设崩塌;
• 高稳定生成:依托 HD-AgentOS 调度,商业可用成功率干到 85%。
这意味着啥?过去要剪辑师熬通宵的活儿,现在 AI 能一口气给你连续生成了。
第二破圈:实时交互。生数 Vidu S1 让数字人”活”了
传统视频大模型啥样?输入提示词 → 等生成 → 看结果。人和视频是”生成与观看“的离线关系,想改个动作?重新生成去吧。
生数科技 Vidu S1 是实时交互模型。视频通话里你持续说话,角色实时跟着动。它把数字人从”语音驱动口型”,升级成”语音控制行为”——表情、眼神、手势、全身动作,实时生成。
还能无限时长连续互动。这不就是科幻片里的 AI 伴侣,照进现实了?
第三破圈:开源。蚂蚁灵波把视频基模献给机器人
蚂蚁灵波开源 LingBot-Video,全球首个面向具身智能的开源视频生成基础模型。架构是 DiT + MoE,30B 总参数只激活 3B,推理效率约 3 倍。
关键不只是画质,是”物理合理性“——生成的机器人动作得符合真实物理规律。在 RBench 基准上总分 0.620,压过 Wan2.6、Seedance 1.5 Pro。
我的判断:AI视频,从”工具”变成了”团队”
这三件事,指向同一个方向:AI视频不再是一个生成单点素材的工具,而是一个能自主完成长链路创作的”智能体团队“。
- 对创作者:抽卡时代正在结束。你给目标,它给成品。
- 对产业:视频生成正从创意辅助,变成生产力工具,嵌进工业仿真、具身智能、智能驾驶。
- 但别高兴太早——85% 成功率还不够,距离”随便用”还有路。可这势头,挡不住了。
圈圈想问一句:这三条线里,你最看好哪条?无限时长、实时交互,还是开源具身?评论区聊聊,我挨个回。
—— 圈圈
没有回复内容