
一个人干四个工种快熬吐了?千问Agent Teams实测:你只当甲方,AI组个剧组替你出片
说实话,我对”一句话出片”这类宣传早就免疫了。
从去年开始,多少工具号称输入一句话就能出成片?结果呢?出来的东西人物换脸、镜头乱飞、配音跟画面脱节。真要做一条能看的短剧,你得自己当编剧写本子,自己当美术定角色,自己去视频模型里一条条抠镜头,最后还得自己剪。四个工种,一个人扛。我做过,做完那种累不是身体累,是脑子被反复切换搞得发木。
8 月 31 日,千问创作上线了一个叫 Agent Teams 的功能。我抱着”又来”的心态点进去,结果愣了三十秒:它没让我写提示词,它问我”你想讲个什么故事”。然后自己把编剧、导演、美术、摄影、剪辑一个个叫出来干活了。
第一章 先说结论:这次变的不是模型,是”谁来干活”
先把判断放前面。Agent Teams 最值钱的地方不在视频画质,而在它把创作方式从”写提示词”改成了”提创意”。
过去你和 AI 的关系是:你必须学会它的语言。角色一致性怎么锚、镜头运动怎么描述、参考图怎么喂,全是你的功课。你稍微偷懒,出片就崩。
现在这个关系反过来了。你说一句大白话,系统自己拆任务、自己排工序、自己点兵派将。编剧写剧本,导演做分镜,美术定角色设定,摄影生成画面,剪辑拼成片,各司其职依次交接。你从”又写又画又剪的制片主任”,退化成一个提需求、做验收的甲方。
这是两种完全不同的产品思路。一键生成类工具卖的是”省事”,Agent Teams 卖的是”分工”。省事的东西你没法改,分工的东西你可以随时插手。
底层模型这次首发接的是阿里 Wan 3.0 视频模型,还有速度更快的 Prime 满血版;图像侧用 Qwen-Image-3.0 出角色设定和分镜图。Wan 3.0 单段最长能生成 30 秒,支持文本、图片、音频、视频,甚至 PDF/Word/PPT 文档当参考输入,角色一致性和推拉摇移的镜头控制都能调。

第二章 三步跑通:一句创意到一集短剧,我是这么走的
入口很好找:千问创作 PC 端 c.qianwen.com,或者直接用千问 App,两边项目互通。已面向全部用户开放,不用申请白名单。
第一步,跟”创作助手”聊清楚你要什么。
别急着写长提示词,就用大白话丢一句故事梗概进去。@创作助手 会立刻帮你拆解想法,然后像个执行制片人那样在关键节点反过来问你:故事走向要哪个?主角性格是哪种?它甚至会给避坑建议。
帮我做一集三分钟的都市奇幻短剧,主角是个每天挤地铁的年轻人
某天发现地铁到站广播能预言未来一小时的事
风格要压抑一点,结尾留个反转
第二步,让各个工位依次上工。
整个界面的体感就像一个微信群。@编剧 出大纲和剧本,@导演 排分镜,@美术 定角色设定,@摄影 逐镜头生成画面,@剪辑 拼成片,配乐同时在写 BGM。每个角色干自己的活,互不干扰。
关键在这儿:摄影不会直接开始烧算力。它会先把十几条镜头提示词写出来摆到你面前,等你审阅、修改、点头,才真正开始生成。视频生成是全流程里最贵最慢的一环,把人的判断插在生成之前而不是之后,比多加几个自动化环节实在得多。
第三步,不满意就 @ 谁改谁。
成片出来后项目并没有结束。哪个镜头别扭,直接 @摄影 单独重做那一段,不用推倒重来。配乐不对味,@配乐 重写,前面确定的镜头不会被带崩。要是你说不清哪儿不舒服,把 @创作助手 这个”监工”叫出来,纯用感受描述,它帮你判断该找谁解决。
如果你完全没做过视频,建议先照着 AI漫剧从剧本到成片的全流程实操 手动走一遍,搞明白编剧、美术、摄影各自在解决什么问题。摸清分工逻辑再用 Agent Teams,你才知道该验收什么。如果你已经手工跑通过全流程,直接上手,第一条就能感受到省在哪。

第三章 最狠的一个设计:Agent 之间传的不是废话,是能改能回滚的交付物
这一章是我最想讲的。很多号称多智能体的产品,Agent 之间传的是一段自然语言转述,A 跟 B 说”你按刚才那个感觉画”,传三轮就走形了。
Agent Teams 不一样。它们之间传递的是结构化中间产物:讲戏本、角色资产、镜头提示词表。这些东西全摆在你眼前,能看、能改、能回滚。
这意味着什么?意味着这是一条每个工位都有明确交付物、且每份交付物都对人开放的流水线,不是黑箱。你想在第三个工位插手,就在第三个工位插手,不用从头再来。
上下文管理也扎实。机器之心实测做了一条《JoJo 的奇幻买瓜》,中途强行加戏:把主角骑的重型摩托改成破旧小电驴,还丢了张参考图进去,同时把视频模型从 720P 切到 1080P。三个东西一起动,这个 Agent Team 稳稳接住了,后面的剪辑也没张冠李戴。
对比一下就懂这有多难。你要是用代码搭过多智能体系统,就知道状态怎么传、上下文怎么不丢,是LangGraph 这类框架里最费神的部分。Agent Teams 把这件事做成了消费级产品,不用写一行代码。
第四章 算笔账:0.26元/秒,半小时一集,钱花在哪
创作者最关心的还是钱。我把公开的价格摆出来:
- Wan 3.0 在千问创作上的价格约 0.26 元/秒
- 按包年高级会员算,1080p 一集平均下来大约 5 毛钱一秒
- 实测有创作者半小时做出一集短剧,镜头、配音、剪辑全是平台直出
但真正省的不只是钱。是等待时间可以被复用。以前你在视频模型那边排队等出片,只能干等。现在等待的同时你可以调用别的工位干下一步,成本、精力、时间三重释放。
有个 5 人漫剧工作室的负责人说得实在:做真人影视一部古装剧投资动辄几千万,基本融不到资;现在做 AI 不受那么多限制,更多看你有没有想象力。他们团队月产量在 500 到 600 分钟。
换句话讲,这波最利好的不是大厂,是没团队没预算的个体创作者和小工作室。大厂上千人配合的流程本来就顺,你一个人以前根本没法比。现在差距被工具抹掉了一大截。
第五章 它不完美:我踩过的三个坑
吹完了说实话的部分。我不觉得这东西现在能”一句话全自动出爆款”,谁这么讲你别信。
坑一:成片第一版基本都要返工。现象是角色 Agent 之间的协同质量参差,某个镜头风格突然跳脱。根因在视频模型对复杂动作和多人交互的控制力还不够。解法是别指望一遍过,把它当”能自动出初版的助手”,然后退回镜头环节挨个微调,迭代两三轮效果会明显好一截。
坑二:镜头提示词表你必须认真看。现象是十几条提示词一路点确认,全跑完才发现方向偏了,钱白烧。根因是提示词写得完整但不一定符合你脑子里那版。解法是把审阅当正事做,尤其检查角色描述和镜头运动,这一步花五分钟能省几十块算力。
坑三:想清楚它更适合当辅助还是当主力。现象是有人拿它直接产商业交付,结果反复修改比手工还慢。根因是从”能跑通”到”能交付”,中间隔着人的验证和多轮优化。解法是先用它跑分镜和脚本,视觉部分你自己把关,成熟一点再往全自动推。
第六章 我的真心话
这半年我看下来,最大的感受不是技术多牛,是门槛真的在往下掉。
半年前做一条漫剧,光把工具链跑通就得学一堆东西,什么模型出什么活、参考图怎么喂、一致性怎么锚,全是隐性知识。现在一个大白话创意丢进去,就有一堆 Agent 帮你把活拆了。除了短剧,营销广告、音乐 MV、游戏内容都有对应的专业 Agent Teams 承接。
它不会让你直接躺着挣钱。该验收还是要验收,该返工还是要返工。但它把你从”四个工种缝合怪”变回了一个只需要有想法的人。这个转变,对个体创作者来说比任何参数提升都重要。
给你一条具体的上手路径:拿你手头一个想拍但一直没动的选题,先自己手动拆成编剧、导演、美术、视频四步走一遍,体会多角色协作到底省在哪。摸清分工逻辑之后,再把重复的活交给 Agent 跑,效率才真上来。
如果你只记一句话,记这句:工具从帮你干活,变成了替你组队。你要练的本事,也从”会写提示词”变成了”会提需求、会验收”。
回到开头那个问题,一个人干四个工种到底还要不要熬?我的答案是不用了,但你得学会当甲方。
关注圈圈,持续带你玩转 AI 工具。
暂无评论内容