录错一个词就要重录整段?腾讯 AuK 开源:一句指令改录音,1.5B 模型收编一整套音频工具

录错一个词,整段重录:这活儿谁干谁崩溃
录了四十分钟的口播,回放时发现第三分钟把「阈值」念成了「阀值」。一个字,整段废掉。
你肯定懂这种感觉。问题不在技术,在流程。剪辑软件没有「只改这一个词」的按钮,你只能把人拽回录音棚,重新找状态,重新对气口。
更窝火的是剪音频这件事本身。降噪开一个工具,人声分离再开一个,想补句台词切到 TTS,变声还得第四个。四个工具,四种交互,四种输出格式,中间来回倒腾的时间比真正干活的时间还长。
我本来以为这就是行业常态。直到 2026 年 9 月 9 日,腾讯混元联合上海交通大学、上海创智学院把 AuK 开源了。1.5B 参数,MIT 许可证,代码和权重全都能商用,技术报告挂在 arXiv(编号 2609.08936),权重在 Hugging Face 和 ModelScope 上都能拉。
它做的事其实很朴素:给你一段音频,再给你一句大白话指令,它还你一段改好的音频。TTS、降噪、分离、变声、改词、改歌词,全塞在这一个接口里。
我第一反应是不信。第二反应是装。
先搞清楚:AuK 和你用过的 TTS 差在哪儿
最大的误会,是把它当成又一个语音合成工具。
你用过的 ElevenLabs、各类 国内 AI 语音平台,本质都是单向的:文本进,音频出。它们解决的是「从无到有」。当你手里已经有一段录音、只想改点什么的时候,它们集体帮不上忙。
AuK 反过来。它的主战场是「从有到改」,这才是最耗人、最常发生、也最没人管的那部分工作。
打个比方。传统 TTS 像一台复印机,你给它文字,它印出声音。AuK 更像一个坐在调音台后面的老师傅,你把带子递进去说「第三句那个词换成阈值,别的别动」,他改完推给你。
技术上怎么做到?讲人话版:Qwen2.5-Omni-3B 当多模态编码器,先读懂你的指令和参考音频,给出语义条件;一个在语音、通用音频、音乐上联合训练的 VAE 把 24kHz 波形压成 50Hz 隐空间;最后由混合 rectified-flow Transformer(10 层双流 MMDiT 加 20 层单流 DiT,宽度 1536)把音频改出来。
训练数据是约 30.3 亿条「指令-音频」配对,195 万小时有效监督,分三步走:先只练生成预热,再做生成与编辑的联合预训练,最后两轮后训练,编辑走人类反馈偏好优化,生成走奖励强化学习。
它是从训练目标上就把「改音频」当一等公民来做的模型。这个定位,跟所有后补编辑功能的 TTS 都不一样。

一个模型,十六份活:最上头的五个
官方把能力划成五大任务族、十六种具体活,全部用同一套格式驱动:指令加输入音频,输出音频。我挑五个体感最强的说。
- Zero-shot TTS:给一段参考音频,复刻音色去说全新的文本。思路有点像 6 秒样本复刻人声,但在 AuK 里这只是十六分之一。
- Instruct TTS:一段参考音频都不给,纯用文字描述音色和情绪就能生成,比如「一个三十岁左右的女性,语气疲惫但克制」。
- 内容编辑:在已有录音里精确替换、插入、删除词语;还能改唱段歌词,保留原旋律和歌手音色。
- 副语言编辑:改情绪、改音色描述、去地方口音、增删呼吸声笑声咳嗽、正常语音与耳语互转。
- 增强与分离:降噪、去混响、按说话顺序分离说话人、从伴奏里抽人声、按说了什么来提取目标说话人。
剩下的声学编辑也值得一提:按半音调音调、调语速、按分贝调音量,全是数值化的,能精确控制。
关于跑分,我必须说实话。官方目前没有公布任何具体分数,项目页只列了评测集名字:Seed-TTS-Eval、InstructTTSEval、MMAE-Speech、SpeechEditBench、DNS Challenge、CHiME-4、Libri2Mix。也没有看到第三方独立复现。谁现在给你报一串分数,谁就是在编。
从装环境到跑通第一条指令
环境要求很普通:Python 3.10,用 uv 或者 conda 建个干净环境就行。
装完有三条路。命令行最省事,auk-infer 一把梭,--instruction 必填,--audio 按任务可选:
auk-infer --instruction "把说错的词改成阈值,其余全部保持不变" --audio raw.wav不想敲命令就跑 auk-gradio,本地起一个网页,上传音频、填指令、Base 和 Flash 两个版本随手切,鼠标点完事,最适合先拿它找感觉。
玩 ComfyUI 的也有官方节点包 ComfyUI-AuK,两个核心节点:AuK Model Loader 和 AuK Generate/Edit,再配一个 auk.json 工作流。另有可选的 Prompt Enhancer,帮你把大白话润成模型更爱吃的格式。
Python API 和 CLI 完全同构,命令行怎么传参,代码里就怎么传。想微调就准备 JSONL,每条样本是指令加音频、指向目标音频的成对数据。
两个版本怎么选?基础版 AuK 质量优先,NFE 步数和 CFG 强度你自己调;AuK-Flash 是蒸馏版,固定 4 步推理、CFG=0、sway_sampling_coef=-1,官方称同条件下有 4.5 倍墙钟加速(厂商自测数据,留个心眼)。赶时间用 Flash,出片用 Base。

改错词、改歌词、捞人声:三个救命现场
场景一:改错词,不重录。四十分钟口播,第三分钟念错一个术语。原来的解法是重录,或者剪掉补一段再硬对气口,音色和底噪对不上,听众一耳朵就听出来。现在只写一句指令:把第三分钟处的阀值改成阈值,保持说话人音色、语速和录音环境不变。用 Base 版本跑,指令里写清楚改哪个、改成什么、什么不许动。出来的那一段和前后严丝合缝,连呼吸位置都对得上。省下的远不止几分钟,是你重新进入状态的那半小时。
场景二:改歌词,不重唱。伴奏做完了,歌词要换一句。原来的做法是找歌手回棚,或者用修音软件硬拉,旋律一变形整首就废。AuK 的内容编辑能直接改唱段歌词,指令写清楚新词是什么、保留原旋律和歌手音色。旋律线不动,音色不动,只有字变了。这个能力在开源模型里此前基本是空白。
场景三:从噪音里捞人声。现场采访录了一段,空调声、路人声、回声全糊在里面。降噪工具一开,人声也跟着发闷,越修越假。AuK 这边你可以写「去掉背景噪音和混响,保留说话人声音」,也可以更狠一点,按说话内容提取目标说话人、从伴奏里抽人声、按说话顺序分离说话人。几种活在模型内部切换,中途不用换工具,也不用转格式。
它不完美:这些坑我得先说
ComfyUI 里长音频直接失败。现象是丢一段两分钟音频进去,节点报错或输出被截断。根因是 ComfyUI 集成有 30 秒上限,参考音频和生成目标都得在 30 秒内,而且不会自动切分。解法:切段处理再拼回去,CLI 和 Gradio 没这个限制。
编码器下错版本。现象是模型根本加载不起来,报一堆编码器相关错误。根因是 Qwen3-Omni 不支持,必须是 Qwen2.5-Omni-3B,这个坑踩的人特别多。另外加载权重时看到 text_encoder.* 相关的缺失提示别慌,编码器是独立加载的,属正常现象。
显存不够会 OOM。ComfyUI 节点不支持自动显存卸载,模型常驻设备,官方也没给推理显存下限。按第三方实测经验,准备 24GB 左右显存,也就是 RTX 3090 或 4090 这个级别。卡不够先跑 Flash 版本。
Prompt Enhancer 连不上。它需要 OpenAI 兼容的聊天端点;没配云 ASR 凭据时会回退到本地 SenseVoiceSmall。要么把端点配好,要么干脆不用它,指令自己写清楚一样能跑。
硬盘先腾地方。每个变体约 6.8GB,编码器另算。Base 加 Flash 一起下,先留出 20GB 空间。
我的真心话
我用过不少音频模型,大多数只是「多一个选择」。AuK 是少数让我真的改了工作流的。
它做对的事,是把「改」提到了和「生成」同等的位置。过去我们默认音频是一次性的,录坏了就重来,所以才堆出那一长串工具链。AuK 把这件事拉回到一条指令:音频也可以像文本一样被就地编辑。
当然,它现在没有公开跑分,没有第三方复现,30 秒限制也还挂着,我不会跟你说它已经完美。但 1.5B 的体积、MIT 的许可证、一句大白话就能驱动的十六种能力,这个组合在开源里确实是头一份。
建议很具体:今天就去下 Flash 版本,拿你手头最想重录的那段音频试一次。别搞评测,就改一个词。改完你会回来谢我。
回到开头那个念错的词。以前它是四十分钟,现在它是一条命令。
工具堆得再多,也不如一个真能改你那段录音的模型。
关注圈圈,持续带你玩转 AI 工具。
暂无评论内容