AuK语音内容编辑实战:精准替换、插入、删除语音内容与歌词改写指南
【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK
AuK 是腾讯混元开源的 15 亿参数语音生成与编辑基础模型,一条自然语言指令即可完成语音内容编辑——精准替换、插入、删除语音中的语句,甚至改写歌曲歌词。本文面向新手,带你零门槛上手 AuK 语音编辑。
什么是 AuK 语音内容编辑?
简单来说:你不用剪辑软件逐帧操作,只需用一句人话告诉模型"把这句话改成那句话",AuK 就会保留原说话人的音色、语速和韵律,输出编辑后的完整语音。
AuK 的核心亮点:
- 🗣️统一指令接口:所有任务(替换、插入、删除、歌词改写、变调、降噪、分离)都用同一种自然语言方式触发
- 🎯内容编辑不串音:改的是"说了什么",不是"谁在说",原音色完整保留
- 📜MIT 开源协议:代码与权重均已开放,可自由用于学习和商用场景
模型整体架构与能力一览可在 README.md 中查看,其中列出了 AuK 支持的全部任务清单,包括零样本 TTS、指令 TTS、内容编辑、歌词编辑、声学编辑(音调/语速/音量)、情感与音色编辑、语音增强与分离等。
准备工作:3 步部署 AuK 语音编辑
第 1 步:获取项目代码
git clone https://gitcode.com/tencent_hunyuan/AuK第 2 步:确认模型文件
本仓库直接包含 AuK 基础模型的核心权重,克隆后即可看到:
| 文件 | 作用 |
|---|---|
| auk_base.safetensors | AuK 基础模型权重(扩散 Transformer + 层融合权重) |
| vae.safetensors | 音频 VAE,负责语音波形与潜变量之间的编解码 |
| config.yaml | 模型配置文件,定义网络结构与采样参数 |
| LICENSE | MIT 开源协议 |
第 3 步:了解关键配置
打开 config.yaml 可以看到 AuK 的两个重要工程细节:
- 目标采样率 24000 Hz:编辑输出为 24kHz 高质量音频,细节保留充分
- BigVGANFlowVAE 声学编解码器:480 倍下采样,兼顾编辑精度与推理效率
💡 提示:除本仓库外,AuK-Flash 是蒸馏加速版(4 步推理),适合需要快速出稿的场景,可从官方模型站点单独获取。
语音替换:一句话改写说错的内容
**替换(Replace)**是最常用的编辑操作:录音里念错了一个词、一个数字、一个名字,无需重新录制,直接让模型改过来。
操作思路:
- 上传原始音频
- 用自然语言描述修改,例如"把音频里的'下周五'替换为'下周一'"
- AuK 定位到对应片段重新生成,前后内容原样保留,音色、停顿、语气自然衔接
实用技巧:
- ✅小范围修改效果最好:替换 1~2 个词通常比整句重写更稳定
- ✅指代尽量具体:用引号给出原文和替换文本,避免歧义
- ⚠️ 替换文本与原文长度差异过大时,整体时长会自然伸缩,属正常现象
语音插入:在指定位置补进新内容
**插入(Insert)**适合"话说漏了一句"的补救场景:在两句之间补进新内容,模型会自动处理衔接的语流,听感上不像人工拼接。
典型用法:
- 在"大家好,"之后插入"欢迎来到本期节目"
- 在句尾补上未说完的宾语或问候语
关键点是指明插入位置——用前文或后文的语句来锚定位置(例如"在'谢谢'之前插入……"),定位越明确,插入越精准。
语音删除:精准去掉不想要的片段
删除(Remove)用于去掉口误、重复词、无关的插入语。你只需指出要删掉的内容,例如"删除音频中的'呃'和重复的那半句话",AuK 会自动把删除点前后自然衔接,不会出现生硬的拼接断层。
三个实用建议:
- 🎯 删除对象用原文引用,例如"删除'那个那个'这个口癖"
- 🎯 删除后想保留的语气词可一并说明
- 🎯 大段删除后总时长缩短,若需要填补空白可再配合"插入"操作
替换、插入、删除这三类"内容编辑"任务的完整指令模板,可在官方 Cookbook 文档中按任务类别查阅,配合 CLI 与 Python 示例直接套用。
歌词改写:旋律不变,歌词随心换
这是 AuK 最具趣味性的能力之一——歌词编辑(Lyric Editing):对一段演唱录音,直接改写歌词文字,而旋律与歌手音色保持不变。
适用场景:
- 🎤 把一首歌的歌词换成自己的文案,快速做出"定制版"歌曲
- 🎤 修改歌词中不合适的表述,旋律一个音都不动
- 🎤 给清唱 Demo 换一版歌词进行对比试听
操作方式同样是自然语言指令:给出原歌词片段与目标歌词,AuK 会重新合成演唱部分,保留原曲的节奏框架和声线。
新手常见问题
Q1:编辑后的音色和原声一致吗?一致。AuK 属于"内容级"编辑,只改变语音承载的文字内容,说话人的音色、基频与韵律特征在输出中保留。
Q2:支持中文语音编辑吗?AuK 在百万小时级多语种音频上训练,中文日常语音的替换、插入、删除与歌词改写均可通过自然语言指令完成。
Q3:AuK 还能做哪些编辑?除了内容编辑,AuK 还支持声学编辑(升降调、调速、音量调节)、副语言编辑(情感、音色、去口音、气声/笑声等)、语音增强(降噪、去混响)和语音分离(多说话人分离、人声提取)等,全部走同一个指令接口,详见 README.md 的 Supported Tasks 章节。
Q4:推理速度太慢怎么办?可切换使用蒸馏版 AuK-Flash(4 步推理),在保持可用质量的前提下显著提升出稿速度。
总结:AuK 语音内容编辑三步上手
- 克隆仓库获取代码与 auk_base.safetensors 等权重文件
- 用自然语言下指令:说清楚"替换/插入/删除什么、在哪里"
- 拿到成品音频:24kHz 高保真输出,音色与原声一致
从"改错字"到"换歌词",AuK 把过去需要专业音频工程才能完成的活,变成了一句会说话的事。现在就可以动手试试你的第一条语音编辑指令 🚀
【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考