【免费下载链接】FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
FireRedTTS3 是一款指令驱动的语音生成与编辑模型。只需一句自然语言指令,就能对已有音频完成改词、调速、变声高等编辑操作——本文完整讲解其语义编辑与声学编辑的原理、安装步骤与实战用法,帮助你无需重新录制即可直接修改录音。
为什么需要 FireRedTTS3 语音编辑
在实际场景中,一段录音往往只需要改一个字、调快一点语速,或让声音更响亮。传统做法是重新录制或手动剪辑,费时费力。
FireRedTTS3-Instruct用一条指令解决这个问题:
- 🗣️语义编辑(Semantic Edit):改词、插入、删除——直接修改"说了什么"
- 🎚️声学编辑(Acoustic Edit):调速、变声高、调音量——改变"怎么说的"
- 🔊全程保留原说话人音色,编辑后听起来仍是同一个人
💡 它属于 FireRedTTS3 的 Instruct 变体,与专注 24 语言 + 21 方言零样本克隆的 Base 变体并列,入口统一在 fireredtts3/core.py。
语义编辑与声学编辑:两种编辑有什么区别
| 维度 | 语义编辑 | 声学编辑 |
|---|---|---|
| 改什么 | 内容(说了什么) | 声学属性(怎么说) |
| 操作 | 改词 / 插入 / 删除 | 语速 / 音高 / 音量 |
| 指令自由度 | 自由自然语言 | 固定模板 |
| 是否需要重述 | 否 | 否 |
核心理念:模型会先自行转写输入音频,理解内容后再按指令重新合成——所以"改词"不需要你告诉它原文是什么。
FireRedTTS3 安装与模型下载完整步骤
1. 克隆仓库并安装依赖
git clone https://gitcode.com/gh_mirrors/fi/FireRedTTS3 cd FireRedTTS3 pip install -r requirements.txt依赖清单见 requirements.txt,核心为torch、transformers、wetext(中/英文本归一化)等。
2. 下载预训练模型
# 方式一:Hugging Face pip install "huggingface_hub[cli]" hf download FireRedTeam/FireRedTTS3 --local-dir pretrained_models/ # 方式二:ModelScope pip install modelscope modelscope download --model FireRedTeam/FireRedTTS3 --local_dir pretrained_models/⚠️ 语音编辑功能基于FireRedTTS3-Instruct模型,下载后位于
pretrained_models/fireredtts3_instruct目录,推理实现见 fireredtts3/llm/fireredtts3_instruct.py。
语义编辑实战:一条指令改词、插入、删除
语义编辑的入口是 fireredtts3/core.py 中的generate_semantic_edit。它接收一段音频和一句自然语言指令,返回编辑后的音频与改写后的文本(含编辑掩码)。
替换某个词
import torchaudio from fireredtts3.core import FireRedTTS3Instruct instruct = FireRedTTS3Instruct("pretrained_models", use_wetext=True) audio_in, audio_in_sr = torchaudio.load("input.wav") gen_audio, gen_sr, gen_text = instruct.generate_semantic_edit( instruction="Replace 'cats' with 'dogs'.", audio_in=audio_in, audio_in_sr=audio_in_sr, ) torchaudio.save("edit_semantic.wav", gen_audio.cpu(), gen_sr) print("Edited text:", gen_text)插入一个词
在指定位置插入,例如在第 8 个词后插入"简直":
instruct.generate_semantic_edit( instruction="insert '简直' after the character or word at index 8.", audio_in=audio_in, audio_in_sr=audio_in_sr, )删除某个词
instruct.generate_semantic_edit( instruction="Remove the 1st word.", audio_in=audio_in, audio_in_sr=audio_in_sr, )🎯指令建议:语义编辑支持自由措辞,但表述越明确(指定第几个词、替换成什么),效果越稳定。
声学编辑实战:调速、变声高、调音量
声学编辑的入口是generate_acoustic_edit。注意:声学编辑的指令必须使用模型训练时的固定模板,不支持自由措辞。
三种声学指令模板
| 编辑属性 | 指令模板 | 参数范围 |
|---|---|---|
| 语速 Speed | adjust the speed to X | X ∈ [0.5, 2.0],步进 0.1 |
| 音高 Pitch | shift the pitch by N step(s) | N ∈ {-6…+6},整数 |
| 音量 Volume | adjust the volume to X | X ∈ [0.3, 2.0],步进 0.1 |
调速示例(0.5 倍速)
instruct.generate_acoustic_edit( instruction="adjust the speed to 0.5x", audio_in=audio_in, audio_in_sr=audio_in_sr, )变声高示例(升 3 个半音)
instruct.generate_acoustic_edit( instruction="shift the pitch by 3 steps", audio_in=audio_in, audio_in_sr=audio_in_sr, )⚠️注意:
shift the pitch by 1 step用单数step,其余用steps;音高为 0 等于不编辑,请取非零整数。
用 Gradio 界面零代码体验语音编辑
不想写代码?官方提供了 Gradio Web 界面,把上述能力都做成了可视化表单,入口为 gradio_instruct.py。
启动 Instruct 演示
pip install gradio python gradio_instruct.py --host "0.0.0.0" --port 7860浏览器访问http://0.0.0.0:7860即可看到如下界面:左侧是 Base 多语言克隆,右侧是 Instruct 的 Voice Design 与 Speech Editing(含 Semantic 与 Acoustic 两个标签页)。
界面里 Semantic 标签页只需三步:上传 ≤20 秒音频 → 填一句编辑指令 → 点Apply edit;Acoustic 标签页则用下拉框选属性、滑块调数值,界面会自动生成对应模板指令。
参数详解与效果调优建议
| 参数 | 默认值 | 作用 |
|---|---|---|
n_timesteps | 10 | DiT 去噪步数,越大越细腻、越慢 |
inference_cfg | 1.2 | 引导强度,越大越贴合指令、越容易失真 |
seed | 1234 | 随机种子,固定后可复现结果 |
调优经验:
- 结果偏"生硬" → 适当调高
inference_cfg - 结果偏"自由发挥" → 适当调低
inference_cfg - 想要稳定复现 → 固定
seed - 长音频 → 界面默认截断前 20 秒,长内容请分段编辑
常见问题:语音编辑失败怎么办
Q1:语义编辑后文字没改对?指令尽量明确指定位置与目标词,例如 "Replace the 3rd word with X"。模型会自行转写音频,模糊措辞可能造成定位偏差。
Q2:声学编辑为什么必须用固定模板?模型训练时只见过这几类固定句式,自由措辞(如"把语速放慢一点")无法被正确解析,必须写adjust the speed to 0.5x。
Q3:音高为什么不能设为 0?shift the pitch by 0 steps等于不变,模型不提供该操作;需要升降时 N 取非零整数。
Q4:编辑会改变音色吗?不会。编辑在保留原说话人表征的基础上重渲染,输出仍是"同一个人"的声音,只是内容或声学属性变了。
总结
FireRedTTS3 的语音编辑把"改词、调速、变声高"统一到了一条自然语言指令里:
- 语义编辑负责"说了什么"——改词、插入、删除,措辞自由
- 声学编辑负责"怎么说"——调速、变声高、调音量,使用固定模板
- 全程保留原音色,无需重新录制
- 支持 Python API 与 Gradio 零代码两种方式上手
配合 Base 变体的 24 语言 + 21 方言克隆能力,FireRedTTS3 已能覆盖从"生成"到"编辑"的完整语音工作流。
【免费下载链接】FireRedTTS3
FireRedTTS3: Multilingual and Multi-Dialect Voice Cloning with Instruction-Guided Voice Design and Speech Editing
相关推荐
VOICEVOX 编辑器使用完全指南:从安装启动到音声合成、调声与歌声编辑实战
VOICEVOX 编辑器使用完全指南:从安装启动到音声合成、调声与歌声编辑实战 导读 本文是 VOICEVOX 官方使用指南(public/howtouse.m
桌面应用语音给 MV 换词不改人声:用 AuK 做语音内容编辑的 5 个实用操作
给 MV 换词不改人声:用 AuK 做语音内容编辑的 5 个实用操作 翻唱、混剪、二创视频里最折腾的一步,往往是"换词":歌还是那首歌,声音还是那个声音,但歌词
人工智能基础模型语音音频媒体生成Qwen-Image-Edit 图像编辑能力全解析:语义编辑、外观编辑与文本编辑实战指南
Qwen Image Edit 图像编辑能力全解析:语义编辑、外观编辑与文本编辑实战指南 Qwen Image Edit 是开源图像基础模型 Qwen Imag
人工智能大模型媒体生成多模态Qwen
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考