不录音也能造声:VoiceStudio语音设计(Voice Design)从文字描述生成全新声线完整教程
2026/9/17 2:57:41 网站建设 项目流程

不录音也能造声:VoiceStudio语音设计(Voice Design)从文字描述生成全新声线完整教程

【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio

VoiceStudio是一款开源、完全本地运行的语音合成工具,被视为 ElevenLabs 的本地替代品,支持 646 种语言的语音克隆、视频配音、听写、转写与有声书创作。其中最让人惊讶的能力是Voice Design(语音设计):不需要录一段参考音频,只需用文字描述"我想要一个什么样的声音"——比如"女性、青年、高音调、四川话"——模型就会凭空生成一条全新的声线。本文将带你从零开始,用文字描述生成属于你的定制声音。

什么是 Voice Design:不录一秒声音也能"造声"

传统语音克隆(Voice Cloning)需要你先上传一段录音作为参考;而Voice Design 模式完全跳过了这一步:

  • 你通过instruct(描述)参数用自然语言描述目标说话人
  • 模型实时生成一个匹配描述的语音
  • 整个过程 100% 在本地完成,不上传任何数据

技术细节可以在官方文档 docs/voice-design.md 中查阅,它完整列出了语音设计的工作原理与全部支持的属性。

三步用文字描述生成全新声音

VoiceStudio 的界面把语音设计做得像填表单一样简单:

  1. 切换到设计模式:在底部 VOICE 区域,把开关从 "From audio"(从录音)切到"By design"(按描述)
  2. 输入描述:在文本框中写下声音特征,例如female, young adult, high pitch, british accent;下方脚本框输入这句话要说的内容
  3. 点击 Synthesize Audio:几秒后即可在右侧 HISTORY 面板试听生成的声音,满意后点Save as voice profile存为可复用的语音档案

界面右侧还内置了一组开箱即用的预设角色——The Librarian(英式有声书旁白)、The Anchor(美式新闻主播)、The Sichuan Friend(四川话示范)等,点 "Use this design" 即可直接套用它的属性参数作为起点:

语音设计属性词全清单

描述由若干"属性词"组成,逗号分隔即可。以下是全部支持的类别(摘自 docs/voice-design.md):

类别可用属性词
性别male / 男,female / 女
年龄child 儿童、teenager 少年、young adult 青年、middle-aged 中年、elderly 老年
音调very low pitch 极低、low pitch 低、moderate pitch 中、high pitch 高、very high pitch 极高
风格whisper 耳语
英语口音american / british / australian / canadian / indian / chinese / korean / japanese / portuguese / russian accent
中文方言四川话、东北话、陕西话、河南话、青岛话、云南话等 12 种

同一类别只能选一个词,不同类别可以任意组合。

写好语音描述的小技巧

  • 中英文混写都行"female, young adult, 四川话"会自动规范化,半角/全角逗号写错也会被自动修正
  • 大小写不敏感MaleMALEmale都有效
  • 不确定的属性直接省略:模型会自动补全,单独写一个"female"也是合法的
  • 口音与方言互不干扰:英语口音只对英文文本生效,中文方言只对中文文本生效
  • 用 Seed 微调:调整属性时 Seed 保持不变,声音只随描述变化;点 "New seed" 则重新生成一条不同的身份感

想进一步加入情绪、笑声、停顿等表现力控制,可参考 expressive-speech.md。

从一次设计到永久声线:保存与导出

  • 保存为语音档案:设计结果会把 seed 和已验证的属性状态一起存进后端,之后随时可以从 Design 侧边栏恢复
  • 导出 .ovsvoice 人格包:在 Voices 中打开任意语音 →Export persona,即可打包成一个可移植的.ovsvoice文件(内置水印预览音、许可标签),导入到另一台 VoiceStudio 即可复用,全程离线、无需账号。格式细节见 persona-format.md

项目还内置了一组不同风格的语音设计演示音频,可以先听效果再动手,目录见 backend/assets/samples/voice_design/(如美式新闻主播、四川话旁白等 7 个样例)。

安装 VoiceStudio 开始语音设计

平台安装方式文档
macOS 13.3+(Apple Silicon)DMG 安装包docs/install/macos.md
Windows 10/11MSI 安装包docs/install/windows.md
LinuxAppImagedocs/install/linux.md
Docker官方镜像docs/install/docker.md

也可以直接克隆源码参与开发:

git clone https://gitcode.com/GitHub_Trending/om/VoiceStudio

安装完成后首次启动会从 Model Catalogue 下载所需模型,遇到卡壳可查阅 troubleshooting.md。装好后打开 Design 页,写下你的第一条描述——一条完全属于你的声音,几秒就会在本地诞生。🎙️

【免费下载链接】VoiceStudioVoiceStudio is the open-source, fully-local ElevenLabs alternative — voice cloning, voice design, video dubbing, dictation, transcription & audiobook creation in 646 languages.项目地址: https://gitcode.com/GitHub_Trending/om/VoiceStudio

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询