Buzz 离线语音转文字完整指南:Whisper 本地转录的免费上手方案
2026/9/20 9:59:26 网站建设 项目流程

Buzz 离线语音转文字完整指南:Whisper 本地转录的免费上手方案

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是一款免费开源的桌面工具,它把 OpenAI Whisper 跑在你的电脑上,音频文件不进云端,转写、翻译都在本地完成。适合做会议记录、视频字幕、或者处理不方便上传的敏感录音的普通用户,也适合想用脚本批量转写的开发者。

它解决什么问题:音频留在本机

很多转写服务要你把文件传到服务器,Buzz 的思路相反:模型下载一次,之后每次转写都走本地算力。🔒 这带来两个直接好处——隐私数据不出机器,以及没有按量计费,跑多少条录音都不花钱。底层技术是 Python 3.12 加 PyQt6,转录历史和设置都存在本地 SQLite 里,首次上手不需要配置任何服务端。

三种方式把工具跑起来

按你对安装的要求选一种即可,三种方式功能基本一致。🖥️

Windows / macOS:去项目发行版页面下载对应安装包。Windows 包没有做代码签名,安装时会弹安全警告,点"更多信息"再选"仍要运行"就行,属于正常现象。注意 Intel 芯片的 Mac 最高只支持到 1.4.5 版本,新版本需要 Apple Silicon。

Linux

flatpak install flathub io.github.chidiwilliams.Buzz

从 PyPI 装(适合开发者):前提是系统里有 ffmpeg,并且用 Python 3.12 环境。

pip install buzz-captions python -m buzz

文件转录:三步拿到字幕文本

导入音频或视频文件(Ctrl/Cmd+O)后,Buzz 会自动抽音轨,不用你先转格式。然后给任务选三样东西:任务类型(转写或翻译)、语言(也可以留空让它自动检测)、模型大小(tiny 到 large 五档,机器差就选 tiny 或 base)。点运行,等进度条走完。

产物是带时间戳的转写文本,可导出 TXT、SRT、VTT 三种格式。SRT 和 VTT 能直接拖进剪辑软件做字幕,这一步对视频创作者最实用。🎬 打开转录查看器还能边播放边核对每个片段,支持搜索和调速。

实时录音:边说边出字

主界面切到"实时录音"模式,选好麦克风就能开始。底部面板会实时滚动出文字,默认有 20 秒左右的延迟来保证文字和语音同步。讲讲座、开访谈时,可以单独弹出一个演示窗口把实时内容投到大屏上。

多人对话的录音还有一步值得做:开启说话人识别,Buzz 会把同一条录音里不同发言人的内容分开标注。嘈杂环境可以先做语音分离再转写,准确率会明显提升。🎙️

模型怎么选:影响速度和准确率的那一格

模型是速度、内存和准确率之间的权衡点。tiny 和 base 在普通笔记本上很流畅,适合先跑通流程;medium 和 large 更准但更吃资源,有独显的机器再考虑。

在偏好设置的模型页里还能选后端:

  • Whisper / Faster Whisper:标准路线,Nvidia 显卡可走 CUDA 加速
  • Whisper.cpp:对硬件最友好,大多数 GPU(包括核显)都能走 Vulkan 加速
  • Hugging Face:可以用 HF 上的各种 Transformer 模型
  • OpenAI API:如果就是想用云端接口,也能接

命令行:一条命令批量转写

GUI 之外,Buzz 有完整的 CLI,适合写进脚本或 CI。所有参数在 CLI 文档 里都有列。最常见的用法是指定后端、模型和输出格式:

buzz add -m whispercpp -s medium -l zh --srt meeting.mp3

--vtt--txt可以换输出格式,--hide-gui能隐藏主窗口纯后台跑。另外主界面有个"监视文件夹"功能,指定目录后新放进来的文件会自动建任务并转录,批量流水线场景两个功能可以配合用。

卡住了怎么办:四个高频问题

按出现频率排一下,基本都是参数问题,不用怀疑机器。⚡

  • 转得太慢:多半是模型选大了,或者后端没吃到 GPU。换 tiny/base,或者改用 Whisper.cpp 后端并确认 CUDA / Vulkan 加速已启用。
  • 专有名词总认错:模型缺领域上下文。在高级设置里填一段"初始提示(initial prompt)",把术语和背景写进去;语言明确时手动指定,别依赖自动检测。
  • Windows 安装弹警告:包没签名导致的,"更多信息"→"仍要运行",正常现象。
  • PyPI 版本 GPU 不生效:默认装的是 CPU 版 torch。Windows 上按 README 改装 CUDA 版 torch 和对应运行库,GPU 才会真正参与计算。

想深入:后端和插件的源码入口

所有转写后端都抽象在 buzz/transcriber/ 目录下,Whisper、Whisper.cpp、Faster Whisper 等每个后端各占一个文件,想接一个新后端从这里看最清楚。插件机制在 buzz/plugins/,内置了 AI 摘要、DOCX 导出、自动调整字幕时长这几个插件,加新插件照着现有目录结构抄就行。文档入口在 docs/docs/,使用手册和偏好设置说明都在里面。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询