Buzz 离线音频转录实战:Whisper 驱动的语音转文字指南
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
Buzz 是基于 OpenAI Whisper(开源语音识别模型)的离线音频转录工具,在个人电脑上完成语音转文字与翻译,音频文件不离开本机。本文覆盖安装、首次运行与高频工作流,目标是半小时内跑通核心功能。
项目定位与适用场景
Buzz 解决的核心问题是:把本地音视频转成文字,同时不向任何云端上传数据。与在线转录服务相比,它把全部计算放在本地硬件上;与纯命令行方案相比,它提供了完整的图形界面、任务队列和结果编辑器。
| 适合的场景 | 不太适合的场景 |
|---|---|
| 不能外发的敏感音频(会议、采访) | 依赖远程 API 毫秒级响应的业务 |
| 批量生成视频字幕与会议文稿 | 无 AVX2 指令集支持的超老硬件 |
| 内网、野外等完全离线环境 | 多人同时编辑同一份转录结果 |
从安装到第一次成功运行
环境检查清单
- CPU 需支持 AVX2 指令集,过老的处理器无法运行。
- 通过 PyPI 安装时需要 Python 3.12 及以上版本,以及系统级 ffmpeg。
- 内存建议 8GB 以上,GPU 可选但能明显提速。
- macOS 同时支持 Intel 与 Apple Silicon 机型。
分平台安装步骤
- Windows:从官方发布渠道(SourceForge)下载安装包;程序未签名,安装时选择“更多信息 → 仍要运行”。
- macOS:下载 .dmg 文件后双击安装。
- Linux(Flatpak):
flatpak install flathub io.github.chidiwilliams.Buzz - Linux(Snap):
sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz- PyPI:
pip install buzz-captions,之后用python -m buzz启动。
三步跑通第一次转录
- 菜单 File → Import Media File(或 Ctrl+O)导入一段音频或视频。
- 在导入表单中设置任务(Transcribe)、语言(建议显式选择而非自动检测)和模型;首次使用会先下载模型。
- 选择导出格式 TXT/SRT/VTT,点击 Run,等待状态变为 Completed。
- 双击任务行打开转录查看器,即可试听、搜索并导出结果。
📁 功能全景:输入 → 处理 → 输出
输入侧:格式、来源与实时录音
- 支持 ffmpeg 可解码的音视频,如 mp3、mp4、wav、m4a、flac。
- 支持粘贴 YouTube 等 URL 直接导入(1.2.0 起)。
- 麦克风实时录音,并附带演示窗口,适合演讲时投屏显示。
- 文件夹监控(Folder Watch)可让新文件落盘后自动进入任务队列。
处理侧:模型后端与硬件加速
- 四种本地后端:Whisper(原版,精确但吃内存)、Faster Whisper(NVIDIA 显卡 6GB 显存以上推荐)、Whisper.cpp(C++ 实现,任意 GPU 或纯 CPU,Mac 首选)、HuggingFace(支持 MMS 等 1000 多种语言的模型)。
- 也可在偏好中配置 OpenAI 兼容 API,把计算放到远端。
- 加速路径:CUDA(NVIDIA)、Apple Silicon、Vulkan(可走核显)。
- 可选前处理:说话人分离用于多人对话提准确率,说话人识别在结果中标注发言人。
输出侧:导出格式与命名模板
- 支持导出 TXT、SRT、VTT(两种常见字幕格式),查看器菜单还可导出 JSON。
- 导出文件名支持模板变量:
input_file_name、task、language、model_type、model_size、date_time,详见 docs/docs/preferences.md。 - 开启 Word-Level Timings 后生成词级时间戳,再配合字幕重排工具整理段落。
两个高频工作流
工作流一:录音 → 纪要 → 归档
- 选择语言与较小模型,点击 Record 开始实时转录。
- 打开 Presentation Window,把实时文字投到大屏。
- 结束后在转录查看器中修正专有名词。
- 按统一命名模板导出 TXT 到归档目录。
提示:实时模式建议用 Whisper.cpp 加 base/small 模型;“Append and correct”会回改上一句、对算力要求更高,普通会议用追加模式即可。
工作流二:视频 → 字幕 → 导出 🎬
- 导入 MP4 并勾选 Word-Level Timings。
- 用 medium 模型转录,完成后打开结果。
- 点击工具栏 Resize,按间隔合并、按标点分割重排字幕。
- 导出 SRT 或 VTT。
提示:在偏好中把默认导出文件名设为{{ input_file_name }}.srt,批量任务可保持命名一致。
⚙️ 性能与质量调优
模型选择对照表
| 场景 | 推荐配置 | 资源占用 | 效果 |
|---|---|---|---|
| 快速草稿 / 实时录音 | Whisper.cpp + base 或 small | CPU 或核显即可 | 速度快,准确率够用 |
| 日常会议文稿 | Whisper.cpp 或 Faster Whisper + medium | 约 3GB 内存或 6GB 显存 | 速度与准确率平衡 |
| 专业存档 | Faster Whisper + Large-V3 | 8GB 以上内存、6GB 以上显存 | 准确率最高 |
| 纯 CPU 环境 | Whisper.cpp + q_5 量化模型 | 8GB 内存 | 量化省内存,速度看 CPU |
硬件适配要点
- NVIDIA 显卡:Linux 需装好 CUDA 12、cuBLAS、cuDNN 才能启用加速;Windows 安装包已自带 CUDA 支持。
- 无 NVIDIA 或 Mac:选 Whisper.cpp,走 Vulkan 或 Apple Silicon 路径。
- 线程数可用环境变量
BUZZ_WHISPERCPP_N_THREADS调整,默认取核心数的一半。
常见问题速查
| 现象 | 原因 | 处理 |
|---|---|---|
| 启动或转录时崩溃 | 模型下载不完整 | 在偏好 → Models 中删除后重新下载 |
| 录音报错 PaErrorCode-9999 | 系统隐私设置拦截麦克风 | 在系统设置中允许 Buzz 使用麦克风 |
| 转录速度慢 | 模型过大或未用上 GPU | 换小模型、启用 GPU 或改用量化模型 |
| GPU 未生效 | 缺少 CUDA 12 | 安装 CUDA 12,或改用 Whisper.cpp |
| 离线机器无法下载模型 | 机器没有网络 | 从在线机器复制模型缓存目录,或用scripts/download-models.py预置 |
平台补充:
- Linux:确认已安装
libportaudio2、gettext、ffmpeg,缺库时录音与导出会失败。 - Windows:安装包未签名属正常现象;GPU 加速依赖 CUDA 12,旧版驱动会自动回落到 CPU。
🧩 自动化与扩展能力
命令行批量转录
命令行与 GUI 共享同一任务系统,完整参数见 docs/docs/cli.md:
buzz add -m whispercpp -s small -l zh --srt --vtt ./meeting.mp4 buzz add --task translate -l fr -m whispercpp --txt ./interview.mp3插件机制
插件(1.4.5 起)在 Help → Plugins 中开关、排序和配置,典型内置插件:
- AI Summary:调用 OpenAI 兼容 API 为长转录生成摘要。
- Resize Transcript:把词级结果自动重组为字幕长度分段。
- Skip Already Transcribed:已有结果时跳过,批量重导不重复计算。
自研插件可参考 buzz/plugins/ 目录中的结构与钩子写法。
与外部工具集成
- 文件夹监控:新文件落盘即自动开始转录,适合夜间批处理。
- 实时转录文本流:可边生成边写入 txt 文件,接入 OBS 等直播工具。
- OpenAI 兼容 API:Base URL 可指向 Ollama 等自托管服务,用于摘要与翻译。
🔒 数据与隐私
- 数据流向:音频、中间结果与转录文件全部保存在本机磁盘。
- 本地化程度:除首次下载模型(或可选的 API 模式)外,处理全程不依赖网络。
- 离线可用:模型缓存目录可整体复制到离线机器,Linux 下位于
~/.cache/Buzz。 - 开源可审查:MIT 协议,转录与数据逻辑可逐行审查。
Buzz 把导入、模型选择、转录、字幕编辑与导出收进同一个界面,适合把“录音到文稿”沉淀成固定流程。可从 README.md 查看各平台安装入口,再按需要扩展工作流。
【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考