☰
Buzz 离线音频转录实战:Whisper 驱动的语音转文字指南
2026/10/10 23:19:46 网站建设 项目流程

Buzz 离线音频转录实战:Whisper 驱动的语音转文字指南

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

Buzz 是基于 OpenAI Whisper(开源语音识别模型)的离线音频转录工具,在个人电脑上完成语音转文字与翻译,音频文件不离开本机。本文覆盖安装、首次运行与高频工作流,目标是半小时内跑通核心功能。

项目定位与适用场景

Buzz 解决的核心问题是:把本地音视频转成文字,同时不向任何云端上传数据。与在线转录服务相比,它把全部计算放在本地硬件上;与纯命令行方案相比,它提供了完整的图形界面、任务队列和结果编辑器。

适合的场景不太适合的场景
不能外发的敏感音频(会议、采访)依赖远程 API 毫秒级响应的业务
批量生成视频字幕与会议文稿无 AVX2 指令集支持的超老硬件
内网、野外等完全离线环境多人同时编辑同一份转录结果

从安装到第一次成功运行

环境检查清单

  • CPU 需支持 AVX2 指令集,过老的处理器无法运行。
  • 通过 PyPI 安装时需要 Python 3.12 及以上版本,以及系统级 ffmpeg。
  • 内存建议 8GB 以上,GPU 可选但能明显提速。
  • macOS 同时支持 Intel 与 Apple Silicon 机型。

分平台安装步骤

  • Windows:从官方发布渠道(SourceForge)下载安装包;程序未签名,安装时选择“更多信息 → 仍要运行”。
  • macOS:下载 .dmg 文件后双击安装。
  • Linux(Flatpak):flatpak install flathub io.github.chidiwilliams.Buzz
  • Linux(Snap):
sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz
  • PyPI:pip install buzz-captions,之后用python -m buzz启动。

三步跑通第一次转录

  1. 菜单 File → Import Media File(或 Ctrl+O)导入一段音频或视频。
  2. 在导入表单中设置任务(Transcribe)、语言(建议显式选择而非自动检测)和模型;首次使用会先下载模型。
  3. 选择导出格式 TXT/SRT/VTT,点击 Run,等待状态变为 Completed。
  4. 双击任务行打开转录查看器,即可试听、搜索并导出结果。

📁 功能全景:输入 → 处理 → 输出

输入侧:格式、来源与实时录音

  • 支持 ffmpeg 可解码的音视频,如 mp3、mp4、wav、m4a、flac。
  • 支持粘贴 YouTube 等 URL 直接导入(1.2.0 起)。
  • 麦克风实时录音,并附带演示窗口,适合演讲时投屏显示。
  • 文件夹监控(Folder Watch)可让新文件落盘后自动进入任务队列。

处理侧:模型后端与硬件加速

  • 四种本地后端:Whisper(原版,精确但吃内存)、Faster Whisper(NVIDIA 显卡 6GB 显存以上推荐)、Whisper.cpp(C++ 实现,任意 GPU 或纯 CPU,Mac 首选)、HuggingFace(支持 MMS 等 1000 多种语言的模型)。
  • 也可在偏好中配置 OpenAI 兼容 API,把计算放到远端。
  • 加速路径:CUDA(NVIDIA)、Apple Silicon、Vulkan(可走核显)。
  • 可选前处理:说话人分离用于多人对话提准确率,说话人识别在结果中标注发言人。

输出侧:导出格式与命名模板

  • 支持导出 TXT、SRT、VTT(两种常见字幕格式),查看器菜单还可导出 JSON。
  • 导出文件名支持模板变量:input_file_name、task、language、model_type、model_size、date_time,详见 docs/docs/preferences.md。
  • 开启 Word-Level Timings 后生成词级时间戳,再配合字幕重排工具整理段落。

两个高频工作流

工作流一:录音 → 纪要 → 归档

  1. 选择语言与较小模型,点击 Record 开始实时转录。
  2. 打开 Presentation Window,把实时文字投到大屏。
  3. 结束后在转录查看器中修正专有名词。
  4. 按统一命名模板导出 TXT 到归档目录。

提示:实时模式建议用 Whisper.cpp 加 base/small 模型;“Append and correct”会回改上一句、对算力要求更高,普通会议用追加模式即可。

工作流二:视频 → 字幕 → 导出 🎬

  1. 导入 MP4 并勾选 Word-Level Timings。
  2. 用 medium 模型转录,完成后打开结果。
  3. 点击工具栏 Resize,按间隔合并、按标点分割重排字幕。
  4. 导出 SRT 或 VTT。

提示:在偏好中把默认导出文件名设为{{ input_file_name }}.srt,批量任务可保持命名一致。

⚙️ 性能与质量调优

模型选择对照表

场景推荐配置资源占用效果
快速草稿 / 实时录音Whisper.cpp + base 或 smallCPU 或核显即可速度快,准确率够用
日常会议文稿Whisper.cpp 或 Faster Whisper + medium约 3GB 内存或 6GB 显存速度与准确率平衡
专业存档Faster Whisper + Large-V38GB 以上内存、6GB 以上显存准确率最高
纯 CPU 环境Whisper.cpp + q_5 量化模型8GB 内存量化省内存,速度看 CPU

硬件适配要点

  • NVIDIA 显卡:Linux 需装好 CUDA 12、cuBLAS、cuDNN 才能启用加速;Windows 安装包已自带 CUDA 支持。
  • 无 NVIDIA 或 Mac:选 Whisper.cpp,走 Vulkan 或 Apple Silicon 路径。
  • 线程数可用环境变量BUZZ_WHISPERCPP_N_THREADS调整,默认取核心数的一半。

常见问题速查

现象原因处理
启动或转录时崩溃模型下载不完整在偏好 → Models 中删除后重新下载
录音报错 PaErrorCode-9999系统隐私设置拦截麦克风在系统设置中允许 Buzz 使用麦克风
转录速度慢模型过大或未用上 GPU换小模型、启用 GPU 或改用量化模型
GPU 未生效缺少 CUDA 12安装 CUDA 12,或改用 Whisper.cpp
离线机器无法下载模型机器没有网络从在线机器复制模型缓存目录,或用scripts/download-models.py预置

平台补充:

  • Linux:确认已安装libportaudio2、gettext、ffmpeg,缺库时录音与导出会失败。
  • Windows:安装包未签名属正常现象;GPU 加速依赖 CUDA 12,旧版驱动会自动回落到 CPU。

🧩 自动化与扩展能力

命令行批量转录

命令行与 GUI 共享同一任务系统,完整参数见 docs/docs/cli.md:

buzz add -m whispercpp -s small -l zh --srt --vtt ./meeting.mp4 buzz add --task translate -l fr -m whispercpp --txt ./interview.mp3

插件机制

插件(1.4.5 起)在 Help → Plugins 中开关、排序和配置,典型内置插件:

  • AI Summary:调用 OpenAI 兼容 API 为长转录生成摘要。
  • Resize Transcript:把词级结果自动重组为字幕长度分段。
  • Skip Already Transcribed:已有结果时跳过,批量重导不重复计算。

自研插件可参考 buzz/plugins/ 目录中的结构与钩子写法。

与外部工具集成

  • 文件夹监控:新文件落盘即自动开始转录,适合夜间批处理。
  • 实时转录文本流:可边生成边写入 txt 文件,接入 OBS 等直播工具。
  • OpenAI 兼容 API:Base URL 可指向 Ollama 等自托管服务,用于摘要与翻译。

🔒 数据与隐私

  • 数据流向:音频、中间结果与转录文件全部保存在本机磁盘。
  • 本地化程度:除首次下载模型(或可选的 API 模式)外,处理全程不依赖网络。
  • 离线可用:模型缓存目录可整体复制到离线机器,Linux 下位于~/.cache/Buzz。
  • 开源可审查:MIT 协议,转录与数据逻辑可逐行审查。

Buzz 把导入、模型选择、转录、字幕编辑与导出收进同一个界面,适合把“录音到文稿”沉淀成固定流程。可从 README.md 查看各平台安装入口,再按需要扩展工作流。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询