
Buzz 离线语音转写本地 Whisper 从安装到字幕导出【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的离线语音转写工具音频和转录结果全程留在你的电脑里不经过任何云端服务器。它同时提供图形界面和命令行支持文件导入、麦克风实时转写、多 Whisper 后端和 TXT/SRT/VTT 导出是处理会议录音、采访素材和课程录像时兼顾隐私与效率的本地方案。一条命令三分钟看到转写结果如果你已经装好 Python 3.12 和 ffmpeg最快的路径是走 PyPIpip install buzz-captions python -m buzz add -s tiny audio.mp3 --txt第二条命令会用 tiny 模型把audio.mp3转写为 TXT 文件模型缺失时会自动下载。图形界面党可以直接装发行版macOS 和 Windows 从官方发布页下载安装包Linux 用flatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz。首次启动后进 帮助 → 首选项 → 模型 把想要的模型下好后面就不用再等。核心能力逐项拆解装好之后Buzz 的功能可以拆成五个相对独立的模块按需取用即可。️实时录音转写麦克风实时出字适合开会和讲座。内置一个演示窗口可以把转写文字放大投到第二块屏幕上讲者侧不用盯着笔记本。录音转写的导出目录在 recording_transcriber_mode.py 相关设置里配置。多后端 Whisper 引擎同一个任务可以跑在五种引擎上选择逻辑很简单——有 N 卡显存 6GB 以上选 faster-whisper没有独显或想榨干 CPU 选 whisper.cppC 实现支持 Vulkan集成显卡也能跑实时转写想要社区微调模型选 huggingface 后端另外也接了 OpenAI API 做兜底的云端转写。多格式导出TXT、SRT、VTT 三种格式自由勾选导出文件名支持模板变量。想批量出字幕文件时在任务上同时勾--srt --vtt就行导出模板逻辑见 transcriber.py 中的 OutputFormat。说话人分离多人对话录音可以先跑语音分离speech separation再转写嘈杂音频准确率明显更好转写完成后进查看器还能做说话人识别把人 A/人 B标注出来。相关实现参考 whisper_diarization 集成。文件夹监控指定一个监控目录新音频落进去就自动排队转写。配合 transcription_task_folder_watcher 的行为逻辑你完全可以把它当成一个录音落盘即出稿的流水线节点。两个真实工作流你是跑外勤的记者采访对象刚说完你手里有一段 40 分钟的 MP3今晚就要交稿。导入文件后选 small 模型加提取语音选项CLI 里对应-e参数嘈杂环境下的准确率会好一截。转完直接进查看器全文搜索对方的名字和关键数字修正专有名词然后导出带时间戳的 TXT 当底稿。整个过程不需要把录音传到任何地方涉及敏感信源时这一点很关键。你是录课程的制作人你拿到 2 小时的教学录像 MP4要上 SRT 字幕。选 whisper.cpp 的 medium 模型有显卡就换 faster-whisper 的 large-v3勾 SRT 输出让它在后台跑。出来的字幕切分经常不合理——一句 30 秒的长句挂在屏幕上。这时用内置的字幕调整工具按最大长度和标点重新分段规则参数在 transcription_resizer_widget 里能看到调完再导出字幕文件直接进剪辑软件。选型与调优模型和引擎是转录效果与速度的主要变量先记住这张表引擎适用硬件特点whisper (OpenAI)大内存机器原始实现准确但慢、吃 RAMfaster-whisperN 卡 ≥6GB 显存比原生快一个量级省内存whisper.cpp任意 GPU/CPUC 优化支持 Vulkan核显可实时huggingface需要社区模型支持 MMS 千语言模型、Parakeet、Qwen3-ASR 等openaiapi有网且有 key云端兜底速度不占本地资源模型档位建议分三档轻量档老笔记本/纯 CPU用 tiny 或 base 的 whisper.cpp先拿到能用的稿子标准档现代 PC 或有独显的笔记本用 small/medium中文场景准确率基本够用重度档16GB 内存或 6GB 显存上 large-v3官方文档提醒它偶尔会脑补音频里不存在的词正式稿件建议人工过一遍。速度上有个粗略参照一段 10 分钟录音medium 模型在带独显的机器上约 1-2 分钟纯 CPU 可能要十几分钟卡住了先换 small 再排查。高频问题 FAQQ1完全没网的机器能用吗能。在有网的电脑上下载好模型按 帮助 → 首选项 → 模型 里的显示文件位置找到缓存目录Linux 是~/.cache/Buzz把整个目录拷到离线机的相同位置。仓库里还带了 download-models.py 帮你提前备一份离线模型缓存。Q2GPU 加速没生效Windows 安装包自带 CUDA 12 依赖老 CUDA 版本会静默回落到 CPULinux 上 N 卡开箱即用出问题就补装 CUDA 12、cuBLAS、cuDNN。Q3转写太慢怎么办先降模型档位或换 faster-whisperN 卡/whisper.cpp无独显。另外确认 CPU 支持 AVX2太老的机器跑不动。Q4录音转写时麦克风报错PaErrorCode-9999九成是系统权限Windows 去 设置 → 隐私 → 麦克风 里给 Buzz 开权限或临时关杀毒软件测试一下。Q5要转系统声音屏幕里的声音怎么录Buzz 录的是麦克风源系统音频要先走虚拟声卡macOS 用 BlackHoleWindows 用 VB-CABLELinux 用 PulseAudio 路由然后把虚拟设备选为输入源。扩展入口插件系统AI 摘要、说话人识别、深度降噪、DOCX 导出等插件放在 plugins/写一个继承BuzzPlugin的plugin.py就能挂进生命周期钩子规范见 base.py。命令行buzz add一个子命令覆盖全部参数任务类型、引擎、语言、初始提示词、时间戳、输出格式--hide-gui可以纯后台跑完整参数见 docs/docs/cli.md。翻译任务--task translate直接把外语音频转成英文文本配合-l指定源语言。问题反馈崩溃日志在 帮助 → 关于 → 显示日志 里找配合源码定位或提 issue。仓库地址https://gitcode.com/GitHub_Trending/buz/buzzgit clone后可看全部源码与测试。装上来随便丢一段 10 分钟录音进去转完你就知道它值不值得放进你的工作流。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考