Buzz 本地转录从音频文件到可导出字幕的 5 步流程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的本地音频转录工具在你自己的电脑上完成语音转文字和翻译音频文件不需要上传到任何服务器。适合处理会议录音、采访素材这类不方便交给在线服务的内容。下面按你实际操作 Buzz 本地转录的顺序走一遍从安装到导出字幕的完整路径。装好 Buzz 并完成首次启动本章解决把工具跑起来的问题。选择一种安装方式pip 安装跨平台通用先装好 ffmpeg 和 Python 3.12然后执行pip install buzz-captions python -m buzzmacOS / Windows从 SourceForge 的 buzz-captions 项目页下载 .dmg 或安装包。Windows 版未签名安装时选更多信息 → 仍要运行即可。Linuxflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz详见 安装文档。从源码git clone https://gitcode.com/GitHub_Trending/buz/buzz后按仓库 pyproject.toml 的说明构建适合需要最新功能的用户。首次启动会提示下载 Whisper 模型网络不佳时可稍后在偏好设置里补下。确认主界面出现空的任务列表、工具栏的按钮和左侧的转录设置面板即代表环境就绪。⚠️ GPU 用户注意pip 安装的版本如需 Nvidia CUDA 加速需额外安装对应版本的 torch参考 README 的 GPU 说明Mac 的 Apple Silicon 和多数 GPU 的 Vulkan 加速由 Whisper.cpp 后端原生支持。第一次转录导入文件并跑完一个任务本章解决拿到第一个转录结果的问题这是最小可用流程。点击工具栏的按钮或按CtrlO→ 选择一个音频或视频文件也支持直接粘贴 URL 导入网络视频。在左侧设置区做三个选择TaskTranscribe转成原语言文本或Translate to English直接翻译成英文Language建议手动指定语言自动检测在方言或混合语境下容易跑偏Model先用默认即可模型取舍下一节再讲。点击Run。任务进入队列状态变为Completed即结束。双击该任务行或选中后点⤢图标打开转录查看器左侧播放音频、右侧逐段对照文本确认结果。两个省时间的选项藏在任务行的Advanced...按钮里Initial prompt把容易听错的专有名词人名、产品名写进去能显著减少同音误写Word-Level Timings生成单词级时间戳为后面按标点重切字幕做准备。批量转录与命令行自动化文件多起来之后逐个点Run不现实。这一章给出三种批处理方式由轻到重。GUI 多选在文件选择对话框里按住Ctrl选多个文件一次性加入队列每个任务可以独立设置模型和语言。Folder Watch 自动转录打开偏好设置Ctrl,→ Folder Watch 选项卡指定一个目录之后新放进该目录的音频会自动开始转录。适合录完往文件夹一扔就走的工作流配置细节见 偏好设置文档。CLI 无界面模式Buzz 自带命令行入口buzz add关键参数完整列表见 CLI 文档buzz add -m whispercpp -s small -l zh \ --srt --txt --hide-gui \ ~/recordings/meeting.mp3-m选后端whisper / whispercpp / fasterwhisper 等-s选模型大小-l指定语言--srt --txt指定导出格式--hide-gui让任务后台跑完自动退出。把这条命令写进 shell 循环或 cron就是一个定时批处理管道。提示CLI 里不指定-l时默认自动检测语言--word-timestamps可在命令行直接开启单词级时间戳。选模型在速度与准确率之间取舍转录质量最终由模型决定。这一章解决该装哪个模型、参数怎么配的问题。打开偏好设置Ctrl,→Models选项卡这里统一管理所有模型的下载和删除。按这个思路选tiny / base速度快、内存占用低实时录音、嘈杂初筛、长音频快速出草稿small / medium准确率明显提升是多数场景的平衡点large最准但最慢留给需要交付级的内容。想要更快换后端Whisper.cpp支持 CPU、Nvidia CUDA 和 Vulkan含核显实时录音场景官方文档也建议用它Faster Whisper和Hugging Face系模型走 GPU 路线OpenAI API后端则适合不想吃本地算力的场景。显存紧张时在模型大小里选量化版本如q5之类或用 Custom 选项粘贴社区模型的 .bin 下载地址偏好设置里还有Reduce GPU RAM开关进一步压缩显存占用。经验值日常保留 tiny medium 两个模型足够覆盖快速草稿和认真转录两种需求长音频先用小模型出全稿再只把关键段落换大模型重跑比整体上大模型省时间得多。转录精修与字幕导出转录结果很少能直接交付这一章把结果变成可用的文本或字幕文件。双击任务行打开转录查看器直接点击文本单元格即可修改文字用Ctrl←/→按 0.5 秒步进调整片段起止时间CtrlShift←/→调整结束时间配合CtrlF搜索定位问题段落点击工具栏Resize重排字幕设置单条字幕最大长度、是否按标点断句开启 Word-Level Timings 的转录还能分析音频静音点来对齐切分位置另可给每条字幕加延长显示时间导出工具栏Export菜单支持 SRT、VTT、TXT、JSON 等格式文件名可用偏好设置里的模板含日期、任务名等变量统一命名锦上添花的插件AI Summary 生成会议摘要、Speaker Identification 区分说话人、Transcript Resizer 自动重排字幕都在Plugins菜单里启用见 插件说明。字幕排版上有个通用底线单行不超过 40 个字符、每条字幕至少留 0.5 秒显示余量导出前用 Resize 过一遍再交付。到这里Buzz 本地转录的完整链路就闭环了装好应用 → 导入文件出结果 → 用 CLI 或 Folder Watch 上量 → 用模型参数调质量 → 用查看器和 Resize 精修导出。下一步建议拿一段真实会议录音完整走一遍第二、五章的流程重点试一次word-level timings Resize的组合这是产出可用字幕最顺的路径。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考