faster-whisper4 倍速本地语音转写【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper用 openai/whisper 原版转音频是慢活13 分钟音频在 GPU 上要跑 2 分 23 秒、显存峰值约 4.7GB笔记本上跑大模型常常直接爆显存把音频传给第三方 API又有隐私和费用顾虑。faster-whisper 用 CTranslate2 推理引擎重写了 Whisper同样精度下速度最高约为原版的 4 倍同一段 13 分钟音频fp16 下要 1 分 03 秒int8 量化下 59 秒就能跑完显存占用从 4708MB 降到 2926MB。全程不需要任何云端服务模型下载和推理都在本地完成。跑通最小闭环环境要求很低Python 3.9 以上即可系统里不需要装 FFmpeg音频解码由依赖的 PyAV 包处理。硬件前提两行说清有 NVIDIA GPU 需驱动 CUDA 12 cuBLAS/cuDNN 9官方 README 给出了配套 Docker 镜像nvidia/cuda:12.3.2-cudnn9-runtime-ubuntu22.04没有 GPU 也没关系CPU int8 开箱即用。安装一条命令pip install faster-whisper首次运行会自动从 Hugging Face Hub 下载模型。下面这段脚本加载 base 模型并把一段音频转成带时间戳的文本from faster_whisper import WhisperModel # 无 GPUdevicecpu int8有 NVIDIA GPUdevicecuda float16 model WhisperModel(base, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3) print(info.language, round(info.language_probability, 3)) # segments 是生成器转写真正开始于遍历之后 for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})三个值得试的工作流1. 批量视频出字幕。输入一批视频文件处理时把调用换成批量接口BatchedInferencePipeline(model).transcribe(..., batch_size8)VAD 默认开启输出带时间戳的段落直接落盘就是 SRT。关键参数是batch_sizeRTX 3070 Ti 上 large-v2 fp1613 分钟音频从 batch1 的 1 分 03 秒压到 batch8 的 17 秒代价是显存涨到约 6GB。2. 长会议录音切分检索。输入一两个小时会议录音处理靠 VAD 过滤按静音间隔切段输出每句发言一个 segment按seg.text里包含关键词即可过滤检索。关键参数是vad_parametersdict(min_silence_duration_ms500)默认只裁掉 2 秒以上的静音发言密集的录音建议降到 500ms。3. 端侧偏置专有名词的识别。输入设备上的口述或指令处理用 small 模型 int8 量化纯 CPU 也可用输出识别文本。关键参数是hotwords公司名 产品名解码会向自定义词表倾斜人名、产品名这类专名的识别表现会相应改善。参数怎么选下表是官方 README 基准里 beam_size5 的实测耗时与内存模型硬件基准配置compute_typebeam_size13 分钟音频耗时 / 内存large-v2RTX 3070 Ti 8GBCUDA 12float165约 1 分 03 秒 / 显存 4525MBlarge-v2RTX 3070 Ti 8GBint8_float165约 59 秒 / 显存 2926MBsmalli7-12700K8 线程int85约 1 分 42 秒 / 内存 1477MBdistil-large-v3GPUbatch_size16float16525 分 50 秒transformers 同配置 46 分 12 秒表里没写但容易踩的三个坑VAD 默认开启但只裁 2 秒以上的静音短停顿多的录音把min_silence_duration_ms降到 500设太低反而把背景噪音当语音收进来。condition_on_previous_text默认开启让上下文连贯卡在重复循环同一句话反复输出时改成 False 可恢复跑 distil-large-v3 时官方示例也建议设为 False。爆显存的降级顺序float16 → int8_float16 → 降一档模型 → 调低 beam_sizeCPU 用户先看OMP_NUM_THREADS线程开太多不提速反而抖动。踩坑与排错启动报 CUDA / ctranslate2 加载失败最新版 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 环境请钉版本pip install --force-reinstall ctranslate23.24.0。transcribe() 立刻返回、看不到任何输出segments 是生成器遍历才开始转写先list(segments)再处理。语言检测错了别依赖自动检测直接指定model.transcribe(audio.mp3, languagezh)。首次运行下载模型很慢模型从 Hugging Face Hub 拉取网络差的环境可手动下载模型后让 WhisperModel 指向本地目录。延伸阅读模型清单按精度/速度取舍tiny / base验证环境、小体积 CPUsmall日常平衡速度与精度medium中英混合、较长音频large-v3精度最高需 GPUturbo显存充裕的 GPU 上更快distil-large-v3蒸馏版比 transformers 同批快约 1.8 倍需指定语言源码入口项目 README、推理主入口、VAD 参数与默认值。需要完整代码时执行git clone https://gitcode.com/GitHub_Trending/fa/faster-whisper。生态项目均为社区开源speachesOpenAI 兼容 API 服务Docker 部署WhisperX说话人分离 词级时间戳whisper-ctranslate2命令行客户端WhisperLive近实时转写先用 base int8 跑一段 10 秒音频验证环境再按上表升到 small/medium最后再决定要不要上 large-v3。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考