
faster-whisper 语音转文字13 分钟音频最快 17 秒转写完成【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper开完两小时的会光整理录音就要耗掉一个下午。faster-whisper 用 CTranslate2 重新实现了 OpenAI 的 Whisper 语音转文字引擎相同准确率下速度最高提升 4 倍、占用更少内存自动检测 98 种语言逐句输出带起止时间戳的转录文本。 装好并跑通第一段转写环境要求 Python 3.9 以上有 NVIDIA GPU 的机器需要 CUDA 12 的 cuBLAS 和 cuDNN 9CPU 则零额外依赖。安装只要一条命令pip install faster-whisper它和 openai/whisper 有个实用区别不需要系统单独装 FFmpeg音频解码由依赖里的 PyAV 库内置完成。跑通脚本后如果想看基准测试或完整参数文档可以从 gitcode 克隆仓库git clone https://gitcode.com/GitHub_Trending/fa/faster-whisperbenchmark/ 目录里有现成的速度测试脚本。 选对模型尺寸和计算类型它帮你解决的问题同样的转写结果faster-whisper 用更少的时间算出来。官方基准里 13 分钟音频、large 模型、RTX 3070 上fp16 精度下 openai/whisper 要 2 分 23 秒faster-whisper 1 分 03 秒换成 batch_size8 的批量转录加 8 位量化16 秒跑完显存仅 2926MB。模型尺寸按需选tiny 测试用small 是日常默认large-v3 追求精度时上它distil-large-v3 是蒸馏版推理接近 tiny、精度接近 large-v3。计算类型按硬件选首次加载会自动下载模型并缓存from faster_whisper import WhisperModel # 有 GPU 且显存宽裕时选 float16 model WhisperModel(large-v3, devicecuda, compute_typefloat16) # 显存紧张换 int8_float16纯 CPU 用 devicecpu compute_typeint8 segments, info model.transcribe(audio.mp3, beam_size5) print(info.language, info.language_probability) for seg in segments: print(seg.start, seg.end, seg.text)长录音建议同时打开静音过滤它内置 Silero VAD默认剔除超过 2 秒的静音段空档多的大幅省时segments, _ model.transcribe(audio.mp3, vad_filterTrue)需要逐词字幕时在 transcribe 里加 word_timestampsTrue无需再写对齐逻辑。 两个真实的使用场景播客剪辑两小时访谈变带轴字幕一位做访谈播客的编辑每期两小时的 raw 音频过去要手动听一遍再敲字幕。接入 faster-whisper 后用 large-v3 加 int8 量化转写打开 VAD 过滤和逐词时间戳导出结果直接导入剪辑软件当字幕轴用。她说现在最耗时的步骤从听录音变成了改错别字。批量入库几十期旧内容一次转完一个自媒体账号把 40 期旧音频统一转文字归档方便后台搜索关键词。用 BatchedInferencePipeline 配合 batch_size16 做批量转写代码见 faster_whisper/transcribe.py批量模式下 VAD 默认启用长静音自动跳过40 期音频在一个工作日内跑完。⚠️ 常见坑和对应的解法CUDA 版本不匹配。现象GPU 初始化报错、提示找不到 CUDA 或 cuDNN 库。原因新版 ctranslate2 只支持 CUDA 12 cuDNN 9装的是 cuDNN 8 或 CUDA 11。解法cuDNN 8 环境降级到 ctranslate2 4.4.0CUDA 11 环境用 3.24.0Linux 上也可以直接pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*再设置 LD_LIBRARY_PATHWindows 用户把对应库文件放进 PATH 即可。内存不够。现象显存或内存溢出报错。原因模型和 batch 尺寸偏大。解法GPU 上把 compute_type 降到 int8 系列或减小 batch_sizeCPU 上换 small 以下模型并开 int8 量化基准里 small 模型 int8 下内存占用从 2257MB 降到 1477MB。transcribe 之后没反应。现象调用 transcribe 返回后长时间无输出。原因segments 是生成器真正推理要等你遍历它才发生。解法先用 list(segments) 接住或确认自己在 for 循环里消费结果。另外模型加载时若本地没有会先从 Hugging Face 下载 CTranslate2 格式权重生产服务建议在启动时预加载别等第一个请求才拉模型。 想调参数时看哪里VAD 的静音阈值、最小语音时长等参数默认值都在 faster_whisper/vad.pytranscribe 时可用 vad_parameters 传入自定义字典比如把 min_silence_duration_ms 从默认的 2000 调到 500。把一段自己的会议录音丢进去试试先从 small 模型加 CPU int8 跑通流程确认结果可用再决定要不要上更大模型。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考