faster-whisper语音转文字教程4倍速的语音识别5分钟从安装到上手【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper13分钟的录音原版openai/whisper要跑2分23秒。faster-whisper基于CTranslate2推理引擎重写了Whisper模型一种把语音变成文字的Transformer模型在保持相同准确率的前提下最高提速4倍占用内存也更少。一条命令装好几行代码就能出转录结果。为什么值得用它 指标具体表现速度13分钟音频GPU上约1分03秒完成large-v2fp16批量加速开启批量推理后同样音频只需17秒内存INT8量化后显存从4525MB降到2926MB语言自动检测98种语言并给出检测结果和置信概率时间戳句级时间戳之外还支持精确到单个词的时间戳三步完成安装与首次语音识别 ⚡环境要求每条一行Python 3.9及以上GPU用户需安装CUDA 12对应的cuBLAS和cuDNN 9无需手动装FFmpeg解码由依赖库PyAV自动处理安装只需一条命令pip install faster-whisper最小示例保存一段音频为audio.mp3运行下面代码就会打印出每句的开始、结束时间和文字from faster_whisper import WhisperModel model WhisperModel(small, devicecpu, compute_typeint8) segments, info model.transcribe(audio.mp3) for s in segments: print(f{s.start:.2f} - {s.end:.2f} {s.text})核心功能详解 ️模型尺寸与计算类型怎么选model_size决定精度和速度tiny最快small均衡medium质量高large-v3精度最高turbo和distil-large-v3则是更快的大模型选项。compute_type决定计算方式GPU用float16速度最佳显存紧张时换int8_float16可省一半显存纯CPU环境建议int8。其余可用参数见WhisperModel源码。批量转录用batch_size换速度BatchedInferencePipeline可以直接替代WhisperModel先照常创建模型再包一层pipeline调transcribe时传入batch_size即可。实测large-v2在GPU上从1分03秒降到17秒batch_size8。批量模式下VAD过滤默认开启适合一次处理长音频。词级时间戳精确到每个词给transcribe加word_timestampsTrue每个分段里会多出words列表每个词都带起止时间。做字幕、歌词对齐、术语检索都靠它。中文、日语等不用空格分词的语言有特殊处理逻辑实现在tokenizer.py。VAD过滤器自动跳过静音传vad_filterTrue后内置的Silero VAD会先剔除非语音片段再送去转录。默认策略偏保守只去掉超过2秒的静音想更激进可传vad_parametersdict(min_silence_duration_ms500)。参数明细见vad.py。这些场景特别适合它 会议记录把录音直接交给transcribe项目按句输出带时间戳的文本并自动识别语言你得到一份能按时间点检索跳看的纪要。视频字幕开启词级时间戳项目输出每个词的起止区间得到逐词对齐、可直接导入剪辑软件的字幕文件。长篇播客叠加VAD过滤加批量转录项目先剪掉静音再并行处理耗时和显存都明显下降适合大量空闲时长的长录音。避坑指南 ️调了transcribe却没有输出segments是生成器开始迭代才会真正转录外面套一层list(segments)即可。GPU显存不足OOM换compute_typeint8_float16或改用更小的模型。CPU上跑得慢用compute_typeint8small模型从2分37秒降到1分42秒内存占用也更低。CUDA 11或cuDNN 8报依赖错误新版ctranslate2只支持CUDA 12加cuDNN 9降级安装pip install ctranslate23.24.0可兼容。静音太多浪费时间开启vad_filterTrue若过滤太狠丢掉了短句把min_silence_duration_ms调大。faster-whisper把语音识别的速度、内存和易用性都放在了实际可用的水平上先用small模型跑通再按硬件调整compute_type和batch_size即可。找一段手边的音频把上面的示例跑一遍一分钟内你就能看到第一份转录结果。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考