FEATURED · 精选文章

faster-whisper 语音转文字:比原版 Whisper 快 4 倍的本地转写,新手 5 分钟上手

发布时间 / 2026/9/5 22:57:40
来源 / 创域科博编辑部
栏目 / 资讯中心
faster-whisper 语音转文字:比原版 Whisper 快 4 倍的本地转写,新手 5 分钟上手 faster-whisper 语音转文字:比原版 Whisper 快 4 倍的本地转写,新手 5 分钟上手【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper录完一上午的会议,转文字却要等一个多小时?语音转文字任务里的这个痛点,可以用 faster-whisper 解决。它是基于 Whisper 模型的本地转录方案,靠 CTranslate2 推理引擎提速,同样音频最多快 4 倍,内存占用还更低。 一句话说清 faster-whisper 是什么它是 Whisper 的快引擎版本。原始 Whisper 是 OpenAI 的开源语音识别模型,faster-whisper 不改模型权重,只把推理部分换成 CTranslate2 这个高性能 Transformer 引擎。精度基本不变,速度明显提升。音频解码由 PyAV 完成,系统里不用装 FFmpeg。 faster-whisper 适合什么场景长会议、讲座录音:几小时音频在本机转完,自带精确时间戳字幕制作:开词级时间戳,直接导出带时间点的文本隐私敏感场景:全程本地跑,不传云端接口二次开发:纯 Python API,方便接批处理和 VAD 过滤 5 分钟上手:安装 faster-whisper 并转录音频先装这一条命令,要求 Python 3.9 及以上:pip install faster-whisper下面是最小可用示例,加载 base 模型,转录本地音频并打印带时间戳的结果:from faster_whisper import WhisperModel model WhisperModel(base, devicecpu, compute_typeint8) segments, _ model.transcribe(audio.mp3) for segment in segments: print(f[{segment.start:.2f} - {segment.end:.2f}] {segment.text})注意:transcribe 返回的是生成器,只有遍历 segments 时转录才真正开始跑。⚡ 怎么让转录更快:GPU、量化与批量推理官方用 13 分钟音频测过,large-v2 模型在 RTX 3070 Ti 上的数据:方案耗时显存原 whisper (fp16)2分23秒4708MBfaster-whisper (fp16)1分03秒4525MBfaster-whisper 批量推理17秒6090MBfaster-whisper (int8)59秒2926MBCPU 上 int8 量化同样有效:small 模型在 i7-12700K 上,原实现要 6 分 58 秒,批量化后 51 秒。想用 GPU,先装 NVIDIA 依赖库:pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*然后把 device 改成 cuda,compute_type 用 float16 或 int8_float16。 核心能力与代码位置转录 翻译:task 参数可选 transcribe / translate,完整参数在 faster_whisper/transcribe.pyVAD 静音过滤:集成 Silero VAD,自动跳过无声段,逻辑在 faster_whisper/vad.py词级时间戳:transcribe 加 word_timestampsTrue,每个词都有起止时间批量转录:BatchedInferencePipeline 是 transcribe 的直接替代品,适合 GPU 提速 避坑指南:新手常踩的 3 个坑CUDA 版本不对:新版 ctranslate2 只支持 CUDA 12 cuDNN 9。CUDA 12 配 cuDNN 8 就降级到 4.4.0,CUDA 11 用 3.24.0,命令是 pip install --force-reinstall ctranslate24.4.0为什么没开始转录:segments 是生成器,要用 for 循环或 list() 消费它,否则一行都不会算速度对比不公平:这里默认 beam_size5,原 whisper 默认是 1。对比性能前先把 beam_size、线程数对齐写在最后faster-whisper 适合所有想把语音转文字做到本地、快、省内存的场景。建议先在 CPU 上跑通 base 模型,再按需求上 CUDA 和 int8。项目采用 MIT 许可证,商业使用也没问题。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻