
Insanely Fast Whisper 模型选择指南large-v3 还是 distil-large-v23 分钟做出决定【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisperInsanely Fast Whisper 是一个跑在本地 GPU 上的语音转文字音频转录命令行工具能把 2.5 小时的音频在 2 分钟出头转完。但装好之后第一个拦路虎往往是模型该选 large-v3 还是 distil-large-v2本文直接给出「场景 → 模型」对照表和两条可复制的命令帮你省掉反复试错的决策成本。30 秒速查表你的场景对应哪个模型先对号入座再往下看细节你的情况推荐模型一句话理由显存充足NVIDIA 大显存卡、A100 级别精度优先large-v3默认全尺寸旗舰复杂音频表现更稳显存紧张Mac、12~16GB 显存级怕 OOMdistil-large-v2参数更少同样能跑更高 batch长音频归档、批量转写追求吞吐distil-large-v2同等优化下转录速度更快法律、学术等对准确率敏感的正式文档large-v3宁可慢一点也要字字准确会议实时字幕、对延迟敏感distil-large-v2快就是第一指标拿不准先跑通流程large-v3它就是 CLI 的默认模型什么都不用加转录速度差距到底有多大先看项目作者在 NVIDIA A100 80GB 上测的数据同样是 150 分钟音频开启 Flash Attention 2 后large-v3 约 1 分 38 秒distil-large-v2 约 1 分 18 秒。两个结论值得注意在这台高配卡上两者都很快差距约 20 秒对一次性转写影响不大但蒸馏模型可以理解为「大模型当老师、小模型当学生」训出来的精简版参数更少在显存受限、batch 开不满的中低端设备上速度优势通常会放大。具体到你的机器上会是多少建议拿同一段音频各跑一遍README.md 里的基准表可以作为对照基准。显存和磁盘各要留多少磁盘large-v3 的权重文件下载下来约 3GBREADME 演示环境里显示为 3.09GB 的 safetensors 文件safetensors 就是模型权重的一种安全存储格式distil-large-v2 更小一些。首次运行会自动下载注意预留空间。显存两者默认都按半精度fp16加载。Mac 用户按 README 的经验值--batch-size 4大约占用 12GB 显存即可稳定跑NVIDIA 卡若遇到 OOM显存不足报错把--batch-size调小即可这是官方 FAQ 给出的通用解法。想榨干速度的话--flash True开启 Flash Attention 2 是目前收益最大的优化项。蒸馏模型会明显变笨吗诚实说仓库没有公开 large-v3 与 distil-large-v2 的准确率对比数值所以不给你编数字。可以把握的大方向是日常清晰人声会议、播客、英文演讲上distil-large-v2 的输出质量通常够用当音频里出现专业术语密集、口音重、多人抢话、背景嘈杂这类情况时large-v3 作为全尺寸模型更不容易翻车。拿不准就用同一段「最难听」的音频各转一遍肉眼比对错字率5 分钟就能得出结论。两条命令跑起来安装、运行与切换模型安装一次即可需 NVIDIA GPU 或 Macpipx install insanely-fast-whisperlarge-v3 就是默认模型直接跑切换到 distil-large-v2 只改一个参数# 默认即 large-v3 pipx run insanely-fast-whisper --file-name https://huggingface.co/datasets/reach-vb/random-audios/resolve/main/ted_60.wav # 切换 distil-large-v2 pipx run insanely-fast-whisper --file-name https://huggingface.co/datasets/reach-vb/random-audios/resolve/main/ted_60.wav --model-name distil-whisper/large-v2完整参数时间戳粒度、说话人分离等都在 src/insanely_fast_whisper/cli.py 中定义--help可查看全部想自己写代码调用的话notebooks/ 里还有 Colab T4 上的推理示例。选型结论一句话显存紧张或追求转录速度的场景实时字幕、批量归档、边缘设备选 distil-large-v2精度优先、显存充裕的正式转写任务直接用默认的 large-v3。两者切换只隔一个--model-name参数没有理由不拿真实音频各跑一次再做最终决定。想继续深入的可以看 README 的 FAQ 了解 Flash Attention 2 的安装方式和 Mac 端的显存调优。【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考