FEATURED · 精选文章

录音噪音太重怎么办?用免费开源的 ClearerVoice-Studio 一键还原清晰语音

发布时间 / 2026/8/19 18:54:46
来源 / 创域科博编辑部
栏目 / 资讯中心
录音噪音太重怎么办?用免费开源的 ClearerVoice-Studio 一键还原清晰语音 录音噪音太重怎么办用免费开源的 ClearerVoice-Studio 一键还原清晰语音【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio上周末我帮一位做播客的朋友剪辑音频。她特意挑了安静的咖啡馆录音可回放时空调的低鸣声、窗外的车流声全被麦克风收了进来40 分钟的人声被杂音埋得几乎听不清。那一刻我才明白录音里的噪音不是把音量调大就能解决的。朋友后来发给我一个开源项目——ClearerVoice-Studio一个基于 AI 的语音处理工具包几行代码就能把噪音清掉让原本模糊的人声重新立起来。这篇文章就是带你从零上手它的完整过程。一句话认识它这个 AI 语音处理工具到底能做什么ClearerVoice-Studio 是一个免费开源的 AI 语音处理工具包它像给语音做手术一样能去掉背景噪音、把混在一起的人声分开、把低采样率的旧录音补回高音质甚至能盯着视频里的人脸只提取目标说话人的声音。它适合三类人想拯救糟糕录音的内容创作者、想把语音处理能力接进自己产品的开发者以及需要模型训练与效果评估的研究人员。好消息是——绝大多数场景下你只需要会复制粘贴几行 Python 代码。先看几个让人心动的点开箱即用预训练模型在首次运行时自动下载pip install clearvoice一条命令就能装好。一包四能力语音增强去噪、语音分离、语音超分辨率、目标说话人提取一个接口全部覆盖。批量省心支持单个文件、整个文件夹、scp 列表文件三种输入方式几十段音频一次处理完。格式通吃wav、mp3、aac、flac、ogg、aiff 等常见格式都能直接读入。自带体检配套的 SpeechScore 提供 18 项语音质量指标效果好坏用数据说话不靠我觉得。零基础第一课三行代码让一段嘈杂语音变干净先安装打开终端输入pip install clearvoice如果你处理的文件不是 wav 格式比如 mp3、aac、flac建议顺手装一下 FFmpeg它是格式转换的底层依赖Ubuntu 上执行sudo apt install ffmpeg即可。然后新建一个 Python 文件粘贴下面这段from clearvoice import ClearVoice # 初始化选择语音增强任务和全频带去噪模型 myClearVoice ClearVoice(taskspeech_enhancement, model_names[MossFormer2_SE_48K]) # 处理单个音频文件返回增强后的波形 output_wav myClearVoice(input_path你的录音.wav, online_writeFalse) # 保存结果 myClearVoice.write(output_wav, output_path去噪后的录音.wav)第一次运行时模型权重会从远端自动下载到本地的checkpoints目录你不需要手动找模型文件。跑完去听一听输出文件——背景杂音消失了人声会变得干净利落这种手术前后的对比感非常直观。如果你有一整个文件夹的音频要处理把代码换成myClearVoice(input_path放满音频的文件夹, online_writeTrue, output_path输出文件夹)一次调用全部搞定。能力进阶从去噪到分离人声再到修复音质跑通第一个示例后你会发现它远不止去噪这么简单。按照下面的路径一步步往上走就知道什么时候该用哪个能力了。第一步去噪也就是语音增强。这是最常用的场景录音里有空调声、键盘声、马路噪音。工具包提供了三个预训练模型按需选择FRCRN_SE_16K速度快适合追求效率的场景MossFormerGAN_SE_16K效果最好PESQ 得分在同测试集上领先MossFormer2_SE_48K是全频带模型适合 48kHz 高音质素材。刚上手时用MossFormer2_SE_48K体验最稳。第二步当录音里有两个人同时说话就该上语音分离了。会议记录、访谈素材常遇到这种问题。把 task 换成speech_separation模型换成MossFormer2_SS_16K它会把混合音频拆成两个独立的人声文件myClearVoice ClearVoice(taskspeech_separation, model_names[MossFormer2_SS_16K]) output_wav myClearVoice(input_path两人对话.wav, online_writeFalse) myClearVoice.write(output_wav, output_path分离结果.wav) # 会生成 spk1 和 spk2 两个文件第三步面对老旧录音试试语音超分辨率。翻出来的老磁带、低码率录音采样率只有 16kHz 甚至更低声音发闷发糊。MossFormer2_SR_48K能把它们补回 48kHz 的高音质。更妙的是它还可以和去噪模型串联使用——先增强去噪再超分辨率提升采样率一条流水线把又噪又糊的音频修成干净清晰的状态。第四步想锁定视频里特定的人试试目标说话人提取。这是最有意思的一个能力输入一段有多个说话人的视频模型通过人脸检测锁定你要提取的那个人只保留他的声音。模型名是AV_MossFormer2_TSE_16K支持 avi、mp4、mov、webm 等常见视频格式。给开发者的彩蛋numpy 进 numpy 出。如果你想把模型嵌入自己的训练或推理管线不想走文件读写项目提供了 numpy 接口——直接把波形数组喂进去拿波形数组出来还支持批量输入。参考示例在 clearvoice/demo_Numpy2Numpy.py非常贴心。给研究者的进阶完整训练与微调脚本。如果你不满足于用现成模型项目train/目录下提供了语音增强、分离、超分辨率、目标说话人提取等任务的完整训练脚本还有专门的数据生成脚本可以按自己的数据做微调或重新训练。对应的目录是 train/speech_enhancement、train/speech_separation 等。新手最容易踩的 5 个坑坑一装了库但 mp3、aac 读不进来。很多人只跑了pip install clearvoice就急着处理 mp3结果报错。解决办法很简单——安装 FFmpeg。它是所有非 wav 格式的底层依赖装上之后格式问题基本消失。坑二采样率对不上输出音质怪怪的。模型名字里的16K和48K不是装饰它代表模型期望的输入采样率。用 numpy 接口时尤其要注意代码里通常需要先用librosa.resample把音频重采样到模型要求的采样率。用文件接口时工具会自动处理好但你自己写调用逻辑时别忘了这一点。坑三以为模型要手动下载结果卡在网络问题上。预训练模型是自动从远端下载的不需要你手动找。如果自动下载失败去 ModelScope 手动下载权重放到clearvoice/checkpoints目录即可。坑四任务选错了。两个说话人混在一起用去噪模型解决不了——去噪是去背景噪音分离才是拆人声。场景判断错了效果自然不对。记住噪音多→增强人声混→分离音质差→超分辨率视频里找特定人→目标说话人提取。坑五一上来就喂超长音频把显存爆了。超过几分钟的长音频建议先切成 30~60 秒的片段再批量处理既省内存也好排查问题。效果如何用数据说话光说有效不够我们用项目公开的评测数据看看它到底有多能打语音增强在 VoiceBankDEMAND 测试集上MossFormerGAN_SE_16K把 PESQ感知语音质量分越高越好从带噪状态的1.97 拉到 3.47在 DNS-Challenge 2020 测试集上更是从1.58 提升到 3.57。语音分离MossFormer2_SS_16K在 LRS2-2Mix 上取得15.5 dB的 SI-SNRi在 WHAM! 测试集上达到 17.4 dB与当前顶级模型持平。语音超分辨率把 16kHz 音频补到 48kHzLSD对数谱距离越低越好从2.80 降到 1.93听感改善非常明显。真实使用量FRCRN 去噪模型在 ModelScope 上已被调用超过300 万次MossFormer 分离模型超过250 万次——这些数字本身就是口碑。这些评测分数是怎么来的项目自带的 SpeechScore 工具包集成了 PESQ、STOI、DNSMOS、SI-SDR、NISQA 等 18 项主流语音质量指标。你处理完一段音频后可以自己跑一遍评分把我觉得变好了变成一组客观数字from speechscore import SpeechScore mySpeechScore SpeechScore([PESQ, STOI, DNSMOS, SISDR]) scores mySpeechScore(test_path去噪后的录音.wav, reference_path原始干净录音.wav, windowNone, score_rate16000, return_meanFalse) print(scores)值得一提的是DNSMOS、SRMR、NISQA 这类非侵入式指标不需要干净参考音频只有一段处理结果也能打分非常适合没有干净底稿的场景。下一步动手试一次加入社区现在轮到你了。最快的体验路径有三条任选其一跑在线 Demo项目在 HuggingFace 和 ModelScope 上都部署了在线体验空间不用装任何东西上传音频就能看到效果适合先感受一下再动手。跑本地示例源码仓库里带了demo.py、demo_with_more_comments.py和demo_Numpy2Numpy.py三个演示脚本从源码安装后直接运行改改开关就能切换任务。想从源码安装的话克隆命令是git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio cd ClearerVoice-Studio/clearvoice pip install --editable .带着自己的录音测试找一段你最头疼的嘈杂录音套用上面的最小示例跑一遍听听输出文件——相信我第一次听到手术前后的差异时你会忍不住把家里所有旧录音都翻出来处理一遍。如果你在使用的过程中遇到问题或者想和做语音技术的同学交流项目有官方钉钉交流群扫描上面的二维码即可加入群二维码会不定期更新如果发现过期去仓库 README 里找最新版本就行。语音处理不应该只是研究员桌上的论文实验。当一段差点被删掉的录音经过几行代码重新变得清晰可辨时那种挽救了一段记忆的满足感就是技术最动人的样子。去试试吧。【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻