FEATURED · 精选文章

3步上手RVC变声框架:用10分钟语音克隆出你的专属AI歌声

发布时间 / 2026/9/2 22:43:27
来源 / 创域科博编辑部
栏目 / 资讯中心
3步上手RVC变声框架:用10分钟语音克隆出你的专属AI歌声 3步上手RVC变声框架用10分钟语音克隆出你的专属AI歌声【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI简称 RVC是一个基于 VITS 的开源语音转换框架它的核心能力是 AI 语音克隆——只要 10 分钟低底噪的录音就能训练出可实时变声、可替换他人音色的声音模型。适合想快速体验 AI 变声的创作者、配音爱好者以及不想折腾命令行的新手。 一图看懂 RVC 能做什么先花 30 秒建立全局印象下表覆盖你最常用的四类操作核心功能帮你解决什么在哪里操作模型训练把几十分钟录音变成一个专属音色模型WebUI「训练」选项卡离线推理把一段音频换成目标音色WebUI「推理」选项卡实时变声说话或唱歌时低延迟换声端到端可低至 90ms实时变声界面gui_v1.py人声伴奏分离调用 UVR5 把歌声和伴奏拆开WebUI「UVR5」选项卡它最大的优点是门槛低即使显卡不算顶级也能跑得动数据量小也能出可用结果。 装完就能跑一条路径备齐环境环境准备按「系统要求 → 装依赖 → 拿预置资源」三步走走完整机就可用。系统要求Python 3.8 以上并安装好 ffmpegUbuntu/Debian 用sudo apt install ffmpegMacOS 用brew install ffmpegWindows 把 ffmpeg.exe 放到项目根目录即可。装依赖按你的显卡选一行其余照搬官方说明。你的环境先装 PyTorch再装项目依赖N 卡pip install torch torchvision torchaudiopip install -r requirements.txtA 卡 / I 卡同上pip install -r requirements-dml.txtMacOS运行sh ./run.sh一键装好同一脚本自动处理拿到代码只需一条命令克隆后进入目录即可git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI拿预置资源RVC 还需要几个预训练模型才能工作。跑下面这条脚本它会自动把 Hubert、预训练权重、UVR5、RMVPE 音高模型都下载到assets对应目录python tools/download_models.py 提示下载慢时不必慌。这些文件都能从 Hugging Face 上的官方 space 手动补下脚本只是替你省去了逐个点对应目录的麻烦。 第一次运行先启动再做一件事启动方式按平台挑一个平台启动动作打开地址Windows双击go-web.bat自动弹出浏览器MacOSsh ./run.sh后自动起自动弹出浏览器通用python infer-web.py默认http://localhost:7860界面打开后先做的一件事是看顶部「显卡信息栏」它会列出你每张卡的型号和显存帮你确认 RVC 认出了正确的卡。认对了后面训练和推理才不会莫名走 CPU。想换推理用的卡号改configs/config.py里device的cuda:后面数字即可映射关系就显示在显卡信息栏里。 按场景上手场景一训练一个专属音色模型你要达成什么把目标声音的录音变成一个可复用的音色模型。分步操作在「训练」选项卡填入训练集音频路径和实验名点一键训练流程会自动切分音频、提取音高与特征、训练模型并建立索引。你会看到什么控制台打印处理日志完成后weights文件夹下出现 60MB 以上、可推理的.pth小模型同时生成added_开头的索引文件。 提示分享或推理要用weights下那个 60MB 的模型而不是logs里几百 MB 的中间文件。后者的作用只是复现和续训直接拿去推理会报缺 key 的错。场景二把一段音频换成目标音色你要达成什么上传一段录音输出换成目标音色后的版本。分步操作在「推理」选项卡选择刚训好的模型和对应索引填入待转换音频选定音高提取算法RMVPE 效果最好点转换。你会看到什么生成一段新的音频文件可直接试听对比原声。常见卡点转换出来「像底模、不太像训练的人」这多半是音色泄露把推理时的 index rate 往 1 拉可缓解。场景三实时低延迟变声你要达成什么对着麦克风说话或唱歌实时听到换声后的效果。分步操作用go-realtime-gui.bat或gui_v1.py启动实时变声界面加载模型选输入输出设备并点启动。你会看到什么说话的同时输出换声后的声音端到端延迟在普通设备上约 170ms用 ASIO 输入输出设备可压到 90ms 左右。常见卡点输入输出设备类型要一致例如都选 MME 类类型混选会出杂音或无声。️ 调参避坑手册新手先用默认值效果不满意再按下表微调。训练相关参数集中在configs/下的 JSON 配置里推理切分参数在configs/config.py结尾。参数新手默认什么时候调总轮数 total_epoch按配置默认约数万轮数据差底噪大调低、数据优质时长多可拉高batch_size4显存不够就往下缩到 1index rate0.5 附近出现音色泄露往 1 拉音质偏低往回调x_pad / x_query / x_center / x_max脚本按显存自动填推理报显存不足时手动缩小训练集越长越干净total_epoch 才有上调空间数据本身就嘈杂调太高也带不动音质。显存吃紧时训练缩 batch_size、推理缩 x_ 系列参数是两条独立出路别混着改。 出了问题先查这里症状可能原因解决动作ffmpeg error / utf8 error音频路径带空格、括号或中文把训练集路径改成无特殊符号的纯英文路径Cuda out of memory显存不够训练缩 batch_size推理缩小 x_ 参数4G 以下显卡基本放弃训练完没看到新音色索引没建好点刷新音色再试一次「训练索引」WebUI 弹出 Expecting value 报错系统开了代理关闭局域网/全局代理再重启Connection Error控制台黑窗口被关掉保持命令行窗口不关闭llvmlite.dll 报错缺 VC 运行库装上 Microsoft VC 运行库再重启 WebUI更多排查可参考仓库自带说明中文常见问题、更新日志。 参与项目与授权RVC 采用 MIT 许可证个人学习和商用都友好具体见 LICENSE。想参与可以从这几个入口入手提 Issue 反馈问题与复现步骤改进代码推理核心在 infer/lib/infer_pack/训练逻辑在 infer/modules/train/界面入口是 infer-web.py补全 i18n/locale/ 里的多语言翻译训练出好模型后分享给社区贡献前请先读 CONTRIBUTING.md。RVC 的价值就在于把「克隆一个声音」这件事压缩到 10 分钟数据、几次点击就能完成。你现在就可以按「装完就能跑」把环境和预置模型备齐启动 WebUI用一段真实录音跑通一次训练在实时变声界面里试听效果再按「调参避坑手册」微调音色现在就动手用你自己的声音跑通第一遍吧【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻