使用 RVC 制作 AI 翻唱

博主第一次做 AI 翻唱,于是记录一下全流程的 pipeline 以及自己的经验。

下面是效果,让 AI 绘名唱了一下我最喜欢的夜鹿曲子,就喜欢听铃果唱歌!

我用的 pipeline:

GitHub - Kisechan/rvc-conversion-pipelinehttps://github.com/Kisechan/rvc-conversion-pipelinefavicon

硬件设施

博主使用的是 Mac 和一台远程的 AutoDL 服务器,大约 1 元每小时:

  • GPU: RTX 2080 Ti *2 (22GB)

  • CPU: 12 vCPU Intel® Xeon® Platinum 8336C CPU @ 2.30GHz

  • RAM: 45 GB

之后的所有模型训练、推理工作都在服务器上完成,Mac 作为本地 ssh 连接和后期工作的设备。

自认为服务器的配置是相当足够应付这个工作的,训练模型的部分(200 epoches)大约在三小时能够完成,推理只需要 10 秒左右。

下面来介绍一下具体的准备素材、训练、推理之类的工作吧。

素材准备

准备一些训练用的歌曲素材,比如:

网易云下载的 ncm 文件转换成 mp3 可以用 ncmdump:

GitHub - taurusxin/ncmdump/https://github.com/taurusxin/ncmdumpfavicon

如果要从 b 站上爬,可以用 yt-dlp 解析和下载:

1
brew install yt-dlp

下载之前可以看这个视频有哪些清晰度,音频也会显示出来:

1
yt-dlp -F "https://www.bilibili.com/video/BVxxx/"

-f 参数指定想下载的就可以了。

环境配置

参考 prompt:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
你需要在 AutoDL Ubuntu 22.04 服务器上部署一个 AI 歌声转换环境
硬件:RTX 2080 Ti 22GB CUDA
目标:搭建 RVC + UVR 完整工作流
要求:
在 /root/autodl-tmp/voice 创建项目目录:
data/
models/
outputs/
third_party/
scripts/
configs/
logs/
所有大文件必须放/root/autodl-tmp
系统盘(/)只保存代码和conda环境

安装:git, ffmpeg, tmux, nvtop, htop, vim
创建conda环境:
name=rvc
python=3.10
目前有PyTorch,无需验证

Clone RVC: https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI
安装依赖以及对应的模型权重。

安装 audio-separator[gpu] 用于UVR人声分离

配置 HF_HOME=/root/autodl-tmp/cache/huggingface

编写README:
环境
启动方式
WebUI访问方式
数据目录结构
训练流程

创建启动脚本 scripts/start_rvc.sh
功能:自动进入环境并启动RVC WebUI

测试:
ffmpeg正常
RVC WebUI可以启动
7865端口可通过SSH转发访问
所有长期运行程序使用tmux

遇到你不知道如何安装的组件,就可以利用子智能体进行网络搜索得到相关的信息,或是用子智能体做其他工作

最重要的就是不仅仅是要把代码和组件安装好,对应的权重和模型也要拉取下来,让 Agent 做就好了。5.6 Luna 也可以做好的工作。

UVR 分离人声

训练的链路是这样的:只有 Vocals 的 WAV \to 准备 RVC 训练集 \to 训练模型 \to 用只有 Vocals 的 WAV 推理。

那 UVR 就是把伴奏和 Vocals 音频分开的工具了,所以不仅仅是训练的时候要用,推理的时候也要用。

UVR 的工作效率很高,audio-separator[gpu] 也很方便 CLI 使用,但是后面的 UVR 只提供 WebUI 的话,就只能手调了。

切分数据集

训练前要用脚本切分数据集,具体的内容在上面的 GitHub 仓库里有。这个不能忘了。

RVC 训练

然后就是用 WebUI 训练了,可以用端口转发到本机来做,比如:

很傻瓜式,但是要注意一些路径问题,要不然很麻烦。填写内容可以参考:

表项
Experiment nameshinonome_ena_vocal
Training folder/root/autodl-tmp/voice/data/train/shinonome_ena_vocal
Sample rate40k
Versionv2
If using F0
F0 methodrmvpe
CPU threads8
GPU0
Batch size16
Save frequency25
Total epochs120[1]
Cache data in GPU
Save a small final model

推理

右边的这四个参数是最影响效果的,但是如果随便选的参数都能效果不错的话,那再调教影响应该也不大,我是听不出来

推理速度很快,慢慢调参,听就是了。如果有破音 [2] 可以换成 fcpetranspose 调的时候最好保持 0。

混音

输出的文件只有 vocals 的音频,那就可以在本地混音或者直接用 FFmpeg。到本地用 Logic Pro 混肯定效果最好吧可惜我不会用。


参考与注解

  1. 我之前数据集是 20 首曲子,大概用了 200 epoches,后来发现 120 其实也可以,如果嫌多了或许还能再少点。
  2. 也有可能是 UVR 分离出来的干声有问题,比如有混响之类的效果。

使用 RVC 制作 AI 翻唱
https://blog.kisechan.space/2026/rvc-ai-conversion/
作者
Kisechan
发布于
2026年8月3日
更新于
2026年8月6日
许可协议