RVC 变声软件迎来 2.3 版重大更新(版本号 2.3.260718),这是三年来首次大版本升级。新版不仅保留了旧模型兼容性,还带来更简洁的 WebUI、全新的 FCPE 音高算法、CUDA Graph 实时推理优化以及可恢复训练功能。下面这份攻略将带你快速上手 RVC 2.3,完成实时变声和 AI 翻唱。
RVC 2.3 核心升级亮点
1. WebUI 操作更简单,模型自动关联
- 推理模型和特征索引文件可自动关联,无需手动指定。
- 支持拖拽、上传音频文件,操作更便捷。
- 新增 FCPE 音高算法,提供更多音高提取选择。
模型训练过程中可以随时中断,恢复训练时会自动从上一次检查点继续,不再需要重新开始。
2. 实时变声:CUDA Graph 加速与声线调节
新版加入 CUDA Graph 加速,实测使用 RTX 4060 时,开启加速后每次推理约 0.08 秒,关闭时约 0.11 秒。虽然界面显示的实时延时时长变化不明显,但后端推理耗时确实有所降低。
同时,实时变声界面新增性别/声线调节功能,可在变声过程中实时调整音色粗细。
3. 人声伴奏分离新增 BS-Roformer 模型
人声伴奏分离新增了 model_bs_roformer_ep_317_sdr_12.9755 模型,可尝试用于第一轮分离。
RVC AI 翻唱完整流程
1. 准备训练素材
建议准备至少 10 分钟的干净音频,说话录音或歌唱干声均可。素材质量直接影响最终模型效果。
2. 训练模型参数建议
训练时建议勾选音高指导,基础模型选择 V2,音高提取算法选择 RMVPE。总轮数应根据训练素材时长确定,可参考下表:
| 训练素材时长 | 建议总轮数 | 保存频率 | 显存缓存 | 评价 |
|---|---|---|---|---|
| 少于 3 分钟 | 不建议正式训练;强行训练约 400~600 轮 | 25~50 | 可尝试 | 极易过拟合,歌唱音域覆盖严重不足 |
| 3~5 分钟 | 350~500 | 25 | 可尝试 | 只适合试验或非常单一的音色 |
| 5~10 分钟 | 280~450 | 20~25 | 8GB 建议关闭 | 可用,但需要注意过拟合 |
| 10~20 分钟 | 150~280 | 10~20 | 关闭 | 最常见且性价比较高 |
| 20~40 分钟 | 80~160 | 10 | 关闭 | 音色和音域覆盖通常更稳定 |
| 40~60 分钟 | 50~100 | 5~10 | 关闭 | 不必机械训练几百轮 |
| 60 分钟以上 | 30~80 | 5~10 | 关闭 | 应按实际训练 step 和试听结果停止 |
3. 分离人声与伴奏的最佳实践
第一轮人声伴奏分离建议使用 HP5 或 model_bs_roformer_ep_317_sdr_12.9755。不要采用 BS-Roformer → HP5 → HP2 的连续分离方式,而应分别试听不同首轮模型的结果,选择效果最好的一份。
第二轮使用 VR-DeEchoDeReverb 去除回声和混响。如果仍有残留混响,可再用 FoxJoy 分离一次。注意分离不要超过三轮,否则原唱人声细节会明显丢失。
4. 如何挑选训练好的模型
建议优先试听最后三轮保存的模型,而不是默认选择最后一轮。多试听几个检查点,选择翻唱效果最自然的版本。
5. 翻唱效果调整技巧
实测 RMVPE 和 FCPE 对高音的处理效果相差不大。如果翻唱后出现声音撕裂或哑音,可以调整“保护清辅音和呼吸声,防止电音撕裂等 artifact”参数,将默认值 0.33 调为 0.3 或更低再尝试。
实时变声参数详解
常规设置
| 选项 | 实际作用 | 调高/调低后的效果 |
|---|---|---|
| 响应阈值 | 输入端静音门,范围 -60~0 dB | 数值越高,越小的声音越容易被判定为静音 |
| 音调设置 | 整体升降音高,范围 -16~+16 个半音 | 正数升调,负数降调;+12 为升一个八度 |
| 性别因子/声线粗细 | 尽量保持音高不变,只移动共振峰,范围 -2~+2 | 正数更亮、更细;负数更暗、更粗 |
| Index Rate | 索引检索特征与原始特征的混合比例,范围 0~1 | 越高越贴近训练角色,越低越保留输入发音 |
| 响度因子 | 输入音量包络和模型原生音量之间的取舍,范围 0~1 | 0 跟随麦克风音量,1 保留模型原生响度 |
| 音高算法 | 选择 F0/基频检测方式 | 影响跑调、抖动、延迟和稳定性 |
性能设置
| 选项 | 主要影响 | 典型取舍 |
|---|---|---|
| 采样长度 | 每次处理多少秒音频 | 数值小则延迟低但压力大;数值大则延迟高但更稳定 |
| 淡入淡出长度 | 相邻输出块的衔接长度 | 长一些更平滑,但会增加延迟 |
| 额外推理时长 | 模型每次参考的历史上下文 | 长一些更连贯,但计算量更大 |
| 输入降噪 | 转换前清理麦克风噪声 | 减少底噪,也可能吃掉轻声 |
| 输出降噪 | 转换后清理模型输出噪声 | 减少嘶声,也可能损失细节 |


加入QQ群
关注微信公众号
给站长发私信
寻求资源需求
Studio One 7-8 分离音轨安装
本站独家全整合一键安装包 













- 最新
- 最热
只看作者