RVC 常见术语解释(新手对照表)

刚接触 RVC 变声器时,界面里满屏的 .pth、f0、RMVPE、index rate 常常让人一头雾水。本文按模型文件、音高算法、训练参数、实时路由四组,把最常遇到的术语整理成对照表,每个术语都附一句话解释和新手选择建议。还没下载的朋友先看 RVC变声器下载;想先搞懂原理的可以看 RVC变声器是什么

一、模型文件与音频规格

术语 一句话解释 新手建议与选择指南
.pth 模型 存储神经网络权重的主模型文件,决定了声音转换的声学骨架。 变声必需文件。使用他人模型时认准 weights 文件夹内精简导出的小文件(约 50MB 左右)。模型获取与放置详见 模型下载页
index 文件 存储目标说话人音色特征向量的检索库(FAISS 索引),用于增强音色辨识度与发音细节。 搭配同名 .pth 一起加载。没有它模型依然能发声,但音色还原度和发音咬字会明显打折。
采样率 音频数字化时每秒采集的样本数(32k / 40k / 48k),决定了音质的高频上限与频宽。 优先选 40kHz(训练底模兼容性最好、音质与算力开销折中最佳);追求人声极高频通透可选 48kHz

二、音高提取算法与特征检索

术语 一句话解释 新手建议与选择指南
f0 决定声音高低调起伏的基频曲线,使生成声音跟随原声的调门变化。 唱歌、有情感起伏的配音转换必须开启;若纯朗读或目标音色不需要音调跟踪,可选择无 f0 模式。
RMVPE 基于深度学习的前沿多音高提取算法,抗噪强、速度快且音准极高。 默认首选。训练与实时推理闭眼选此项,在绝大多数场景下综合表现最稳。
harvest 传统声码器算法中低音表现出色的提取器,音准较好但计算极慢且易哑音。 离线高质量推理的备选方案,仅在 RMVPE 音质不理想时尝试;不适用于实时变声
crepe 基于卷积神经网络的专业音高算法,稳定性高、抗破音,但计算开销巨大。 追求极致平滑的离线歌声渲染备选,算力消耗高;显卡性能较弱时不建议使用。
pm (Parselmouth) 传统语音学 Praat 的快速音高提取实现,速度极快但精度低、易走调破音。 仅供极低算力设备做快速跑通测试,日常变声与模型训练不推荐。
dio 速度极快的早期传统音高算法,对环境底噪极度敏感,高频表现较差。 现阶段已被 RMVPE 全面替代,不建议选择。
index rate 控制特征库(index)与生成模型(pth)之间的混合比例,用于调节目标音色的浓淡度。 推荐设置在 0.6 ~ 0.8。设为 1 容易带入训练集的底噪或杂音,设为 0 则仅使用通用声学模型导致音色不像。

三、模型训练与硬件加速

术语 一句话解释 新手建议与选择指南
Batch Size 训练时显卡单次并行处理的音频片段数量,直接影响显存占用和训练吞吐。 6GB 显存建议设为 4~8;8GB 显存设为 8~12;12GB 及以上设为 16~32。出现显存不足(CUDA OOM)立即下调。
Epoch 整个训练音频数据集被神经网络完整学习一轮的周期总次数。 10~30 分钟优质干声推荐跑 200 ~ 300 轮;超过 400 轮容易引发过拟合(声音出现金属电音、咬字僵硬)。
fp16 半精度 使用 16 位浮点数替代传统 32 位浮点数进行计算,显存占用减半且大幅提速。 现代 NVIDIA 显卡(GTX 1660 / RTX 系列及以上)默认开启;除非报 NaN 错误或使用极老架构显卡才关闭。
DirectML 微软提供的跨平台机器学习加速框架,让非 NVIDIA 设备能够调用显卡计算。 AMD 显卡(A卡)或 Intel 核显用户必选(需配合专用 RVC DirectML 整合包);N 卡用户切勿开启,直接走原生 CUDA 性能最佳。

四、实时变声与音频路由

术语 一句话解释 新手建议与选择指南
Block Size 实时变声器单次切片采样的音频数据块时长,直接决定转换延迟与音频连贯性。 实时变声建议从 0.25s ~ 0.5s 开始测试。若声音卡顿、噼啪爆音需调大,追求极限低延迟可微调调小。
CABLE Input / Output VB-Audio 虚拟声卡驱动,用于在变声软件与语音通讯软件之间搭设虚拟音频跳线。 RVC 实时变声软件的"输出设备"设置为 CABLE Input;在 Discord / QQ / 游戏设置中的"麦克风输入"选择 CABLE Output。完整跳线教程见 直播配置指南

训练或使用中遇到报错(显存溢出、路径编码、DLL 缺失等),可以到 常见问题与报错排错 查对应的解决方案;各档显卡适合的参数组合见 硬件性能对比表