ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RVC变声器用10分钟录音训一个音色模型:新手完整指南

RVC变声器用10分钟录音训一个音色模型:新手完整指南 RVC变声器用10分钟录音训一个音色模型新手完整指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI你要给视频换的嗓音、要翻唱的歌、要给游戏角色换的声音本人不配合。RVCRetrieval-based Voice Conversion WebUI干的就是这件事喂它 10 分钟目标音色的录音它训出一个音色模型之后任何音频进去都以那个音色出来。面向配音、游戏换声、翻唱场景不碰音频工程的新手也能走完全程。显存与系统最低门槛先确认机器合格不合格先别开始录音。NVIDIA 显存 ≥4GB 可训练可推理3GB、2GB 老卡按官方 FAQ 建议直接放弃AMD/Intel 或无独显走 DirectMLWindows或 CPU 依赖包只是训练慢系统 Windows 10 以上或 Ubuntu 24.04Python 3.12 x64内存 8GB 以上更稳切分和音高提取是多进程 CPU 任务不需要服务器RVC 训练页就是本地 7865 端口的网页开跑前要备齐的材料清单材料获取位置数量与质量要求仓库代码gitcode 仓库见主流程一命令最新版底模文件HuggingFace 模型仓库 lj1995/VoiceConversionWebUI用 huggingface_hub 下载hubert_base、rmvpe、pretrained、pretrained_v2 四组缺一不可目标音色录音自录或收集总时长 10~50 分钟单条 30 秒~2 分钟底噪低ffmpegUbuntu 用 apt、macOS 用 brew、Windows 把 ffmpeg.exe 丢进项目目录近期任意版本录音是整个流程里最不可逆的一步环境安静、语调有变化、别只念一种腔调。音色有辨识度且底噪低的话 5~10 分钟也能出可用模型但建议留余量。主流程一装依赖并下载底模做三件事拉代码、建环境、按显卡装依赖再下四组底模到 assets/。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv rvc-env激活虚拟环境后按硬件装依赖NVIDIA 非 50 系pip install -r requirments_cu118_py312.txt50 系requirments_cu128_py312.txtCPU/AMD 用requirments_cpu_py312.txt。底模下载pip install huggingface_hub hf download lj1995/VoiceConversionWebUI hubert_base/* --revision main --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe/rmvpe.pt --revision main --local-dir assets hf download lj1995/VoiceConversionWebUI pretrained/* pretrained_v2/* --revision main --local-dir assets完成标准assets/ 下能看到 hubert_base、rmvpe、pretrained、pretrained_v2 四个目录跑python -c import torch; print(torch.cuda.is_available())打印 True。底模不全训练和推理都起不来。主流程二启动训练页并跑一次训练python webui.py浏览器自动打开 7865 的训练页无桌面环境用python webui.py --noautoopen后手动访问。训练页改四处训练集文件夹、实验名全局唯一以后找模型全靠它、采样率 48k 对应 v2 底模、音高提取算法 rmvpe。其余保持默认点一键训练流程依次过切分、音高提取、特征提取、训练数据预处理逻辑在 train/preprocess.py。完成标准日志打出 Training is donelogs/实验名/ 下出现几百 MB 的 D_*.pth 检查点文件。主流程三训练索引并转换第一段音频一键训练结束不会自动加索引。回训练页点训练索引logs/实验名/ 下出现 added_ 开头的 .index 文件即成功。进 RVC 的模型推理页刷新音色选中刚训的模型和索引上传一段音频转换在页面输出区听转换结果。完成标准输出应是训练集那个人在说输入的内容。听出输入源音色说明发生了音色泄露对照下表调 index rate。参数速查表参数怎么设为什么总轮数底噪大 20~30 轮干净且时长足 200 轮底噪大的数据训太多轮模型会把噪音也学进去官方 FAQ 明确说法batch size用页面默认OOM 往下调一档默认按显存自动估算约为显存 GB 数的一半是稳定起步值index rate默认 0.75音色泄露就往 1 调越接近 1 越锚定训练集输入源音色漏得越少protect默认 0.33输出有电音再调高专门防清辅音和呼吸声撕裂底模与采样率48k v2 底模官方配置里质量上限最高的一档见 configs/v2/48k.json验证与排错验证动作从录音里挑一段没用进训练集的音频在推理页转换后听——音色对得上整条 RVC 换声链路就跑通了。常见失败症状训练报 CUDA out of memorybatch size 调小降到 1 还 OOM 就是显存不够换卡或租云 GPU训练完成但没有 added 索引训练集太大卡住加索引步骤重按一次训练索引ffmpeg error 或 utf8 error多半不是 ffmpeg 本身而是音频路径带空格、括号或中文改成纯英文路径音色偏输入源调高 index rate训练集优质且时长长时模型本身不怎么写外部音色这个值反而不重要跑通之后两条进阶路线值得试实时变声入口 realtime_gui.py官方端到端延迟 170ms用 ASIO 设备可压到 90ms以及 tools/uvr5/ 的 UVR5 人声分离先把伴奏和人声拆开再转换。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表