ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RVC 从0到1:用10分钟语音完整训练出自己的AI变声模型

RVC 从0到1:用10分钟语音完整训练出自己的AI变声模型 RVC 从0到1用10分钟语音完整训练出自己的AI变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI核心关键词RVC变声器 长尾关键词RVC安装教程、AI变声模型训练、RVC Web界面使用、语音转换参数调优、实时变声低延迟配置Retrieval-based-Voice-Conversion-WebUI简称RVC是基于VITS架构的开源语音转换工具用10分钟干净人声就能训练出一个能替换任意音频音色的变声模型。CPU可跑推理训练建议显存6GB以上的NVIDIA显卡。本笔记按安装、训练、推理的顺序走通完整流程。 项目速览它能做什么训练变声模型用10-30分钟单说话人干净音频训练出音色模型pth文件适合你手头有目标音色干净录音、想复刻该音色的场合。任意音频音色替换上传音频即可输出目标音色版本音高可调±12个半音适合翻唱换声、台词配音这类保留旋律只换声音的场合。索引训练基于训练集生成faiss索引推理时进一步提升音色相似度适合模型已成形但相似度还差一点的场合。批量与命令行推理tools/infer_cli.py单文件转换、tools/infer_batch_rvc.py整目录批量转换适合配音工程或TTS后处理的规模化场合。实时流式变声对麦克风输入做流式转换入口在tools/app.py适合直播、语音聊天场景需要独立显卡。️ 环境要求与最小安装步骤项目最低配置推荐配置操作系统Windows 10 / Ubuntu 18.04 / macOS 10.14Windows 11 / Ubuntu 20.04Python3.83.8依赖版本被锁定如 fairseq0.12.2更高版本易冲突内存8GB16GB磁盘空间10GB20GB预训练模型与训练数据显卡可无仅CPU推理NVIDIA、支持CUDA、显存6GB其他系统已安装 ffmpeg同左第1步克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt建议放在虚拟环境里安装避免污染系统Python。第2步下载预训练模型hubert、pretrained、rmvpe等约数GB./tools/dlmodels.shWindows下改用仓库根目录的tools\dlmodels.bat。第3步启动Web界面python infer-web.pyv2推理与训练一体界面即启动需要v1训练界面时改用python gui_v1.py。浏览器访问默认7860端口。 跑通第一个变声端到端五步准备数据10-30分钟单说话人、无背景音乐和人声混音的干净音频WAV/MP3/FLAC均可放入新建目录片段长度可用界面音频切割功能切成3-10秒。配置参数界面选择v2、采样率48k实时场景可改32k输入模型名称。执行训练依次点击提取Hubert特征→模型训练batch_size按显存设置见下文参数表训练轮数按数据时长取10-50之间。训练索引在索引页签选择刚训好的模型版本选v1或v2训练音频少于5分钟时索引收益有限。验证输出推理页签选模型索引f0method设为rmvpe、音高0、索引率0.5上传一段10秒测试音频结果wav保存在logs/infer目录音色可辨认、音高自然即算跑通。不想走界面的话一条命令也能完成单文件转换python tools/infer_cli.py --f0up_key 0 --input_path src.wav --f0method rmvpe --model_name myvoice --index_path logs/myvoice.index --opt_path out.wav 真实用法拆解三个典型场景翻唱歌曲换音色保留旋律只换声音目标把一首翻唱的演唱音色换成自己训练的模型旋律与节奏不动。步骤先用UVR5infer/modules/uvr5/把人声与伴奏分离用自己15-30分钟清唱音频训练模型推理时音高保持0、index_rate取0.4-0.6、resample_sr设0保留原始采样率最后把转换后的人声与伴奏重新合成。可量化效果显存6GB的GPU上4分钟人声推理约需30-60秒约为实时的5-8倍速单模型pth文件约20MB量级显存峰值通常在3GB内。台词配音批量处理一个目录统一音色目标把一整批台词或TTS音频转成统一音色用于有声书、动画后期。步骤先为模型训练好索引用tools/infer_cli.py逐个调用或直接用tools/infer_batch_rvc.py批量脚本f0method取rmvpe、index_rate用默认0.66输出统一重采样到40k。可量化效果独立GPU上1分钟单文件推理通常10秒内完成批量任务建议每批控制在几十分钟内避免长音频触发显存溢出。实时直播变声低延迟流式转换目标直播或语音聊天时麦克风输入实时变声。步骤启动tools/app.py实时界面流式参数保持 configs/config.json 的默认值block_time 0.15秒、crossfade_length 0.08秒、threhold -60dB低配机器把resample_sr降到32000可再降延迟与显存。可量化效果端到端延迟以block_time 0.15秒为主项总延迟在数百毫秒量级显存占用通常低于3GB4GB显存32k采样率即可运行。⚙️ 调参与排障速查参数表默认值来自CLI与configs/config.json参数默认值何时需要调batch_size界面默认约4显存≥6GB可取4-6显存≤4GB降到1-2防止训练OOMf0up_key0需要整体升降调时调±12半音同性别转换保持0f0methodfcpe实时/ harvestCLI推理推荐rmvpe速度快且音高更准pm用于交叉验证index_rate0.66CLI相似度不足升到0.8音色发闷、机器音降到0.4-0.6protect0.33气声、齿音破裂时升到0.5保护非浊音区间resample_sr0保留原采样率实时场景或显存紧张设32000降低延迟与显存block_time0.15秒实时实时卡顿升到0.2-0.3显存富余且延迟敏感可下调rms_mix_rate0.5实时/ 1.0CLI输出音量与源音频不一致时调整0表示完全用原音量故障表症状原因处理训练报CUDA OOM显存不足batch_size降到1-2训练采样率降到32k推理报CUDA OOM单次音频过长把音频切成2分钟以内分段推理界面起不来7860端口被占或依赖冲突换端口仍失败则在Python 3.8虚拟环境重装依赖Windows报llvmlite.dll缺失VC运行库缺失安装Visual C Redistributable输出金属味、气声破碎训练数据带BGM/噪音或protect过低用UVR5分离后重训protect升到0.5以上音高跳变或机器人音f0提取错误或索引与模型不匹配换rmvpe确认索引文件与模型对应降index_rate✅ 核对单与下一步数据核对单说话人干净音频10-30分钟无背景音乐采样率统一44.1k或48k格式WAV/MP3/FLAC已切分为3-10秒片段原始音频与模型文件各留一份备份步骤核对预训练模型已下载完成tools/dlmodels.sh已依次完成Hubert特征提取→模型训练→索引训练已用音高0、索引率0.5试听验证不满意时先调index_rate与f0method再考虑重训三档路线新手先用下载好的预置模型走通推理流程再录自己的15-30分钟音频训练前两次不要动高级参数。进阶重点试index_rate、protect、resample_sr的组合再用批量脚本处理整批配音任务。开发者阅读infer/lib/infer_pack/的推理核心与infer/modules/train/的训练流程通过infer/modules/vc/的ConfigVC入口把vc_single集成进自己的应用。建议路径先跑通推理验证环境无误再录15-30分钟干净音频训练第一个模型音色不理想时优先调index_rate和f0method确认参数都到边界后再考虑重新训练。更多问题可查docs/cn/faq.md。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表