ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

10分钟语音跑通AI变声:RVC WebUI从装环境到出效果,一篇讲清

10分钟语音跑通AI变声:RVC WebUI从装环境到出效果,一篇讲清 10分钟语音跑通AI变声RVC WebUI从装环境到出效果一篇讲清【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUIRVC是一个基于 VITS一种端到端语音合成模型架构的 AI 变声 WebUI最少 10 分钟低噪语音就能训练出可用的语音转换模型。这篇文章给你讲清最低显存要多少、预模型下哪几个文件、以及第一次出音出现电音、哑音时怎么调。先看清门槛AI变声的最低显存与预模型清单跑 RVC 之前先对照这张表确认你的机器够不够档次项目要求必须系统Windows / Linux / macOSPython 大于 3.8必须显存显卡专用内存N 卡最低 4GB代码会自动给 4GB 卡切换 fp32 省显存6GB 以上才从容4GB 以下基本放弃必须ffmpeg读音频、切音频都靠它系统 PATH 里必须有必须预模型assets/hubert/hubert_base.pt、assets/pretrained/、assets/uvr5_weights/可选v2 底模assets/pretrained_v2/训练 v2 模型才需要可选音高模型根目录rmvpe.pt效果最好的音高提取算法用它可选训练数据10~50 分钟、低底噪、音色统一的语音精简数据 5 分钟也能跑平台专属Windows RTX30xxtorch 必须装 cu117 版本见下节命令平台专属A 卡 / I 卡依赖换requirements-dml.txt启动加--dml参数平台专属A 卡 ROCm仅 Linux装 ROCm 驱动部分显卡要设HSA_OVERRIDE_GFX_VERSION等环境变量用户加入render/video组预模型不用一个个找仓库自带下载脚本清单和脚本位置tools/download_models.py覆盖上表全部条目。一条主线跑通装环境、下模型、启动 WebUI下面 5 步每步给你成功标志看到什么算过了。1. 拉代码→ 命令 → 标志根目录出现infer-web.py、assets/、configs/git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI2. 装依赖和 ffmpeg→ 命令 → 标志pip 正常结束无报错ffmpeg -version有输出pip install torch torchvision torchaudio pip install -r requirements.txt # A卡/I卡换 requirements-dml.txtA卡ROCM(Linux)换 requirements-amd.txt sudo apt install ffmpeg # macOS: brew install ffmpegWindows: 把 ffmpeg.exe 放进根目录注意Windows RTX30xx 用户第一条要换成pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117。macOS 用户也可以直接sh ./run.sh装依赖。Windows 用户嫌麻烦可以下RVC-beta.7z整合包解压后双击go-web.bat用 Poetry 装的人把后面所有命令前加poetry runPython 建议 3.7~3.10更高版本会在llvmlite0.39.0上报冲突。3. 下载预模型→ 命令 → 标志assets/hubert/、assets/pretrained/等目录不再为空python tools/download_models.py4. 启动 WebUI→ 命令 → 标志浏览器自动打开127.0.0.1:7865能看到推理、训练、ckpt 处理等标签页python infer-web.py5. 出第一段声音纯界面操作无命令「训练」页填一个实验名指向放音频的目录点「一键训练」——它会依次做切音频、提取音高和特征、训模型、建索引成功的标志控制台打出Training is done. The program is closed.且logs/实验名/下出现added_*.indexfaiss 建的检索特征库用来在推理时拉回训练集音色如果模型训完但没出现 index 文件再点一次「训练特征索引」或命令行跑 tools/infer/train-index.py然后到「推理」页刷新音色选中刚训的模型上传一段源音频点「转换」出现可下载的输出音频就算全链路通了效果怎么调直接改变声音听感的 3 个参数第一次出音很少完美下面是推理页三个对听感影响最大的控件都给你排障式用法。1. 检索特征占比 index_rate默认 0.75范围 0~1作用输出音色里训练集音色的混合比例调满理论上杜绝音色泄漏输出声音被输入源音色带跑的现象如果你听到输出还残留输入源的音色大概率是泄漏试试拉到 0.9~1.0如果你听到音质发闷、像隔了一层而源音频其实比训练集清晰大概率是占比太高把音质拖向训练集试试降到 0.5 附近训练集够多够好的话这个参数重要性下降模型本身就不怎么泄漏2. protect 保护清辅音和呼吸声默认 0.33范围 0~0.5如果你听到电音、撕裂感等 artifact大概率是清辅音被音高处理破坏了试试降到 0.2拉满 0.5 等于关闭保护保护力度越大也可能越削弱索引效果别为了消除一个瑕疵把音色换掉3. 音高提取算法默认 rmvpe可选手动换 pm / harvest / crepe如果你听到哑音音高漂移、破音大概率是算法在弱音段抽错了音高用默认的 rmvpe 或换 crepe效果好但吃 GPU输入是歌声、要速度选 pmharvest 低音区好但极慢一般不用配套的 filter_radius默认 33 以上会对 harvest 的音高结果做中值滤波数值是滤波半径调大对削弱哑音有帮助踩过的坑RVC 训练推理最高频的 5 个报错现象ffmpeg error/utf8 error→ 真因音频路径带空格、()或中文不是 ffmpeg 本身坏 → 把训练集挪到全英文无空格目录再跑现象 一键训练结束没有added_*.index→ 真因训练集太大内存建索引被 OOM 卡死 → 再点一次「训练特征索引」或单独跑 tools/infer/train-index.py现象CUDA out of memory→ 真因显存不够 → 训练就缩小 batch_size缩到 1 还不行只能换卡推理就调小 configs/config.py 末尾的x_pad、x_query、x_center、x_max现象 训练完成推理页刷新后没有新音色 → 真因界面缓存 → 点「刷新音色」还没有就看logs/实验名/下的训练日志有没有报错现象 Windows 报Could not load shared object file: llvmlite.dll→ 真因缺 Visual C 运行库 → 装微软 VC 2015-2022 可再发行组件x64后重启 WebUI收个尾适合把 10~50 分钟单人语音变成能翻唱、能转声的模型N 卡 4GB 就能起步。跑通之后可以试试 ckpt 选项卡里的 ckpt-merge 融合两个音色或用tools/rvc_for_realtime.py接实时变声。完整训练参数对照看 docs/cn/faq.md。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表