ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT-SoVITS 声音克隆完全指南:1 分钟录音,做出属于你自己的语音合成

GPT-SoVITS 声音克隆完全指南:1 分钟录音,做出属于你自己的语音合成 GPT-SoVITS 声音克隆完全指南1 分钟录音做出属于你自己的语音合成【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一款免费开源的声音克隆与语音合成工具1 分钟录音就能微调出属于你的音色支持中英日韩粤多语言全程 Web 界面操作零编程基础也能完成。先看看 GPT-SoVITS 能帮你做出什么克隆你自己的声音录 1 分钟音频做微调之后输入任意文字都会用你的音色读出来。不训练也行——只放一段 5 秒参考音频就能直接零样本合成。一个声音多种语言训练时只用了中文合成时可以直接说英文、日文、韩文、粤语音色保持不变。批量产出配音给小说、视频、课件配一段几分钟的旁白合成速度远快于真人录音且随时可改文案重出。第一次跑起来的最小路径Windows 上 3 步启动 GPT-SoVITS WebUI克隆项目代码git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS在项目目录打开终端运行安装脚本pwsh -F install.ps1 --Device CU126 --Source HF把CU126换成你实际环境NVIDIA 显卡选CU126或CU128无显卡选CPU国内网络下载慢可把--Source改成ModelScope。双击go-webui.bat浏览器自动打开 http://127.0.0.1:9874 即安装成功。 Windows 用户也可以直接下载官方整合包解压后双击go-webui.bat可跳过上面的两步。Linux 与 macOS 上 3 步启动 GPT-SoVITS WebUI克隆代码git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS在项目目录执行安装NVIDIA 显卡把CPU换成CU126或CU128bash install.sh --device CPU --source ModelScope运行python webui.py浏览器访问 http://127.0.0.1:9874 打开主界面。安装脚本会自动装依赖并下载预训练模型首次运行约 10-20 分钟放着不管即可。macOS 用户用--device MPS代替--device CPU但注意 Mac 上训练质量不如 Windows/Linux官方建议 Mac 用 CPU 训练。按目标进阶提高声音克隆相似度录音标准与训练量相似度主要由训练数据决定记住三个数字项目建议值说明录音时长1-5 分钟1 分钟可出可用效果3-5 分钟更稳定录音距离距麦克风 30-50 厘米太近会爆音太远有环境音片段长度切成 3-10 秒/段用 WebUI 内置的音频切割功能录制要求安静室内、无 BGM 和回音、语速语气尽量多样别全程用同一种语调念。如果原素材是带背景音的视频先用项目自带的 UVR5 人声分离 把纯人声抠出来再切割。训练流程全部在 WebUI 里完成填入音频路径 → 切割 → 降噪可选→ ASR 自动识别文本 → 校对错字 → 开始训练共 6 步。校对很关键ASR 标错的字会让模型学错发音用内置的 SubFix 校对工具 逐条改过来。 训练数据里混入别人的声音是相似度下降的头号原因只保留单一说话人的干净人声。让一个模型说多种语言跨语言合成怎么开GPT-SoVITS v2 及以上版本支持跨语言推理训练集是中文合成时也能输出其他语言目前覆盖中文、英文、日文、韩文、粤语语言码分别是zh、en、ja、ko、yue。打开1-GPT-SoVITS-TTS/1C-推理页面在文本框直接输入对应语言的句子选择对应语言即可。混合语种内容中文里夹英文单词可以直接写在同一段文本里系统会自动分词处理。想更可靠就在推理页面选「中英混合」等对应切分模式长文本按标点或句子切分输出避免一次合成太久。跨语言效果最好的组合训练语言与目标语言同属语系接近的如中→粤或训练素材本身有对应语言的语料。用纯中文训练集说日文相似度会低于说中文这是正常现象。改变语气与语速推理参数怎么调推理页面1-GPT-SoVITS-TTS/1C-推理有四个主要旋钮参数建议区间作用语速0.8-1.2小于 1 放慢大于 1 加快音调-12 到 12调高更年轻活泼调低更沉稳参考音频3-10 秒决定音色与情绪风格切分模式按标点长文本分段合成防止一次失败全重来参考音频是情绪的遥控器想要播音腔就找一段目标说话人或他人的播音风参考音频想要轻声细语就录一段耳语感的参考。参考音频 3-10 秒、干净无背景音效果最稳。想换一种感觉不用重新训练换参考音频重新合成即可。⚠️ 每次改参数后要点重新生成才生效建议一次只动 1-2 个参数方便定位是哪个参数起了作用。出了问题怎么办问题现象可能原因解决方法合成语音有杂音训练音频带背景音用 UVR5 分离纯人声或走一遍 WebUI 的降噪步骤再训练发音不标准、读错字ASR 标注文本有误在 WebUI 校对环节用 SubFix 改正错字后重训音色不像本人训练素材太短或有其他人声补录到 3-5 分钟剔除含他人声音的片段合成速度慢、卡顿无 GPU 或显存不足选 CPU 设备后把 batch_size 调到 4 以下长文本改按标点切分启动报 FFmpeg 相关错误未安装 FFmpegUbuntu/Debian 执行sudo apt install ffmpeg libsox-devmacOS 执行brew install ffmpeg常见疑问没有 NVIDIA 显卡能用吗可以。安装时--device CPU合成速度会明显变慢官方测试 M4 CPU 的 RTF 约 0.53即 1 分钟音频约需 30 秒合成日常使用够用批量产出建议上显卡。生成的声音能商用吗GPT-SoVITS 采用 MIT 协议开源见 LICENSE基于本人声音合成的内容可用于商业用途。但克隆他人声音前务必先取得对方授权避免侵犯声音权益。到底要多长的训练数据1 分钟可出可用效果3-5 分钟且语气多样的素材相似度更稳定。比起时长干净度和多样性更重要——1 分钟录音带大段 BGM不如 30 秒的干净人声。零样本和少样本怎么选只想快速听听效果放一段 5 秒参考音频直接零样本合成要做正式内容、要长期反复使用这个声音就用 1 分钟以上素材微调音色的贴合度和稳定性都会高一档。更多参数细节可参考 中文文档 与 更新日志。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表