ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT-SoVITS 声音克隆 TTS 六版本选型指南:v1 到 v2ProPlus,三分钟挑对版本

GPT-SoVITS 声音克隆 TTS 六版本选型指南:v1 到 v2ProPlus,三分钟挑对版本 GPT-SoVITS 声音克隆 TTS 六版本选型指南v1 到 v2ProPlus三分钟挑对版本【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一款开源的声音克隆 TTS 工具1 分钟人声就能微调出高相似度的专属语音模型目前分 v1、v2、v3、v4、v2Pro、v2ProPlus 六条线。直接给结论大多数场景选 v2ProPlus显存低、训练录音音质一般的选 v2 最稳。选型速查按你的画像对号入座你是谁推荐版本一句话理由纯新手、低配显卡先跑通流程v2教程最多、显存最省、生态最成熟高显存≥12GB要音质和相似度上限v4原生 48kHz、无金属音作者认证的 v3 替代品手机录音、训练集有底噪v2 / v2Pro这个谱系对平均音质偏低的语料容忍度明显更高直播、实时对话要快v2ProPlus推理速度极低还带流式推理已有 v3 训练产物v4无损替换v3 不用继续投入六版本核心差异一张表维度v1v2v3v4v2Pro / Plus支持语种中/英/日加韩/粤同 v2同 v2同 v2预训练规模2k 小时5k 小时v3 级底模与 v3 共用 GPT 底模与 v3 共用 GPT 底模原生输出采样率32kHz32kHz24kHz48kHz32kHz训练显存低低高LoRA 约 8GB 起高中等音色更像整个训练集整个训练集参考音频参考音频整个训练集低质量训练集尚可较好不推荐不推荐较好教程/生态多最多多中快速积累中表格里装不下的四件事v4 相对 v3 只换了 SoVITS 声码器一侧从 config.py 能看到 v3 和 v4 的 GPT 底模都是同一个s1v3.ckpt区别在输出端。v2Pro 与 v2ProPlus 同族Plus 推理更快实测 RTF 4090 约 0.0144 分钟音频几秒合成完。各版本训练产物按目录隔离SoVITS_weights到SoVITS_weights_v2ProPlus六个互不覆盖可同环境共存。v3 已不再是新项目的合理选择它只服务于已经训了 v3 想继续的人。三组拆开看轻量入门、高音质、性价比轻量入门组v1 和 v2共同点显存门槛低、32kHz 输出、音色贴合整个训练集对平均音质一般的语料更友好。v1 是 2k 小时语料的开山版只支持中/英/日已停更新项目直接忽略。v2 升级加韩语/粤语、底模扩到 5k 小时、文本前端重做多音字和中英混读更准低音质参考音频的可用度也上来了。适合老显卡和新手工练手。⚠️ 典型坑v2 做中文时要把 G2PWModel 解压后放进GPT_SoVITS/text目录漏装这一步中文推理会直接失败。高音质组v3 和 v4共同点音色相似度上一个台阶不训练直接推底模的提升最大GPT 侧更稳、重复漏字更少、情绪表达更丰富且新增 LoRA 微调显存需求压到约 8GB。v4 的升级是定向修复消掉 v3 非整数倍上采样带来的金属音并原生输出 48kHz声音不再闷糊。适合显存 12GB 以上、训练录音质量过关的用户。⚠️ v3/v4 的音色更偏参考音频而非整个训练集且对低质量语料效果反而更差v3 原生 24kHz 听着发闷v4 已根治。性价比组v2Pro 和 v2ProPlus共同点音质超过 v4显存成本比 v2 稍高和推理速度回到 v2 水平音色贴合整个训练集并支持流式推理。两者共用 v3 的 GPT 底模差别在 SoVITS 侧Plus 的推理速度更快。适合直播、实时 TTS 这类既要快又要好的场景。坑生态和第三方教程还不如 v2 丰富照抄旧教程时参数对不上的概率高。实操速记换版本、找权重、认训练入口git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS # 拉取代码 python webui.py v1 # 显式切 v1 界面不加参数默认 v2 及以上 python GPT_SoVITS/inference_webui.py # 只开推理界面版本在界面里切训练入口按谱系分v1/v2 走 GPT_SoVITS/s2_train.pyv3/v4 走 GPT_SoVITS/s2_train_v3.pyv3 的 LoRA 训练在 GPT_SoVITS/s2_train_v3_lora.py。训练产物目录映射v1→SoVITS_weights、v2→SoVITS_weights_v2其余类推加_v3/_v4/_v2Pro/_v2ProPlus后缀完整逻辑见 config.py。各版本预训练底模的路径默认注册在 GPT_SoVITS/TTS_infer_pack/TTS.py推理参数模板在 GPT_SoVITS/configs/tts_infer.yaml版本发布说明看 docs/cn/README.md。FAQ新手必踩的四个坑Q1v2 训的模型能直接拿到 v4 或 v2Pro 上推理吗不能。训练产物按版本分目录、模型不互通只有pretrained_models里的预训练底模是共用的。换版本等于重新训练。Q2显存只有 8GBv3/v4 完全跑不了吗能走 v3 的 LoRA 微调路线约 8GB 可完成全量微调建议 12GB 起。再低就换 v2/v2Pro。Q3怎么确认我手里的预训练权重是哪个版本看GPT_SoVITS/pretrained_models/下的子目录s2G488k.pth是 v1gsv-v2final-pretrained/是 v2s2Gv3.pth是 v3gsv-v4-pretrained/是 v4v2Pro/是 Pro 系列。Q4为什么 v3 听着比 v4 闷v3 原生只出 24kHz高频直接丢了v4 改整数倍上采样并原生 48kHz顺带把金属音也清掉了。一句话总结低配先跑 v2高配直接 v4要速度又要音质就 v2ProPlus——记住这三句版本选型不会翻车。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表