ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

1分钟录音克隆一个声音:GPT-SoVITS 少样本语音克隆完整指南

1分钟录音克隆一个声音:GPT-SoVITS 少样本语音克隆完整指南 1分钟录音克隆一个声音GPT-SoVITS 少样本语音克隆完整指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS你手里只有一个人 1 分钟的录音却想让一段新文字用这个人的声音念出来——这正是 GPT-SoVITS 的 WebUI 干的事丢进 5 秒参考音频就能零样本合成或者拿 1 分钟语音数据微调一个专属音色再输入文字生成 TTS 语音中、英、日、韩、粤语都支持。️它和主流 TTS 项目的差别在哪大多数 TTS 项目要几小时录音数据、手动配数据集而 GPT-SoVITS 把门槛压到了分钟级5 秒零样本、1 分钟少样本微调few-shot voice cloning。另一个关键差别是它自带数据预处理全家桶——人声分离、自动切片、多语言 ASR 转写、文本标注全部集成在同一个 WebUI 里你不需要为凑训练集额外安装任何工具。项目基于 MIT 协议开源预训练模型从 2k 小时扩展到 5k 小时语料。原理文字是怎么变成 48kHz 音频的整条链路是一条单向流水线文本先经过文本前端中文走 GPT_SoVITS/text/ 下的 G2PW 和 zh_normalization处理多音字与数字归一化转成音素序列接着 GPT 模块自回归生成语义 token相当于决定每个字该怎么发音SoVITS 模型再结合参考音频提取的说话人特征把 token 转成 mel 频谱最后由 NVIDIA BigVGAN 声码器输出波形。v4 版本原生输出 48k 音频官方实测 v2 ProPlus 在 4090 上 RTF 约 0.014——1400 词约 4 分钟的内容推理只要 3.4 秒。三步跑起来从空目录到第一句合成第一步获取代码。Windows 用户直接下官方集成包双击go-webui.bat最省事Linux/macOS 用户克隆仓库https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS后走下面的安装脚本想容器化则直接用仓库里的docker-compose.yaml。第二步一条命令装环境。测试通过的环境是 Python 3.10 PyTorch 2.5.1 CUDA 12.4install.sh会自动拉取依赖和预训练模型到 GPT_SoVITS/pretrained_models/conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU126|CU128|ROCM|CPU --source HF|HF-Mirror|ModelScope python webui.pymacOS 建议选--device CPU官方提示 Mac GPU 训出的模型质量明显偏低。Docker 用户只需在项目根目录执行docker compose run --service-ports GPT-SoVITS-CU128第三步出结果。python webui.py启动后浏览器自动打开默认就是 V2/V3 版本无需其他配置Docker 场景建议把环境变量is_half设为true开启 fp16 省显存。上手体验数据准备、训练、生成三关 数据准备WebUI 的0-前置数据集获取工具页填入音频路径按 切片 → 降噪可选→ ASR → 校对 的顺序点下去即可。30 分钟的干净录音切片加转写几分钟内跑完中/英/日/韩默认用 Fun-ASR-Nano粤语走 FunASR 后端真正的耗时在校对 ASR 文本。最终标注文件是vocal_path|speaker_name|language|text格式language 填 zh/en/ja/ko/yue 之一。带背景音乐或噪声的原始录音先在 tools/uvr5/ 对应的人声分离页跑 UVR5 再切片。训练1B-微调训练页1 分钟数据在消费级显卡上分钟级到十几分钟即可训完一轮可用模型数据到 5~10 分钟音色相似度会明显更稳。最容易卡住的地方不是训练本身而是上游——ASR 错字没校对、切片太碎都会直接拖累音色。生成1C-推理页选参考音频5 秒即可、贴入文本可调语速、音高、情感强度后一键合成零样本和微调模型都在这一页切换。三个能直接上场的场景影视配音与多语言本地化用角色的 1 分钟原声微调一次后续所有台词批量生成还能直接跨语言——训练集是中文推理时输入英文也能说。适合独立游戏、短剧出海团队。有声内容制作播客/有声书主播只需贡献几分钟样本就能克隆自己的声音批量产出内容省掉反复录棚。适合有固定人设、内容量大的创作者。个性化语音交互把家庭成员或品牌声音克隆成语音助手播报音色。适合智能家居、客服语音等固定话术场景。避坑指南4 个高频问题 ⚠️现象ASR 页打不开或报错→ 原因ASR 模型未就位Lite 版 Docker 镜像不带 ASR 和 UVR5 模型 → 解法换完整版镜像或把模型预下到 tools/asr/models 目录首次使用也会自动下载。现象合成声音不像原说话人→ 原因训练数据不足 1 分钟或参考音频带噪声、混响 → 解法先用 UVR5 降噪数据补到 1 分钟以上再微调。现象显存爆掉→ 原因未开半精度 → 解法设is_halftrueDocker 环境变量或在 WebUI 勾选半精度fp16 可显著降显存仍不够就调小 batch size。现象声音发闷或有金属感→ 原因v3 的非整数倍上采样缺陷 → 解法换 v4 预训练模型s2v4.pth vocoder.pth 放入 pretrained_models 目录48k 原生输出同时解决发闷问题。参数调优速查项目建议值说明参考音频5 秒、干声带背景噪声会拖累整段合成训练数据≥1 分钟5~10 分钟更稳平均音质较差的训练集建议用 v1/v2/v2Pro 系列模型精度CUDA 下开 fp16显存减半级别质量基本无损中文文本前端部署 G2PW 模型到 GPT_SoVITS/text/多音字准确率明显提升语速/音高推理页微调语速偏离 1.0 过大时自然度下降写在最后GPT-SoVITS 把克隆一个声音的成本从录音棚级压到了一段手机录音且把数据准备到推理的全流程收进一个 WebUI。从 TODO 清单看更细的情感控制、模型混合model mix和预训练语料向 1 万小时扩展仍在路线上少样本克隆的门槛还会继续降低。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表