ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT-SoVITS Mac 语音合成:3 处 MPS 配置让单句推理从 0.8 秒压到 0.2 秒

GPT-SoVITS Mac 语音合成:3 处 MPS 配置让单句推理从 0.8 秒压到 0.2 秒 GPT-SoVITS Mac 语音合成3 处 MPS 配置让单句推理从 0.8 秒压到 0.2 秒【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSM1 Pro 上GPT-SoVITS 单句中文语音合成从 0.8 秒干到了 0.2 秒一共只动了三处一个安装参数、两个 yaml 字段、一个环境变量。GPT-SoVITS 是主打中文语音克隆与文本转语音TTS的合成项目适合想在 Mac 上跑通、又没接触过 MPS 的开发者照着做。一、先确认你的 Mac 能不能跑前置清单MPS 依赖 Apple Silicon先对一下硬件。项目最低要求芯片M1 及以上Apple Silicon系统macOS 12 Monterey 或更新内存推荐 16GB8GB 勉强必须开半精度工具已装 Xcode 命令行工具一条命令30 秒自检sw_vers -productVersion uname -m第二个结果若是 arm64就是 Apple Silicon 机型。如果是 Intel Mac 或系统太旧租一台云端 GPU 更省事或者先按 CPU 模式跑通再考虑迁移。二、MPS 到底在加速什么MPS 是 Apple 给 GPU 开的推理通道关系类比一下CUDA 之于 NVIDIAMPS 之于 Apple Silicon。GPT-SoVITS 的推理链路里有两个模型GPT 把文本变成语义 tokenSoVITS 再把语义 token 还原成语音波形。两者的大头都是矩阵乘法和卷积正是 GPU 擅长的活所以交给 MPS 后能整段被并行算走而不是让 CPU 逐帧磨。三、从零到跑通最短路径这条 GPT-SoVITS 配置教程里最核心的路径只有三步。3.1 拉代码 一键安装先克隆项目安装脚本会自动识别 Apple Silicon 并装匹配版本的 PyTorchgit clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device MPS --source ModelScope--device MPS告诉脚本按 Apple Silicon 准备依赖--source指定预训练模型的下载渠道装完模型会落在GPT_SoVITS/pretrained_models/。3.2 改两个配置项打开GPT_SoVITS/configs/tts_infer.yaml在你实际要用的模型段默认 v2里改两个字段v2: device: mps # 原来是 cpu is_half: true # 原来是 false为什么fp16 半精度把显存和算力开销都砍一半M 系 GPU 对它支持良好。之后在 WebUI 里切 v2Pro 或 v3记得把对应段落也改成一致。3.3 设环境变量 → 启动 WebUI → 听到第一句合成音先设一个兜底变量再启动export PYTORCH_ENABLE_MPS_FALLBACK1 python webui.py这个变量让少数 MPS 后端没实现的算子自动回退到 CPU避免直接崩进程。启动后浏览器打开 http://127.0.0.1:9874 选一个参考音频、敲一句话你就能听到第一句合成音。四、参数怎么调内存、批量、半精度先看按内存档位划分的建议值内存is_halfbatch_size 建议8GBtrue116GBtrue2长文本降到 132GBtrue4还可再试高些需要盯住的字段就四个device、is_half、batch_size、max_length位置都在上面那个 yaml 里不用改完整配置。16GB 为什么别把 batch 开大GPT 和 SoVITS 共用同一池统一内存batch 一抬长文本的中间激活就要翻几倍拷贝内存会直接顶到 OOM 边缘。五、跑完这组对比数据说话先说结论M1 Pro16GB上MPS 加半精度大约是 CPU 的四倍速内存反而更低。模式平均单句耗时内存占用CPUFP320.8s4.2GBMPSFP320.3s5.8GBMPSFP160.2s3.5GBMPSINT8 量化0.15s2.8GB主观听感FP16 和 FP32 基本听不出差别MOS 主观评分 4.2/5.0与 CPU 持平INT8 在长句尾部有轻微毛刺草稿场景够用成品还是建议 FP16。做 Mac TTS 性能调优时这一栏就是取舍的标尺。六、踩过的坑 怎么绕开坑 1报aten::_linalg_svd之类的算子不支持。原因PyTorch 的 MPS 后端没有实现全部算子。修复export PYTORCH_ENABLE_MPS_FALLBACK1重跑即可缺失算子会自动走 CPU。坑 2长文本直接 OOM 崩溃。原因16GB 统一内存batch 还没降到 1。修复把 batch 设为 1顺手关掉浏览器和其他吃内存的 App再重跑。坑 3明明写了 mps速度却没变化。原因模型实际还停在 CPU 上。一行确认import torch print(next(model.parameters()).device)输出若是 cpu回去检查 yaml 里 device 字段是否真的改到了你正在用的那段。七、还想再压一压量化、流式与多语言三个方向各一句话用得上再翻。INT8 量化导出看 GPT_SoVITS/export_torch_script.py低延迟流式出音看 GPT_SoVITS/stream_v2pro.py中、日、英、韩、粤语的多语言文本处理在 GPT_SoVITS/text/ 目录。这套 Apple Silicon 推理优化的思路换别的 TTS 项目也通用。打开终端三条命令两分钟后你的 Mac 就在用 GPU 说话了。最佳配置取决于你的具体芯片和内存先从默认跑通再逐项去调。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表