ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Duix.Avatar 免费开源 AI 数字人部署教程:10 秒视频克隆形象,离线生成口播视频

Duix.Avatar 免费开源 AI 数字人部署教程:10 秒视频克隆形象,离线生成口播视频 Duix.Avatar 免费开源 AI 数字人部署教程10 秒视频克隆形象离线生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar做一条真人出镜的口播视频最省事的方式大概是录一段 10 秒左右的视频喂给Duix.Avatar让它克隆你的形象和声音之后你只管把文案贴进去或者上传一段音频它就能自动把口型对上吐出一条完整的口播视频。整个过程在本地离线完成素材不经过外网隐私不用太担心。它是什么凭什么免费一个完全开源的 AI 数字人工具本地部署后可无限次生成不限量、不收订阅费服务端基于 Docker 跑在你自己的显卡上三个服务分别负责语音识别ASR、语音克隆合成TTS和视频合成全程离线克隆只依赖一段 10 秒视频脚本支持 8 种语言中、英、日、韩、法、德、阿拉伯、西班牙语客户端是 Electron 桌面程序Windows 和 Ubuntu 22.04 Desktop 都有安装包也开放本地 APIhttp://127.0.0.1方便你接到自己的业务流程里一句话区分它和其他数字人方案商业 3D 数字人动辄报价数万元而这里你只需要一台带 NVIDIA 显卡的电脑。部署前的环境检查硬盘、显存、驱动先对照一下配置差一项都可能卡住项目要求Windows 系统Windows 10 19042.1526 或更高版本D 盘存数字人和作品数据空闲 30GC 盘Docker 镜像位置空闲 100G不够时可在 Docker 设置里把磁盘镜像换到别的盘推荐硬件i5-13400F / 32G 内存必要/ RTX 4070显卡必须有 NVIDIA 显卡且驱动装好——所有算力都在本地没有它三个服务起不来Ubuntu 用户22.04 Desktop内核 6.8.0-52-generic 已验证硬盘空闲 100G依赖方面服务端需要 Nodejs 18 和三个 Docker 镜像docker pull guiji2025/fun-asr、docker pull guiji2025/fish-speech-ziming、docker pull guiji2025/duix.avatar。Windows 上装 Docker 前先用wsl --list --verbose看看 WSL 在不在没有就执行wsl --install网络原因可能失败多试几次装完用wsl --update更新再安装 Docker Desktop。C 盘空间不够时在 Settings → Resources → Advanced 里把 Disk image location 指到另一块盘服务端部署一条命令拉起三个容器仓库里deploy/目录放好了 compose 文件进目录起容器cd /deploy docker-compose up -d想要 lite 版只有视频生成服务Duix.Avatar-gen-video没有 ASR 和 TTS用docker-compose -f docker-compose-lite.yml up -d耐心等半小时左右这一轮会拉大约 70G 的镜像建议连 WiFi。Docker 里看到duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务都 Running服务端就算就绪了lite 版只有一个。两个变体场景NVIDIA 50 系列显卡30/40 系列用 cuda 12.8 的也可以改用cd /deploy docker-compose -f docker-compose-5090.yml up -d它基于 torch 官方预览版构建已在 5090 上验证通过Ubuntu 服务端装好 Docker、显卡驱动和 NVIDIA Container Toolkit装完nvidia-smi能显示显卡即成功后执行cd /deploy docker-compose -f docker-compose-linux.yml up -d镜像拉得慢或超时就在/etc/docker/daemon.json里加镜像源源会随时间失效自行搜最新的{ registry-mirrors: [ https://docker.mirrors.ustc.edu.cn, https://hub-mirror.c.163.com ] }客户端安装Windows 装 exeUbuntu 跑 AppImageWindows下载官方构建的Duix.Avatar-x.x.x-setup.exe双击安装Ubuntu下载 Linux 版Duix.Avatar-x.x.x.AppImage双击即可无需安装如果以 root 用户登录桌面双击没反应在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox加上参数就能跑客户端首次打开会要求你接受用户协议。装好之后你就在首页看到两个入口Create Video生成视频和 Create Avatar创建数字人下面挂着我的作品 / 我的数字人两个列表。从零生成第一条数字人口播视频第 1 步准备素材。录一段 10 秒左右的视频要求画面里的人在开口说话、环境音干净。注意素材必须带人声——程序要拿这段声音做声音克隆静音视频直接报错。第 2 步克隆形象与声音。在 Create Avatar 里提交这段视频。后台会自动做三件事把视频转成 H.264 的无声视频、用 ffmpeg 分离出音频、再调用 TTS 服务训练语音模型。对应代码在 src/main/service/model.js它内部会串起 src/main/service/voice.js 完成声音训练。第 3 步写文案或传音频。进入视频编辑页后先选一个数字人左侧列表可以搜索中间编辑区有两个 Tab文本驱动输入文案系统先把它转成你克隆的声音再驱动口型语音驱动直接上传音频文件数字人按音频的节奏做口型第 4 步生成并下载。提交后视频进入 waiting 队列我的作品里能看到排队进度生成完可以直接播放下载。支持批量生成也支持导入多个模型按场景切换。进阶本地 API 与高级参数不想走客户端界面、想批量跑任务的话Docker 起完后本地就能调 API可参考 src/main/api/f2f.js 的调用方式模特训练视频分离出音频后放到D:\duix_avatar_data\voice\data该路径与guiji2025/fish-speech-ziming服务约定可在 docker-compose 里改然后 POSThttp://127.0.0.1:18180/v1/preprocess_and_tran请求体{ format: .wav, reference_audio: xxxxxx/xxxxx.wav, lang: zh }返回的asr_format_audio_url和reference_audio_text要记下来后面音频合成要用。音频合成POSThttp://127.0.0.1:18180/v1/invokespeaker传一个唯一 UUIDtext传要合成的文案reference_audio/reference_text填上一步的返回值其余为固定传参format: wav、topP: 0.7、max_new_tokens: 1024、chunk_length: 100、repetition_penalty: 1.2、temperature: 0.7、need_asr: false、streaming: false、is_fixed_seed: 0、is_norm: 0。视频合成POSThttp://127.0.0.1:8383/easy/submit参数audio_url音频路径、video_url视频路径、code唯一 key、chaofen: 0超分开关、watermark_switch: 0水印开关、pn: 1再用 GEThttp://127.0.0.1:8383/easy/query?code${taskCode}轮询进度。合成服务本体在 src/main/service/video.js。这些坑大概率会踩到镜像拉取超时request canceled while waiting for connection可能原因Docker Hub 官方源连接不稳定。 处理开全局代理重试或在daemon.json配置国内镜像源见上文 JSON。新增数字人报错、克隆直接失败可能原因上传的视频没有声音或画面里的人没在说话程序拿不到可克隆的声源。 处理换一段 10 秒左右、人声清晰的视频重新提交。克隆时报Connection refused可能原因ASR 服务duix-avatar-asr启动很慢服务端刚起就来请求会连不上16G 内存的机器也可能起不来。 处理服务端启动后等几分钟再克隆内存紧张就升到 32G。客户端连不上服务端可能原因三个容器没全部 Running、防火墙挡了端口、或版本太旧。 处理逐个检查容器状态日志入口在客户端右上角菜单的 Open Log日志文件在AppData\Roaming下的logs\main.log服务端日志则点开对应 Docker 容器的 Logs 页签查看file not exists之类的报错多和数据目录路径没配对上有关视频生成进度卡在 20% 不动可能原因显存不足或系统资源吃紧合成任务中途被拖死。 处理显存建议 8G 起步12G 更稳、加大虚拟内存、降低输出分辨率或者直接改用 lite 版部署。提问前可以先走一遍 docs/常见问题.md 里的自查步骤三个服务是否都 Running、nvidia-smi是否正常、服务端和客户端是否都更新到了最新版。写在最后到这里从环境检查、Docker 三容器、客户端安装到10 秒视频 → 文案 → 成片的完整链路都跑通了。后面项目大概率会朝实时对话、多模态输入等方向继续演进但你现在手里的这套离线工具已经够做内容批量生产课程口播、带货切片、企业宣发、个人 IP 都能用同一套流程批出来。遇到文档没覆盖的问题优先翻 docs/常见问题.md 和容器日志再考虑去社区提问。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表