
免费AI数字人本地部署Duix.Avatar用10秒视频训练你的数字分身【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是免费开源的AI数字人工具上传约10秒的真人说话视频在本地克隆你的形象和声音输入文案即可生成口播视频。适合不想把影像声音传上云端的教育者、内容创作者与企业培训人员。项目速览这款免费AI数字人工具能做什么简单说它把录视频、克隆、配音、对口型这套流程装进了一个桌面应用你提供一段真人视频它负责后续的 AI 数字人生成全程不联网。维度说明它做什么克隆外貌声音文字/语音驱动自动生成口型同步的口播视频适合谁无编程基础的个人创作者、教师、企业培训人员是否离线完全离线数据和算力都在你自己的电脑上部署成本一次性下载约70G镜像之后无授权费、无月费主界面只有两个核心入口左侧 Create Video 直接用数字分身做视频右侧 Create Avatar 先训练一个分身。下面的 My Works / My Avatars 分别管理你的作品和已训练的模型。上手前的门槛本地部署数字分身的硬件与软件要求先把话说在前面这个项目的所有算力都在本地必须有一张装了驱动的英伟达显卡否则三个服务都起不来。硬件要求部件要求备注CPU13代 i5 起步如 i5-13400F官方推荐配置内存32GB 及以上16GB 可能起不动 ASR 服务显卡英伟达显卡推荐 RTX 4070驱动装好后nvidia-smi能显示信息即可硬盘100GB 以上空闲WindowsC盘存镜像需 100GD盘存数据需 30G软件环境系统Windows 10 19042.1526 及以上或 Ubuntu 22.04 DesktopDockerWindows 用 Docker Desktop需先装 WSLUbuntu 用 apt 安装英伟达显卡驱动必装项装完跑一下nvidia-smi确认Node.js 18仅当你要从源码自己构建客户端时才需要直接用官方安装包可跳过5分钟部署开源AI数字人从克隆代码到服务跑起来整个部署核心就两条命令其余时间都花在下载镜像上。第1步装好 Docker 和显卡驱动Windows先确认 WSLwsl --list --verbose没装过就wsl --install再wsl --update然后安装 Docker Desktop 并首次运行Ubuntusudo apt update sudo apt install docker.io docker-compose再按官方流程装显卡驱动和 NVIDIA Container ToolkitC盘空闲不足100G时装完 Docker 可在设置里把镜像目录改到其他磁盘第2步克隆项目代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar第3步启动服务端cd deploy docker-compose up -d首次执行会拉取约70G的镜像半小时左右完成取决于网速建议连WiFi。当 Docker 里出现3 个 Running 状态的容器就算成功TTS 语音合成、ASR 语音识别、视频生成各一个。配置见 deploy/docker-compose.yml。两个可选变体显存/硬盘较小docker-compose -f docker-compose-lite.yml up -d只起视频生成1个服务50系列显卡docker-compose -f docker-compose-5090.yml up -d第4步安装客户端从官方发布页下载对应系统的安装包Windows 是 .exe 双击安装Linux 是 .AppImage 直接运行打开后它会自己检测本地三个服务是否就绪。训练第一个数字人4步完成形象与声音克隆服务跑起来后创建第一个数字分身大概是这样录素材一段 10 秒左右的正面视频光线充足、背景干净视频里必须有你本人在说话——这段声音是语音克隆的原料纯无声视频会直接报错上传视频点 Create Avatar 上传素材等待训练完成约30分钟包含面部特征提取和语音模型训练写文案训练好后进 Create Video输入一段文字或用 8 种语言中、英、日、韩、法、德、阿拉伯语、西班牙语之一生成视频系统合成音频并驱动口型完成后在 My Works 里直接播放、下载原理速览10秒视频如何变成数字分身架构上就是一个桌面客户端 三个本地 Docker 服务。客户端Electron Vue只负责界面和流程编排重活都由容器干彼此通过本机端口通信TTS 服务fish-speech18180 端口、ASR 服务fun-asr10095 端口、视频生成服务8383 端口。一条口播视频的完整数据流你上传的视频先用 FFmpeg 分离为「静音视频 人声」人声送去训练语音模型ASR 负责把参考音频转成文字供后续对齐生成时你输入的文案先经 TTS 合成为你的声音视频生成服务用这段音频驱动分身口型渲染出最终口播视频想深入的话从 src/main/service/model.js模型训练、src/main/service/video.js视频合成、src/main/service/voice.js语音处理三个文件入手最直观。本地部署的数字分身能用来做什么教育培训批量生产章节讲解视频同一课程出一套多语言版本课件更新时只需改文案不用重拍企业应用标准化的产品演示片风格统一的员工培训材料对外宣传保持品牌形象一致自媒体创作一次写稿、多次出片提高口播视频产量固定个人出镜形象建立识别度音画全程本地处理素材不经过第三方平台本地部署常见坑与排查部署过程中最容易卡住的三个问题按「现象 → 动作」排查docker-compose up -d拉镜像超时request canceled / timeout现象三个容器全部报Error response from daemon动作Docker Hub 直连不稳定。在 Docker 的 Docker Engine 设置里加registry-mirrors国内镜像源后重启再重新执行启动命令创建数字人报错或无响应Connection refused现象上传素材后训练失败日志里 ASR 连接被拒动作先确认素材视频有人声无声音频无法做声音克隆再注意 ASR 服务启动较慢三个服务起来后等几分钟再发起克隆内存只有16G的机器可能根本起不来需按硬件要求升级三个服务起不来或反复重启现象容器状态不是 Running动作执行nvidia-smi检查显卡和驱动是否就绪这是最常见原因其次确认客户端和服务端都是最新版本服务端可在/deploy目录重新执行docker-compose up -d更新更完整的排查步骤和提问模板见 doc/常见问题.md。收尾现在开始你的数字分身一句话总结Duix.Avatar 让你用一段10秒视频在自己电脑上免费造一个能说话的数字分身数据全程不出门。资源入口完整安装文档README_zh.md含 Ubuntu 22.04 与50系显卡方案部署配置deploy/docker-compose.yml排障指南doc/常见问题.md社区交流项目技术交流邮箱 jamesduix.com下一步行动先按部署章节把三个服务拉到 Running然后录一段10秒的说话视频把第一个数字分身训练出来——跑通这一遍后面就只是换文案的事了。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考