FEATURED · 精选文章

本地数字人怎么跑起来:用10秒视频克隆形象,全程离线生成口播视频

发布时间 / 2026/9/11 8:30:40
来源 / 创域科博编辑部
栏目 / 资讯中心
本地数字人怎么跑起来:用10秒视频克隆形象,全程离线生成口播视频 本地数字人怎么跑起来用10秒视频克隆形象全程离线生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar把一段10秒左右的手机自拍视频交给 Duix.Avatar它能克隆出你的形象和声音之后输入一段文案或直接上传自己的录音就能得到一个口型同步的说话视频。整个过程在本机完成不用把素材上传到云端——这是这个开源项目最值得先知道的一点。它是什么适合谁Duix.Avatar 是一个全离线的数字人视频工具服务端跑在 Docker 里基于本地 NVIDIA 显卡客户端是一个桌面程序负责上传素材、录入文案、预览和导出。官方推荐配置是 i5-13400F、32G 内存、RTX 4070 级别显卡磁盘预留 100G 以上社区里有不少 8G 显存显卡跑通的反馈显存需求在同类方案里算比较省。它适合三类人做课程、口播、产品演示需要频繁更换文案但不想反复出镜录制的创作者在意素材隐私、不想让视频和声音离开自己机器的用户想基于开放 API 做二次开发、把数字人能力嵌进自己产品的开发者。最低配置要求与最短启动路径先说硬件底线三条都是硬要求有 NVIDIA 显卡并装好驱动所有算力都在本地没有 N 卡三个服务都起不来内存 32G 及以上16G 内存的机器 ASR 服务可能直接启动失败Windows 需要 D 盘空闲大于 30G、C 盘大于 100G存镜像Ubuntu 需要 100G 空闲磁盘。服务端就是几条命令的事。以 Ubuntu 22.04 为例装好 Docker 和 NVIDIA Container Toolkit 后git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose -f docker-compose-linux.yml up -dWindows 用户在仓库的deploy目录直接执行docker-compose up -d即可。首次拉取镜像会消耗约 70G 流量官方给出的等待时间是半小时左右速度取决于你的网速建议连 WiFi 耐心等。启动成功后 Docker 里会看到duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个服务处于 Running 状态。客户端不需要自己编译从项目 Releases 页面下载官方构建的安装包Windows 是 exe 安装程序Linux 是 AppImage双击即可。核心能力拆解形象 声音一次克隆。上传一段约10秒、有清晰人声的视频程序会同时完成外貌建模和声纹克隆之后这个人开口用的就是你的声音。适合需要统一出镜形象的团队。文本、录音双驱动。生成视频时可以输入文案由 TTS 合成本人音色朗读也可以直接上传一段录音支持 mp3、wav 等单条小于 30 分钟官方提示用干声、避开背景音效果更好。适合有现成脚本或已录好旁白的场景。全离线数据不出机器。从视频采集、预处理、克隆到合成导出全程无网络交互素材只存在本地磁盘。适合对隐私敏感的内容生产。开放本地 API。Docker 启动后在 127.0.0.1 上暴露模特训练、音频合成、视频合成三类接口端口 10095 / 18180 / 8383源码在src/main/service/下有完整调用示例。适合想把数字人能力接进自有系统的开发者。两个真实使用场景的复盘第一次部署卡在拉镜像。我在 Windows 上跟着文档走docker-compose up -d执行后三个容器反复报错日志里全是registry-1.docker.io连接超时——就是 Docker Hub 官方源在国内访问不稳定的老问题。处理办法是在 Docker Desktop 的 Docker Engine 设置里加上国内 registry 镜像源官方常见问题里给了一份现成配置改完 Apply and restart重新拉取就顺了。克隆第一步报 Connection refused。服务端刚拉起来我马上就上传视频做模特克隆结果客户端直接报Connection refused日志里能看到 ASR 服务还没建立连接。后来才明白 ASR 服务启动比较慢官方建议服务端启动后等几分钟再做克隆操作。等了几分钟重试克隆顺利通过客户端首页就多了这个数字分身。把课程口播搬回家。第二个场景是我录了一段 10 秒的正面说话视频文档要求至少 8 秒、吐字清晰、必须带人声克隆成功后写一段讲稿贴进文案输入框生成的视频里我的口型和讲稿逐句对应换文案重新生成不需要再录任何东西。客户端首页的 My Avatars 和 My Works 分别管理克隆的形象和生成的作品支持建多个形象切换做系列内容时很方便。硬件门槛与可选部署方案服务端提供三份 compose 文件按需选一个不要混用方案启动命令deploy 目录下容器适用场景完整版Windowsdocker-compose up -dasr / tts / gen-video 三个常规创作8 种语言 TTS中、英、日、韩、法、德、阿、西轻量版 litedocker-compose -f docker-compose-lite.yml up -d仅 gen-video显存紧张、或已有外部 TTS 只跑视频驱动50 系列版docker-compose -f docker-compose-5090.yml up -dtts(5090) / gen-video 两个RTX 50 系列显卡基于 torch 预览版30/40 系列部分 CUDA 12.8 用户也可用两个容易忽略的配置合成容器设置了 8G 的 shm_size内存小的机器建议同时把 Docker 的内存上限调上去磁盘方面镜像加模型加数据预留 100G 是官方口径的稳妥值社区有反馈 10G 量级的模型、8G 显存也能跑可以按自己机器情况试。部署和使用中的常见坑位Qdocker-compose up -d报 request canceled / connection 超时Docker Hub 官方源在国内不稳定。在 Docker 的 daemon 配置里加国内 registry-mirrors仓库 FAQ 里有一份可用列表或走全局代理后重试。Q新增模特时报错提示与视频相关用于克隆的视频必须带人声、且是人在说话程序要用这段声音做声音克隆纯画面或音乐视频会失败。Q定制模特报 Connection refusedASR 服务启动慢服务端刚拉起就操作容易撞上等几分钟重试即可另外 16G 内存的机器 ASR 可能根本起不来。Q三个服务怎么也起不来先跑nvidia-smi确认 NVIDIA 显卡和驱动正常本项目没有 N 卡或驱动缺失时容器是无法启动的。QUbuntu 下用 root 双击 AppImage 没反应在终端里加--no-sandbox参数启动即可官方文档有说明。Q想换新版服务端到deploy目录重新执行docker-compose up -d项目更新比较频繁不少旧问题在新版里已经修掉。边界与入口适合谁、不适合谁一句话讲清有 N 卡8G 显存以上社区已有验证、32G 内存、百 G 级硬盘且在意素材不出本地或想二次开发的值得花一个晚上把它跑起来没有 N 卡、想零部署开箱即用、或只偶尔做一两条视频的这个项目的维护成本对你就是负资产。项目地址clone 用git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar部署文档README_zh.mdWindows / Ubuntu / 50 系列三套安装说明都在里面常见问题doc/常见问题.md授权协议LICENSE【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻