ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

10秒视频克隆数字人:Duix.Avatar 免费本地 AI 数字人克隆完整指南

10秒视频克隆数字人:Duix.Avatar 免费本地 AI 数字人克隆完整指南 10秒视频克隆数字人Duix.Avatar 免费本地 AI 数字人克隆完整指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar做口播视频要布景、打光、录制、再剪辑文案一改就得重来。Duix.Avatar 解决的就是这个问题。它是一款完全免费开源的 AI 数字人克隆工具用一段 10 秒的视频就能克隆出你的形象和声音。之后你只需输入文案或上传一段音频就能生成一条口型对齐的口播视频。整个过程都在你自己的电脑上离线运行。视频素材和声音数据不会离开这台机器。代码完全开放你可以自由修改、扩展也可以参与社区共建。硬件要求是一张 NVIDIA 显卡加 32GB 内存部署和首次上手大约 30 分钟。它适合内容创作者、教师、企业市场团队也适合想折腾数字人的个人用户。下文按自检 → 部署 → 生成 → 排错的顺序写你可以直接跟着做。先自检你电脑要满足的 4 项硬件条件这 4 项里缺任何一项都别急着部署三个核心服务起不来。显卡必须是 NVIDIA 显卡30、40、50 系列都可以驱动要装好。这个项目的算力全在本地没有 N 卡服务直接跑不了。内存官方推荐 32GB 起步参考配置是 i5-13400F 加 RTX 4070。硬盘服务镜像要 100GB 以上空间数据目录再留 30GB 存放数字人文件。系统Windows 1019042.1526 及以上或 Ubuntu 22.04。磁盘空间不够时改镜像位置C 盘空闲不足 100GB 不必重装系统。装完 Docker 后在 Settings → Resources → Advanced 里点 Browse把磁盘镜像位置挪到空间够的盘。部署前先验证显卡驱动终端输入nvidia-smi能看到显卡型号和驱动版本就没问题。命令报错或找不到先装驱动。驱动没装好是服务起不来的头号原因。30 分钟完成部署3 个 Docker 服务加 1 个客户端服务端是 3 个 Docker 镜像客户端是 1 个安装包全程约 30 分钟一半时间在下载镜像。先装 DockerUbuntu终端执行docker --version有版本号就跳过。没有的话按顺序装 3 个包命令见下方代码块。Windows用wsl --list --verbose检查 WSL用wsl --update更新再装 Docker Desktop首次启动接受协议。sudo apt update sudo apt install docker.io sudo apt install docker-compose一条命令拉起 3 个服务三个服务分工明确。一个做语音识别ASR基于 fun-asr一个做语音合成TTS基于 fish-speech一个做视频合成也就是数字人视频生成引擎。后面讲 API 时这三块能力会原样开放出来。克隆仓库地址https://gitcode.com/GitHub_Trending/he/Duix-Avatar找到 部署配置 所在的deploy目录。在该目录执行docker-compose up -d。下载约 70GB建议连 WiFi耐心等约 30 分钟。Docker 里看到 3 个服务运行中即成功。精简版换docker-compose-lite.yml只有 1 个视频生成服务。安装客户端Windows下载官方构建的安装包双击Duix.Avatar-x.x.x-setup.exe安装。UbuntuAppImage 直接双击运行。root 用户下打不开时在终端加--no-sandbox参数启动。10 秒视频的克隆流程建数字人并生成第一条口播视频两步完成先上传 10 秒视频克隆形象和声音再输入文案生成口播视频。上传 10 秒视频同时克隆形象和声音素材要求人脸清晰、说话声音清楚10 到 20 秒最合适太短提取不到足够特征。在主界面点Create Avatar上传后系统自动提取面部特征和声音特征耗时几分钟取决于显卡。训练完成后模型出现在My Avatars列表里。输入文案或上传音频生成口播视频选中数字人模型输入文案或上传音频文件点生成即可。文案支持 8 种语言中、英、日、韩、法、德、阿拉伯、西班牙。客户端界面本身也可以切换语言。几分钟后口播视频出现在My Works里口型自动对齐。排查 4 类高频问题从镜像到进度卡住你遇到的问题大概率是这 4 类FAQ 里都有对应解法。问题一服务起不来查驱动和端口用nvidia-smi确认显卡被识别三个服务都依赖 N 卡。确认 8383、18180 端口没被其他程序占用被占就关掉占用程序或改端口映射。确认服务端和客户端都是最新版本。社区更新频繁你的问题可能已经被修掉。问题二镜像拉取失败配置镜像源部署阶段最常见的失败是 Docker Hub 连接不稳定镜像下载中断。解决办法是在 Docker 设置里加镜像源打开 Docker Engine 配置在registry-mirrors字段填入可用的镜像地址然后应用并重启。问题三生成进度卡住先看 tts 日志进度卡在 20% 通常是音频处理环节出问题。在 Docker 里打开 3 个容器的日志重点看语音合成tts服务。最高频的报错是File not exists指向音频文件路径问题。一般重启该服务或检查音频文件的路径和权限就能恢复。客户端侧的日志也不难找客户端右上角设置菜单里有Open Log或者直接在 logs 目录里找main.log文件。图形界面之外3 个本地 API 与批量生成当界面点不过来时3 个本地 API 就是答案全部通过 127.0.0.1 访问。模型训练 API上传 10 秒视频拆出无声视频和音频返回后续合成要用的参考参数。音频合成 API监听 18180 端口传入文案和训练返回的参考音频输出数字人语音。视频合成 API监听 8383 端口传入音频与视频路径提交任务再按任务码查询进度。具体请求参数写在 API 实现代码 里。model.js、video.js、voice.js 三个文件分别对应一项能力照着写请求就行。批量生成把 API 排进队列一次要出几十条口播视频时别逐条点界面。写个脚本循环调用这 3 个 API先克隆模型再逐条合成语音最后提交视频任务。系统会自动管理任务队列这就是本地数字人视频生成的批量做法。这类工具最适合谁用四类人按使用频率排序。内容创作者不露脸也能产出口播视频保住更新频率。8 种语言支持让你用同一份文案出多语言版本。教育做数字人讲师把讲义转成课程视频形象统一重复课程不用反复出镜。企业品牌代言、产品介绍、客服口播数字人 7x24 小时在岗。个人用户纪念视频、祝福视频门槛就是一条 10 秒的录像。想动手的话克隆仓库https://gitcode.com/GitHub_Trending/he/Duix-Avatar照部署章节一步步做或直接下载客户端安装包。遇到问题先查项目里的 FAQ 文档还卡住就去项目 Issues 区提问社区更新很快。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表