ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

SadTalker新手保姆级教程:3步让一张照片开口说话,附完整避坑指南

SadTalker新手保姆级教程:3步让一张照片开口说话,附完整避坑指南 SadTalker新手保姆级教程3步让一张照片开口说话附完整避坑指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 获奖的开源语音驱动人脸动画模型——上传一张人像照片加一段音频就能自动输出口型同步的说话头部视频。本文带你走完环境搭建、模型下载、生成第一个视频的完整流程文末还有参数速查表和避坑清单新手 30 分钟内即可跑通。先认识 SadTalker 能做什么SadTalker 的输入输出非常简单输入一张正脸人像照片PNG/JPG 一段音频WAV 等格式输出一段说话头部视频MP4人物嘴型随语音开合头部还会自然摆动原理上可以粗略拆成三步先把音频听成表情系数和头部姿态系数再把人脸捏出 3D 结构最后逐帧渲染成视频。核心代码分别在音频转表情模型、音频转姿态模型和人脸渲染模块进阶后可以按图索骥去翻这几个目录。⚠️ SadTalker 只适合接近真人的照片。动漫、卡通风格的脸部目前不建议使用。第一步准备环境并克隆项目开工前先备好两样基础软件Python 3.8和ffmpeg负责读写视频文件的工具没有它视频会没有声音。如果还没装过 conda先安装 Anaconda 即可。# 1. 克隆项目 git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker # 2. 创建独立虚拟环境避免依赖污染其他项目 conda create -n sadtalker python3.8 -y conda activate sadtalker # 3. 安装 PyTorch有 CUDA 显卡的用户请选用对应驱动版本 pip install torch torchvision torchaudio # 4. 安装 ffmpeg conda install ffmpeg # 5. 安装项目依赖 pip install -r requirements.txt几个提醒强烈建议用虚拟环境。SadTalker 的部分依赖版本较老独立环境能避免把别的项目搞崩。Windows 用户先安装 Python 3.8 并勾选Add to PATHffmpeg 直接用 conda 装最省事。macOS 用户依赖装完后需要额外执行pip install dlib详见安装文档。第二步一条命令下载模型权重SadTalker 的模型权重可以理解为模型的大脑没有打包在代码仓库里需要单独下载。好消息是项目提供了官方一键脚本bash scripts/download_models.sh跑完后会生成两个目录各司其职目录里面是什么作用checkpoints/256/512 人脸渲染模型、映射网络主力模型负责看音频做动作gfpgan/weights/GFPGAN 面部增强、人脸检测模型负责把脸变清晰模型下载防超时技巧脚本里的下载命令都带了-nc断点续传参数中途断网或超时的话重新执行一遍同样的脚本即可它会自动跳过已下载完成的部分不用从头再来。下载结束后确认checkpoints/下至少有SadTalker_V0.0.2_256.safetensors、SadTalker_V0.0.2_512.safetensors和两个mapping_*.pth.tar文件。第三步跑通第一个说话视频万事俱备直接试项目在examples/目录里备好了示例音频和照片拿来即用。基础模式人像照片 音频python inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/art_9.png \ --result_dir ./results结束后打开results/目录里面会多出一个以时间戳命名的 MP4 文件。如果人物嘴型和语音对得上你就已经成功了 全身模式加两个参数防变形如果照片里人物没有占满画面比如全身照、半身照请补上--still和--preprocess fullpython inference.py --driven_audio examples/driven_audio/chinese_news.wav \ --source_image examples/source_image/art_17.png \ --result_dir ./results \ --still --preprocess full --enhancer gfpgan--preprocess full对整张图做动画再贴回原构图保留人物与背景--still头部保持照片里的原始姿态减少乱晃全身图必加--enhancer gfpgan用 GFPGAN 模型锐化人脸成片观感明显更干净想用鼠标点打开 WebUI 界面不习惯敲命令的话SadTalker 自带一个 Gradio 网页界面拖拽上传音频和图片就能生成# Linux / macOS bash webui.sh # 或者直接运行 python app_sadtalker.pyWindows 用户直接双击webui.bat即可它会自动装好依赖并打开页面。如果想让网页里文本转语音先额外安装 TTS 组件pip install TTS。常用参数速查表跑通第一个视频后你可能会想微调效果。最常用的一行参数汇总如下完整说明见最佳实践文档参数默认值它是干嘛的什么时候用--preprocesscrop人脸特写模式 / 整图模式头像照用crop全身照用full并配--still--still关保持原头部姿态、减少头部晃动全身图、半身图必加--enhancer无人脸画质增强gfpgan/RestoreFormer脸糊、追求细节时开启--size256人脸渲染分辨率512画质更好但更吃显存--expression_scale1.0表情幅度1.0更夸张生动1.0更收敛克制--batch_size2一次处理的帧数显存不足时改为1--ref_eyeblink无眨眼参考视频想让眨眼更自然时指定--ref_pose无头姿参考视频想借用另一段视频里的头部动作显存吃紧8G 以下显卡的降载技巧加上--batch_size 1让显卡一次少干点活--size保持默认256非必要不开--enhancer避坑速查症状可能原因解决办法视频能播但没声音环境里缺 ffmpeg执行conda install ffmpeg后重跑CUDA out of memory显存不够加--batch_size 1暂时关掉--enhancer生成的脸偏糊默认 256 分辨率加--enhancer gfpgan或改用--size 512全身图结果变形没走整图模式补上--still --preprocess full模型下载中断网络波动重跑bash scripts/download_models.sh支持续传提示检测不到人脸照片侧脸、遮挡或卡通换一张正脸、无遮挡的真人照遇到更冷门的问题可以先翻项目的 FAQ里面覆盖了报错处理和 Docker、WSL 等环境的细节。进阶玩家去哪儿跑通之后下一步是看懂它为什么这么动几个值得逛的路径docs/best_practice.md官方参数详解 各模式效果对比图调参前必读src/audio2exp_models/把音频变成表情的模型src/audio2pose_models/把音频变成头部姿态的模型src/facerender/人脸渲染网络最终画质的核心docs/face3d.md3D 人脸可视化模式需额外安装requirements3d.txt中的依赖scripts/extension.pyStable Diffusion WebUI 扩展的接入参考小结回头看整个流程其实只有三步建环境 → 下模型 → 跑inference.py。真正决定效果好坏的是根据输入照片类型选对--preprocess模式和--still参数剩下的交给模型即可。现在就去挑一张正脸照、录一段自己的语音让它开口说话吧。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表