QQ扫一扫联系
Wav2Lip 是一个经典的基于深度学习的语音驱动唇动同步(Lip-Sync)模型(ACM MM 2020 论文),能够根据输入音频生成与之高度同步的唇动视频,使视频中的人物口型与音频内容精确匹配,产生更自然真实的口型运动。
视频配音口型同步、数字人/虚拟角色口型生成、影视与短视频二创、多语种视频本地化配音等。
效果可参考:https://github.com/Rudrabha/Wav2Lip
✅ 新增:模型文件统一下载到项目本地模型目录,推理时离线加载,启动更稳定可靠
✅ 新增:支持 N 卡 50 系列及以上显卡(初始化与构建流程升级为 CUDA 128 版本 PyTorch)
✅ 优化:推理模型加载逻辑优化,模型缺失时自动回退备用权重
✅ 优化:测试流程通过启动器运行,并自动校验输出文件真实存在