Model Download LatentSync 数字人对口型 ComfyUI工作流一键运行包
离线 免费 视频换口型 内存 16G+GPU 16G+
支持系统 Win-x86Linux-x86
免费 该资源免费,可直接下载使用

LatentSync1.5 是字节跳动开源的潜扩散端到端唇形同步模型,新增时序层优化画面连贯性,强化中文口型匹配效果,大幅降低训练显存至 20GB,消费级显卡即可实现音频驱动视频精准对口型,适配短视频配音、数字人制作场景GitHub

v1.0.0 初版发布 Download
2026-09-02 Win-X86 Linux-X86

✅ 第一个版本发布

✅ 数字人对口型(LatentSync 1.5):输入含正脸说话视频 + 目标音频,输出嘴型与音频同步的视频,当前开源方案效果最优(纯 PyTorch,支持 CUDA / MPS / CPU)

✅ 完整实现对口型专用节点:模型懒加载常驻复用、上传兼容新版 ComfyUI、默认低分辨率显存友好(8GB 级显卡可跑,高质量模式可选)

✅ 模型仓库架构:主模型/Whisper/VAE/人脸检测模型统一管理,自动下载,随包分发

✅ 人脸检测不依赖联网下载(模型随包分发)

✅ 精简为单一工作流服务:聚焦对口型场景,服务配置与工作流保持一致

✅ 补齐视频解码与人脸检测依赖,初始化时自动安装;人脸检测模型随包分发,离线可用

✅ 修复推理加载路径,确保对口型管线正确加载

✅ 推理设备自动降级:无 GPU 环境自动降级运行,人脸检测自适应加速,保证任意机器可运行

✅ 修复推理数值稳定性:人脸关键点异常时自动降级,避免推理中断

✅ 修复视频输出通道顺序:异常帧与原图保持一致,避免合成视频失败

✅ 修复推理段错误崩溃:人脸帧数值异常时跳过恢复并输出原图,避免服务进程挂掉

✅ 优化:打包测试时自动复制示例素材到解压测试目录,保证示例配置可用

✅ 优化:示例配置改用更合适的音频素材

Language
QQ
微信客服
微信群
客服