QQ扫一扫联系
LatentSync1.5 是字节跳动开源的潜扩散端到端唇形同步模型,新增时序层优化画面连贯性,强化中文口型匹配效果,大幅降低训练显存至 20GB,消费级显卡即可实现音频驱动视频精准对口型,适配短视频配音、数字人制作场景GitHub
✅ 第一个版本发布
✅ 数字人对口型(LatentSync 1.5):输入含正脸说话视频 + 目标音频,输出嘴型与音频同步的视频,当前开源方案效果最优(纯 PyTorch,支持 CUDA / MPS / CPU)
✅ 完整实现对口型专用节点:模型懒加载常驻复用、上传兼容新版 ComfyUI、默认低分辨率显存友好(8GB 级显卡可跑,高质量模式可选)
✅ 模型仓库架构:主模型/Whisper/VAE/人脸检测模型统一管理,自动下载,随包分发
✅ 人脸检测不依赖联网下载(模型随包分发)
✅ 精简为单一工作流服务:聚焦对口型场景,服务配置与工作流保持一致
✅ 补齐视频解码与人脸检测依赖,初始化时自动安装;人脸检测模型随包分发,离线可用
✅ 修复推理加载路径,确保对口型管线正确加载
✅ 推理设备自动降级:无 GPU 环境自动降级运行,人脸检测自适应加速,保证任意机器可运行
✅ 修复推理数值稳定性:人脸关键点异常时自动降级,避免推理中断
✅ 修复视频输出通道顺序:异常帧与原图保持一致,避免合成视频失败
✅ 修复推理段错误崩溃:人脸帧数值异常时跳过恢复并输出原图,避免服务进程挂掉
✅ 优化:打包测试时自动复制示例素材到解压测试目录,保证示例配置可用
✅ 优化:示例配置改用更合适的音频素材