QQ扫一扫联系
MuseTalk 是腾讯音乐娱乐集团(TME)天琴实验室开源的实时高清音频驱动唇同步(Lip-Sync)模型,可将输入视频中的人脸与给定音频精确对齐,生成高质量、自然表现的口型同步视频,广泛应用于语音驱动视频生成、虚拟形象和数字人制作等领域。
数字人直播、视频配音口型同步、虚拟主播、影视/短视频二创、多语种视频本地化等。
效果可参考:https://github.com/TMElyralab/MuseTalk
✅ 新增生成物有效性校验,自动校验视频/音频/图片输出为可正常解析的有效媒体文件
✅ 新增模拟结果占位媒体生成能力,长任务模拟输出使用可正常播放的有效媒体文件
✅ 支持图片或视频作为输入素材,图片输入时按 25 帧合成口型视频
✅ 合成视频时自动将宽高修正为偶数,兼容奇数尺寸输入素材
✅ Windows 下自动加载随包分发的内置 ffmpeg,无需系统预装 ffmpeg
✅ 确保模型文件解压后正常加载,人脸解析模型等推理模型完整随包分发
✅ 修复模型下载位置与推理加载路径不一致的问题,确保模型下载后能被正确加载
常规优化
优化模型调用异常
视频合成、视频管理