模型市场 MuseTalk模型一键运行包
云端 离线 免费 视频换口型 GPU 16G+内存 16G+
支持系统 Win-x86Linux-x86
免费 该资源免费,可直接下载使用

MuseTalk 是腾讯音乐娱乐集团(TME)天琴实验室开源的实时高清音频驱动唇同步(Lip-Sync)模型,可将输入视频中的人脸与给定音频精确对齐,生成高质量、自然表现的口型同步视频,广泛应用于语音驱动视频生成、虚拟形象和数字人制作等领域。

核心特性

  • 实时高清唇同步:单步隐空间补全(Inpainting)机制,在 NVIDIA V100 上可实现 30fps+ 实时推理
  • 多语言音频支持:支持中文、英文、日文等多种语言的音频驱动
  • 高画质版本升级:1.5 版本引入感知损失、GAN 损失与同步损失训练,显著提升画面清晰度、身份一致性与唇音同步精度
  • 256x256 人脸区域:针对人脸区域精修,兼顾口型精度与整体画质
  • 生态联动:可与 MuseV 等视频生成模型配合,构成完整的虚拟人解决方案

适用场景

数字人直播、视频配音口型同步、虚拟主播、影视/短视频二创、多语种视频本地化等。

效果可参考:https://github.com/TMElyralab/MuseTalk

原始视频
合成视频
v1.2.0 连续合成优化速度 下载
2026-08-08
v1.1.0 连续合成优化速度 下载
2026-04-28
v1.0.0 适配最新版,连续合成加速 下载
2025-10-14
v0.6.0 常规优化 下载
2025-06-21
v0.5.2 常规优化 下载
2025-03-22

常规优化

v0.5.0 常规优化 下载
2025-03-03
v0.4.0 模型优化 下载
2025-02-24
v0.3.0 模型优化 下载
2025-02-19
v0.2.0 常规优化 下载
2025-02-11
v0.1.0 优化模型调用异常 下载
2024-12-16

优化模型调用异常

v0.0.1 视频合成、视频管理 下载
2024-11-01

视频合成、视频管理

语言
QQ
微信客服
微信群
客服