Model Download FlashTalk 数字人口型驱动一键运行包
免费 视频换口型 GPU 24G+内存 32G+支持50显卡
免费 该资源免费,可直接下载使用

FlashTalk 是 Soul-AILab 开源的 14B 参数数字人口型驱动模型(SoulX-FlashTalk-14B),采用自校正双向蒸馏(Self-Correcting Bidirectional Distillation)架构,支持无限长流式说话视频生成,画质高清、口型同步准确。

核心特性

  • 14B 大参数模型:基于 DiT 架构,利用大规模数据训练,生成视频质量高、面部细节丰富
  • 无限长流式生成:支持无限时长音频驱动的流式说话视频生成,无需分段拼接,适合直播、长视频等场景
  • 自校正双向蒸馏:创新蒸馏技术,兼顾推理效率与生成质量,在消费级 GPU(如 RTX 4090/5090)上达到实时性能
  • 高精度口型同步:输入人物图片与音频,自动生成与音频口型同步的逼真说话视频
  • 支持 RTX 50 系显卡:基于 PyTorch 2.7+ cu128 构建,原生支持 Blackwell 架构

适用场景

数字人直播、视频配音、虚拟主播、影视后期、实时互动应用

更多信息可参考:https://soul-ailab.github.io/soulx-flashtalk/

Language
QQ
微信客服
微信群
客服