模型市场 ‌Spark-TTS模型一键运行包
离线 免费 语音克隆 GPU 8G+GPU 16G+
支持系统 Win-x86MacOS-Apple
免费 该资源免费,可直接下载使用

Spark-TTS 是 SparkAudio 团队(香港科技大学等联合)开源的基于大语言模型(LLM)的高效文本转语音(TTS)工具,无需额外的生成模型,直接从 LLM 预测的编码中重建音频,实现零样本文本到语音的转换。

核心特性

  • 简洁高效:完全基于 Qwen2.5 构建,无需流匹配(Flow Matching)等额外声学生成模型,推理流程简洁、效率高
  • 零样本语音克隆:参考音频即可高质量复刻说话人音色,适用于跨语言与语码混合(Code-Switching)场景
  • 中英双语:支持中文与英文合成,跨语言与混合语言自然流畅
  • 虚拟说话人生成:可通过调整性别、音调、语速等参数直接"创造"虚拟音色,无需参考音频
  • 轻量部署:0.5B 参数,配合 TensorRT-LLM 等可进一步加速,GPU 门槛低

适用场景

个性化语音合成、虚拟角色配音、多语言内容创作、语音助手与有声读物等。

更多信息可参考:https://github.com/SparkAudio/Spark-TTS

后羿 Hou Yi
有一种撕心裂肺的感觉,是辣椒,我加了辣椒!
刘德华 Andy Lau
所以我觉得好的技术,它一定是有温度的,能够真正服务于大家,而不是冷冰冰地摆在那里。就像现在的语音合成技术,越来越自然,越来越贴近人们的需求,这种发展是有生命力的。它就跟当年那些突破性的科技一样,一开始可能觉得很新鲜,但慢慢地,它就融入生活,变成大家离不开的一部分了。
v1.1.0 常规优化 下载
2025-10-14
v1.0.0 Mac卷积层输出通道数太大问题 下载
2025-08-21
v0.1.0 初版发布 下载
2025-03-23

初版发布

语言
QQ
微信客服
微信群
客服