模型市场 CosyVoice 3 模型一键运行包
云端 离线 免费 语音克隆语音合成 GPU 8G+GPU 12G+
支持系统 Win-x86MacOS-AppleLinux-x86
免费 该资源免费,可直接下载使用

CosyVoice 3 是阿里通义实验室(FunAudioLLM)于 2025 年推出的第三代语音合成大模型,在内容一致性、说话人相似度与韵律自然度上全面超越前代,是当前开源 TTS 的标杆之作。

核心特性

  • 3 秒零样本声音克隆:仅需 3 秒参考音频即可高度还原真人音色,逼真到难辨真伪
  • 多语言 + 多方言:支持中文、英文、日文、韩文、德文、西文、法文、意文、俄文 9 种常见语言,以及四川话、粤语、闽南语等 18+ 中文方言
  • 跨语种生成:支持跨语种/多语种零样本语音克隆,同一音色可说多国语言
  • 情感与韵律自然:语音自然度、情感韵律接近真人,听感自然流畅
  • 发音修复(Inpainting):支持拼音与 CMU 音素级发音修复,可精确控制字词发音
  • 智能文本规范化:无需传统前端即可正确朗读数字、特殊符号与多种文本格式
  • 双流式低延迟:文本流 + 音频流同时生成,首包延迟低至 150ms
  • 指令控制:支持语言、方言、情感、语速、音量等多种自然语言指令

适用场景

有声书与小说配音、数字人直播、影视解说、多语言内容出海、实时语音交互等。

更多信息可参考:https://funaudiollm.github.io/cosyvoice3/

v1.0.0 初版发布 下载
2026-05-26
语言
QQ
微信客服
微信群
客服