Model Download
资源下载中心
云端 离线
Funasr模型一键运行包 免费 CPU/GPU 内存 8G+ 支持50显卡
语音识别 Win-x86Linux-x86
阿里达摩院开源工业级语音识别工具包,支持 ASR/VAD/标点/说话人分离/情感识别
Win-X86v2.0.1 Linux-X86v2.0.1 OSX-ARM64v1.1.0
2026-09-05
Details Download
离线
直播模型一键运行包 SVIP 内存 32G+ GPU 8G+ 支持50显卡
智能直播 Linux-x86
数字人直播 + 语音直播 + 大模型知识库一体化方案,开箱即用
Linux-X86v1.4.0 Win-X86v1.3.0 OSX-ARM64v0.1.1
2026-09-02
Details Download
离线
SenseNova-U1.5 文生图/图生图一键运行包 免费 GPU 8G+ 内存 12G+ 支持50显卡
文生图图生图 Win-x86MacOS-AppleLinux-x86
商汤开源的 8B 原生统一多模态模型,无需 VE/VAE 即可原生 4K 文生图与图生图编辑,低显存单卡可运行。
Win-X86v1.0.0 OSX-ARM64v1.0.0 Linux-X86v1.0.0
2026-09-02
Details Download
离线
视频换口型 Win-x86Linux-x86
LatentSync1.5 是字节跳动开源的**潜扩散端到端唇形同步模型**,新增时序层优化画面连贯性,强化中文口型匹配效果,大幅降低训练显存至 20GB,消费级显卡即可实现音频驱动视频精准对口型,适配短视频配音、数字人制作场景GitHub
Win-X86v1.0.0 Linux-X86v1.0.0
2026-09-02
Details Download
云端 离线
Wav2Lip模型一键运行包 免费 GPU 4G+ 内存 8G+
视频换口型 Win-x86
经典高精度语音驱动唇同步模型,适用于任意身份、语音与语言
Win-X86v1.2.0 OSX-ARM64v1.1.0 Linux-X86v1.1.0
2026-08-24
Details Download
离线
Wav2lip384模型一键运行包(调优版) VIP/SVIP GPU 8G+ 内存 16G+
视频换口型 Win-x86MacOS-AppleLinux-x86
Wav2Lip 384 分辨率调优版,口型高精度同步,人脸区域更清晰
Win-X86v1.1.0 OSX-ARM64v1.1.0 Linux-X86v1.1.0
2026-08-22
Details Download
云端 离线
IndexTTS2模型一键运行包 免费 GPU 16G+ 内存 16G+ 支持50显卡
语音克隆 Win-x86MacOS-AppleLinux-x86
IndexTTS2 是 哔哩哔哩(B站)研发的新一代文本转语音(TTS)模型,主要在情感表达、时长控制、音色与情感解耦等方面实现突破。
Win-X86v1.2.1 OSX-ARM64v1.2.1 Linux-X86v1.2.1
2026-08-22
Details Download
离线
Heygem-v2模型一键运行包(调优版) VIP GPU 8G+ 内存 16G+ 支持50显卡
视频换口型 Win-x86
硅基智能开源数字人模型 v2,快速克隆形象与声音,超高清视频合成,精准口型匹配
Win-X86v1.1.0
2026-08-22
Details Download
离线
Qwen3TTS模型一键运行包 免费 GPU 16G+ 内存 16G+ 支持50显卡
语音合成语音克隆 Win-x86MacOS-AppleLinux-x86
Qwen3-TTS是通义千问团队开发的开源语音合成模型系列,支持多音色、多语种与多方言的语音生成。
Win-X86v1.1.0 OSX-ARM64v1.1.0 Linux-X86v1.1.0
2026-08-22
Details Download
离线
VoxCPM2模型一键运行包 免费 GPU 12G+ 内存 16G+
语音合成语音克隆 Win-x86MacOS-AppleLinux-x86
面壁智能开源 2B 语音生成模型,支持 30 种语言、创意音色设计与可控声音克隆,48kHz 高保真输出
Win-X86v1.0.0 OSX-ARM64v1.0.0 Linux-X86v1.0.0
2026-08-22
Details Download
离线
IndexTTS2.5声音克隆一键运行包 免费 GPU 8G+ 内存 16G+ 支持50显卡
语音克隆 Win-x86MacOS-AppleLinux-x86
哔哩哔哩 Index 团队开源的零样本语音克隆模型,支持中英日西阿多语言、细粒度情感与语速控制,推理速度快。
Win-X86v1.0.0 OSX-ARM64v1.0.0 Linux-X86v1.0.0
2026-08-22
Details Download
云端 离线
CosyVoice-2.0-0.5B模型一键运行包 免费 GPU 8G+ 内存 16G+ 支持50显卡
语音克隆 Win-x86
阿里开源 0.5B 流式语音合成模型,支持零样本语音克隆、指令控制与跨语种合成
Win-X86v1.2.2 OSX-ARM64v1.2.1 Linux-X86v1.2.1
2026-08-21
Details Download
云端 离线
MuseTalk模型一键运行包 免费 GPU 6G+ 内存 16G+ 支持50显卡
视频换口型 Win-x86Linux-x86
腾讯音乐开源实时高清唇同步模型,V100 上 30fps+ 实时推理,支持多语言
Win-X86v1.2.0 Linux-X86v1.2.0 OSX-ARM64v1.1.0 Win-ARM64v0.1.0
2026-08-08
Details Download
云端 离线
Heygem模型一键运行包(调优版) VIP/SVIP GPU 16G+ 内存 16G+
视频换口型 Win-x86Linux-x86
硅基智能开源数字人模型,1 秒视频或 1 张照片快速克隆,100% 口型匹配,全离线运行
Win-X86v1.1.0 Linux-X86v1.1.0
2026-07-28
Details Download
云端 离线
LatentSync模型一键运行包 免费 GPU 8G+ 内存 16G+
视频换口型 Win-x86Linux-x86
字节跳动开源端到端唇同步模型,基于潜在扩散模型,实现高精度口型对齐
Win-X86v1.1.1 Linux-X86v1.1.1 OSX-ARM64v1.1.0
2026-07-27
Details Download
离线
CosyVoice-2.0-0.5B模型一键运行包(优化版) VIP/SVIP GPU 8G+ 内存 16G+ 支持50显卡
语音克隆 Win-x86MacOS-AppleLinux-x86
阿里开源 0.5B 流式语音合成模型(长文本优化版),支持零样本语音克隆与指令控制
Win-X86v1.2.0 OSX-ARM64v1.2.0 Linux-X86v1.2.0
2026-05-26
Details Download
云端 离线
CosyVoice 3 模型一键运行包 免费 GPU 8G+ 内存 16G+
语音克隆语音合成 Win-x86MacOS-AppleLinux-x86
阿里开源 3 秒零样本语音克隆大模型,多语言多方言,情感韵律逼近真人,流式低延迟
Win-X86v1.0.0 OSX-ARM64v1.0.0 Linux-X86v1.0.0
2026-05-26
Details Download
离线
VoxCPM模型一键运行包 免费 GPU 8G+ 内存 16G+
语音合成语音克隆 Win-x86
VoxCPM 是由面壁智能联合OpenBMB开源社区与清华大学人机语音交互实验室共同开发并开源的一款语音生成模型
Win-X86v1.0.0
2026-04-22
Details Download
云端 离线
CosyVoice-300M模型一键运行包 免费 GPU 8G+ 内存 16G+ 支持50显卡
语音合成语音克隆 Win-x86MacOS-Apple
阿里开源 300M 轻量语音合成模型,支持语音合成与零样本语音克隆
Win-X86v1.1.0 OSX-ARM64v1.1.0 Win-ARM64v0.0.4
2026-04-21
Details Download
离线
MOSS-TTS-Nano模型一键运行包 免费 CPU/GPU 内存 8G+ 支持50显卡
语音克隆 Win-x86MacOS-Apple
由 MOSI.AI 与 OpenMOSS 团队联合开源的超小型语音生成模型
Win-X86v1.0.0 OSX-ARM64v1.0.0
2026-04-21
Details Download
离线
‌Spark-TTS模型一键运行包 免费 GPU 8G+ GPU 16G+
语音克隆 Win-x86MacOS-Apple
SparkAudio 开源 LLM 语音合成模型,支持零样本语音克隆与虚拟说话人生成
Win-X86v1.1.0 OSX-ARM64v1.1.0
2025-10-14
Details Download
离线
IndexTTS模型一键运行包 免费 GPU 8G+ 内存 16G+
语音克隆 Win-x86MacOS-Apple
哔哩哔哩开源工业级零样本 TTS,参考音频即可复刻音色,合成自然流畅
Win-X86v1.0.0 OSX-ARM64v1.0.0
2025-10-13
Details Download
离线
GPT-SoVITS模型一键运行包 免费 GPU 8G+ 内存 16G+
语音克隆 Win-x86MacOS-Apple
GPT-SoVITS 是一款开源语音转换与合成工具。它结合了 GPT 模型和 SoVITS 语音变换技术,支持零样本和少样本的即时文本到语音转换,只需 5 秒音频样本即可进行语音风格迁移。
Win-X86v1.0.0 OSX-ARM64v1.0.0
2025-10-10
Details Download
云端 离线
Fish Speech模型一键运行包 免费 GPU 8G+ 内存 16G+
语音克隆 Win-x86MacOS-Apple
Fish Audio 开源 SOTA 语音合成模型,支持 80+ 语言高品质语音克隆与自然语言韵律控制
Win-X86v1.0.0 OSX-ARM64v1.0.0
2025-10-09
Details Download
离线
CosyVoice-300M-Instruct模型一键运行包(优化版) VIP/SVIP GPU 8G+ 内存 16G+ 支持50显卡
语音合成语音克隆 Win-x86MacOS-Apple
阿里开源 300M 语音合成模型(长文本优化版),支持语音克隆、合成与指令控制
Win-X86v1.1.0 OSX-ARM64v1.1.0
2025-10-02
Details Download
云端 离线
CosyVoice-300M-Instruct模型一键运行包 免费 GPU 8G+ 内存 16G+ 支持50显卡
语音合成语音克隆 Win-x86MacOS-Apple
阿里开源 300M 语音合成模型,支持语音克隆、语音合成与指令控制
Win-X86v1.0.0 OSX-ARM64v1.0.0
2025-09-30
Details Download
离线
CosyVoice-300M模型一键运行包(优化版) VIP/SVIP GPU 8G+ 内存 16G+ 支持50显卡
语音合成语音克隆 Win-x86MacOS-Apple
阿里开源 300M 语音合成模型(长文优化版),支持语音合成与零样本语音克隆
Win-X86v1.1.0 OSX-ARM64v1.1.0
2025-09-25
Details Download
离线
智能直播语音克隆 Win-x86
面向直播场景的 Index-TTS 语音克隆模型,支持个性化音色实时播报
Win-X86v0.1.0
2025-06-16
Details Download
SenseVoice 语音识别一键运行包 免费 CPU/GPU 内存 8G+ 支持50显卡
语音识别
基于阿里达摩院 FunAudioLLM SenseVoice-Small 的高精度多语言语音识别,支持中文/粤语/英文/日文/韩文,内置情感识别与音频事件检测
暂未发布
Details
FlashTalk 数字人口型驱动一键运行包 免费 GPU 24G+ 内存 32G+ 支持50显卡
视频换口型
基于 SoulX-FlashTalk-14B 模型,输入人物图片和音频,生成与音频口型同步的高清说话视频,支持无限长流式生成
暂未发布
Details
SoulX-FlashHead Lite 对口型一键运行包 免费 GPU 8G+ 内存 16G+ 支持50显卡
视频换口型
基于 Soul-AILab SoulX-FlashHead Lite 1.3B 模型的高保真人像对口型视频生成,消费级 GPU 可达 96 FPS 实时推理
暂未发布
Details
LivePortrait 人像动画一键运行包 免费 GPU 8G+ 内存 16G+ 支持50显卡
视频换口型
基于快手开源 LivePortrait 模型,输入人像图片和驱动视频,生成面部动作自然、身份保持一致的动画视频,支持视频/图片双驱动模式
暂未发布
Details
SadTalker 对口型模型一键运行包 免费 GPU 4G+ 内存 8G+
视频换口型
基于 CVPR 2023 SadTalker 模型,输入人物图片和音频,生成逼真的 3D 对口型说话视频,GPU 4G+ 即可运行
暂未发布
Details
LatentSync 数字人对口型 ComfyUI工作流一键运行包 免费 GPU 8G+ 内存 16G+ 支持50显卡
ComfyUI视频换口型
基于 ByteDance LatentSync 1.5 的音频驱动对口型工作流:输入一段带人脸的说话视频 + 目标音频,输出嘴型与音频同步的视频。效果为当前开源方案最优(纯 PyTorch,支持 CUDA / MPS / CPU)。
暂未发布
Details
语音合成语音克隆
FireRedTeam 开源统一语音生成与编辑系统,支持24语言零样本克隆、指令式语音设计与自由形式语音编辑
暂未发布
Details
开源零样本歌声转换与语音转换模型,支持 F0 音高条件、自动音高对齐与实时语音转换,算法延迟约300ms
暂未发布
Details
Language
QQ
微信客服
微信群
客服