Seed-VC 是开源社区(Plachta)开发的零样本歌声转换与语音转换模型,支持将源歌唱音频的音色转换为参考音色的歌声,同时保留原歌声的旋律与节奏,并支持实时语音转换,算法延迟约 300ms。
核心特性
-
零样本歌声转换:无需任何训练,仅需 1~30 秒参考音频即可克隆目标音色,支持 F0 音高条件控制,保留原唱歌的旋律和音高走向
-
实时语音转换:支持约 300ms 算法延迟的实时变声,配合 VAD 模型避免静音段杂音输出,适用于在线会议、游戏和直播场景
-
多版本模型选择:提供 V1 系列(25M~200M 参数,涵盖实时/离线/歌声转换)和 V2 系列(ASTRAL 量化 + CFM + AR 架构,更好的源说话人特征抑制),用户可根据硬件条件灵活选择
-
低门槛微调:支持自定义数据快速微调,每位说话人仅需至少 1 条语音,最低 100 步即可完成训练(T4 上约 2 分钟),大幅提升特定说话人相似度
适用场景
歌声翻唱与音色转换、实时语音变声与直播互动、语音内容后期制作、游戏角色配音
更多信息可参考:https://plachtaa.github.io/seed-vc/