QQ扫一扫联系
阿里达摩院开源的 SenseVoice,一个模型把语音识别、情感识别、语种识别、事件检测全包了,而且比 Whisper 快 5 倍。中文识别比 Whisper 准,粤语场景优势更明显,还能听出说话人情绪和背景声音。

SenseVoiceSmall 采用非自回归端到端架构,参数量跟 Whisper-Small 差不多,推理速度是它的 5 倍以上,是 Whisper-Large 的 15 倍。在 AISHELL-1、AISHELL-2、Wenetspeech 等中文基准上,识别准确率全面领先 Whisper。

大多数 ASR 模型只做语音转文字。SenseVoice 在一个模型里同时输出:
在不做任何目标数据微调的前提下,SenseVoice 的情感识别效果就达到了甚至超过了当前最好的专用情感识别模型。

录一段会议录音,不仅能拿到逐字稿,还能知道哪句话是开心的、哪段有人在鼓掌、背景有没有音乐。这种"富文本转录"对内容创作、客服质检、会议纪要这些场景很实用。
模型再好,部署折腾也白搭。SenseVoice 的 AIGCPanel 服务把流程简化到了几步:
支持 GPU 推理(自动检测 CUDA),没有 GPU 自动降级 CPU,机器有就行。还支持粤语、日语、韩语的自动识别,做海外内容、多语言客服场景很合适。

SenseVoice 把语音识别这件事做到了一个新高度——听得准,还能听出情绪、听出场景。如果你在做语音转写、内容审核、AI 语音助手,这个模型可以放进工具箱试试。
你在实际场景中遇到过哪些语音识别的翻车案例?是方言识别不准,还是长音频处理太慢?说不定 SenseVoice 刚好能解决你的问题。