Echo

关注TA

大家好，我是Echo！

该文章投稿至Nemo社区资讯板块复制链接

直接开源，阿里达摩院公布下一代工业级语音识别模型

发布于 2022/12/22 14:55 236浏览 0回复 421字

IT之家 12 月 22 日消息，阿里巴巴达摩院今日发布了新一代语音识别模型 Paraformer，适用于语音输入法、智能客服、车载导航、会议纪要等场景。

阿里巴巴

据介绍，这是业界首个应用落地的非自回归端到端语音识别模型，在推理效率上最高可较传统模型提升 10 倍，且识别准确率在多个权威数据集上名列第一。目前，该模型于魔搭社区面向全社会开源。

数据显示，配合 GPU 推理，不同版本的 Paraformer 可将推理效率提升 5-10 倍。同时，Paraformer 使用了 6 倍下采样的低帧率建模方案，可将计算量降低近 6 倍，支持大模型的高效推理。

IT之家了解到，阿里达摩院方面表示，Paraformer 是阿里巴巴研发的下一代“杀手锏”级别的语音识别基础模型，未来将广泛应用于会议纪要产品“听悟”、钉钉语音转文字、高德导航等场景。

点了个评