腾讯混元发布Hy ASR 3.0 preview:真正懂上下文的语音识别
比特网8月5日消息,日前,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 Preview,目前已上线腾讯云官网并对外开放API服务,可应用于智能客服、内容理解、语音搜索等场景。
与以往“只转写、不理解”的语音识别不同,这一代模型最大的标签是“能理解上下文”,它基于新一代大语言模型 Hy3的语言理解能力,将高精度语音识别与深度语义理解结合起来,让机器不仅能把声音变成文字,还能结合语境判断语义。
评测数据颇为亮眼:在开源测试集中,Hy ASR 3.0 Preview的多语种词错误率(WER)均控制在3%左右:中文普通话3.34%、英语2.62%、粤语3.12%;在自建评测集的通用语音、方言、上下文理解、专业词汇以及高噪声、耳语等复杂声学场景中,也保持了较低的词错误率。
从实际体验看,模型重点提升了四项能力:一是通用识别准确率提升,覆盖普通话、方言及中英文混说,减少错字漏字和长音频偏差;二是支持结合Context上下文理解语境,对同音词智能纠错,降低语义误判;三是支持热词注入增强,可快速识别品牌名、产品名、人名与行业术语,减少企业适配和词库维护成本;四是针对高噪声、耳语、低声说话等场景专项优化,复杂环境下仍能稳定转写。
技术层面,模型采用兼顾效率与性能的MoE架构,基座升级至Hy3;语音侧使用腾讯自研的无监督语音Encoder,以数千万小时无监督语音数据训练,并与大语言模型联合训练,覆盖多种方言、口音和声学环境。腾讯元宝深度参与共研并完成首发接入,用户长按说话即可免费体验相关能力,WorkBuddy等腾讯产品也在陆续接入。
我们认为,将大模型语义能力引入ASR,是语音识别从转写工具迈向理解助手的合理方向。免费开放有助于生态检验,实际体验仍待多场景长期观察。
来源:比特网相关阅读
- 7.3GW、192个!2024年第七批可再生能源发电补贴项目清单公布
- 格芯 GlobalFoundries 完成对芯片 IP 企业 MIPS 收购,后者仍将作为独立业务运营
- 达摩院院长张建锋:RISC-V迎来蝶变,进入应用爆发期
- 西门子2024 Realize LIVE用户大会:拥抱新质生产力,激发数智新动能
- 2024 年及以后的量子生态系统发展趋势
- AMR中国国际汽保汽配展引领中国汽车后市场可持续发展潮流
- 东芝推出全新S300 AI 监控硬盘
- TrendForce:预估今年智能手机平均存储容量将同比增长 4.8%
- 比特网早报:字节AI编程工具TRAE发布企业版,人形机器人批量上岗宁德时代
- 三星LPDDR4X通过高通汽车模组验证