
腾讯混元近日正式推出语音识别模型Hy ASR3.0preview,该模型依托最新一代大语言模型Hy3的强大语义理解能力,将高精度语音转写与深度语境理解融为一体。官方称,这一升级标志着其语音识别技术从“逐字转写、单点优化”进化到了“理解语境、兼容场景、一键直出”的新阶段,在通用识别、方言覆盖、高噪及耳语等复杂声学环境中的表现均有显著提升,尤其对长音频中错误累积的老问题进行了针对性优化。
在公开评测数据上,Hy ASR3.0preview交出了亮眼成绩:在海外开源评测集中,中文普通话词错误率低至3.34%,英语为2.62%,粤语为3.12%,多个语种均控制在3%上下。在腾讯自建的评测集内,无论是通用识别、方言识别、上下文理解、专有名词识别,还是高噪声、轻声耳语等复杂场景,该模型同样保持较低的词错误率,综合评测集上斩获最低错词率,显示出扎实的技术底座和广泛的场景适应性。
从实际用户体验来看,这一版本着重打磨了四方面能力。一是通用识别更加精准,在方言、中英混说等复杂语音输入中有效减少了错字和漏字。二是模型具备了更强的意图理解能力,能结合上下文智能纠正同音词并消弭语义歧义,让转写结果更贴近用户本意。三是针对专业场景提供热词注入增强功能,可快速识别品牌名、产品名、行业术语等专有词汇,大幅降低了企业接入和后续维护的成本。此外,模型在嘈杂环境和轻语场景下的鲁棒性提升,也为会议记录、智能客服、车载语音等现实应用场景带来了更可靠的使用体验。腾讯混元此番动作,再次证明了大模型技术对语音识别底层能力的全面重塑,而3%左右的词错误率水平,也意味着AI“听懂人话”正在从理想走向日常。
原创文章,作者:校草,如若转载,请注明出处:https://www.kejixun.co/article/759087.html