阿里推出语音识别新型模型:医疗词汇“听中率”突破95%,持续领跑全球最低错字率
近日,阿里巴巴达摩院发布新一代语音识别模型,在医疗专业场景下的词汇“听中率”首次突破95%,同时延续了此前在通用语音识别领域保持的“全球最低错字率”纪录。这一成果标志着AI语音技术在垂直行业应用上迈出了关键一步,尤其对医疗信息化、智能问诊、电子病历生成等场景具有深远意义。
技术突破:从“通用听写”到“专业精度”
传统语音识别模型在通用场景下的字错率已降至较低水平,但面对医疗领域——包含大量罕见病名、药品名、解剖学术语及多音字、同音异义词——准确率往往骤降。阿里此次推出的模型采用**多模态预训练+领域自适应微调**架构,通过引入大规模医疗文本语料和专家标注的声学数据,构建了针对医疗词汇的“语义-声学联合解码”机制。测试显示,在涉及呼吸科、心血管科、肿瘤科等10个专科的2000余条真实语音样本中,模型对专业术语的识别准确率(听中率)达到95.2%,较此前行业主流水平提升约8个百分点。
意义解读:AI赋能医疗,破解“人机壁垒”
医疗语音识别长期以来面临两大痛点:一是医生口音、语速差异导致通用模型失效;二是专业术语的“同音歧义”问题(如“心率”与“心律”、“阿司匹林”与“阿司匹林肠溶片”)。阿里模型通过**动态发音词典**和**上下文对抗训练**,能在识别过程中实时匹配病历语境,自动修正歧义。例如,当医生说出“盐酸氨溴索”时,模型能基于患者症状(如咳嗽、痰多)自动排除“盐酸氨溴索口服液”与“盐酸氨溴索注射液”的错误候选。
行业影响与未来展望
“听中率”突破95%意味着AI辅助医疗记录的实际可用性大幅提升。据透露,该模型已在部分三甲医院试点,应用于手术语音记录、门诊实时录入等场景,将医生手动录入时间平均缩短70%。但需要指出的是,医疗场景对错误零容忍——即便1%的错字也可能导致诊断偏差。因此,阿里团队正同步推进“置信度标注+人工复核”机制,对低于95%置信度的识别结果自动标记,供医生二次确认。未来,随着多方言支持、实时纠错能力的增强,这一模型有望成为医疗数字化转型的“标准输入层”。