阿里千问推出 Qwen-Audio-3.1:五款语音模型齐发,ASR 价格骤降 95%

阿里千问推出 Qwen-Audio-3.1:五款语音模型齐发,ASR 价格骤降 95%

近日,阿里云通义千问团队正式发布 Qwen-Audio-3.1 系列语音模型,一次性推出五款覆盖不同场景与算力需求的模型版本,并同步大幅下调自动语音识别(ASR)服务价格,降幅高达 95%。这一动作不仅标志着阿里在语音 AI 领域的技术突破进入量产阶段,更可能引发 ASR 行业定价体系的深层变革。

五款模型覆盖全场景,精准匹配多样化需求

Qwen-Audio-3.1 系列并非单一模型升级,而是面向终端部署、云端推理、多语言处理等不同场景的矩阵式产品。据了解,五款模型从轻量级(如 0.5B 参数级别)到高精度大参数量(如 14B 级别)均有覆盖。其中,轻量版本专为手机、IoT 设备等边缘端设计,可在低功耗下实现实时语音转写;而大参数量版本则聚焦金融、医疗等高精度场景,支持多语种方言混合识别,并强化了噪声环境下的鲁棒性。此外,系列中还包括针对直播、会议等流式场景优化的实时版模型,以及集成情感识别、说话人分离的增强版模型。这种“全栈式”产品布局,使得不同规模的企业均可找到匹配自身预算与性能需求的方案。

技术突破驱动成本骤降,ASR 市场格局或迎变局

价格骤降 95% 绝非单纯的营销策略,背后是阿里在模型压缩与推理优化上的系统性突破。据官方信息,Qwen-Audio-3.1 系列采用了改进的 Whisper 架构,结合自蒸馏、混合精度量化及 Flash Attention 加速技术,使得相同精度下的推理成本相比前代下降一个数量级。更关键的是,团队通过大规模并行训练与数据增强,在减少模型参数量的同时保持了 WER(词错误率)的行业领先水平。这意味着,以往动辄每千小时数百元的 ASR 服务,如今可能降至几十元级别,直接将语音识别从“奢侈品”变为“日用品”。

行业影响:从“可用”到“用好”的拐点

ASR 价格的断崖式下跌,将显著加速语音 AI 在中小企业中的渗透。过去,高昂的 API 调用成本是智能客服、语音笔记、会议转写等应用规模化落地的核心障碍;如今,阿里将价格打到“平民级”,有望催生一批新场景,例如短视频字幕自动生成、在线教育实时互动、医疗听写助手等。同时,对以百度、科大讯飞为代表的既有 ASR 服务商构成直接竞争压力,行业可能迎来一轮价格战与技术迭代竞赛。然而,降价不等于牺牲质量——阿里同时承诺在学中文、英语、粤语、四川话等主要语种上保持 WER 在 5% 以内,这一平衡能力才是此次发布真正的技术硬核。

未来,随着多模态大模型与语音能力的深度融合,ASR 或将不再是一个独立收费的服务,而是成为通义千问整套 AI 平台的基础能力组件。Qwen-Audio-3.1 的推出,表明阿里希望率先从这个角度重构市场认知——语音识别越便宜,其之上的智能应用生态才越有价值。对于开发者与行业用户而言,现在或许是拥抱语音 AI 的最佳时机。

相关文章