科大讯飞发布 Spark-Audio-1.0-Preview:全国产算力驱动的语音基座模型
2025年3月,科大讯飞正式推出**Spark-Audio-1.0-Preview**,这是一款基于**全国产算力**训练的大规模语音基础模型。该模型支持 **99 种语言**与 **202 种方言**的语音处理能力,覆盖全球主要语种及中国绝大部分地方言,标志着我国在语音领域实现了从算法到算力的全链路自主可控。
# 技术突破:国产算力与多语言泛化
Spark-Audio-1.0-Preview 的核心亮点在于其训练完全基于国产算力平台(如华为昇腾系列芯片),摆脱了对英伟达 GPU 等进口硬件的依赖。在模型架构上,它采用了自研的**多任务统一框架**,将语音识别、合成、翻译与方言识别整合进单一模型,通过大规模多语言无监督预训练与方言特异性对齐技术,实现了对低资源语言和边缘方言的高效建模。相较于 OpenAI Whisper 等国际模型,Spark-Audio 在中文方言(如粤语、闽南语、吴语)的细粒度识别上表现尤为突出,同时将方言覆盖量提升至 202 种,填补了国内众多濒危方言的数字化空白。
# 应用场景与产业意义
从应用角度看,该模型可直接赋能智能客服、实时翻译、无障碍通讯、AI 主播等场景。例如,在政务热线中,系统可自动识别用户方言并匹配对应服务人员;在国际会议中,99 种语言的实时转写与互译将降低跨境沟通成本。更重要的是,**全国产算力**的落地验证了国产 AI 基础设施在大模型训练中的可行性,为后续更大规模的基础模型(如语音 + 多模态)提供了技术储备。未来,科大讯飞有望基于该模型推出轻量化版本,并集成至 IoT 设备与车载系统,进一步拓展语音交互的边界。
总体而言,Spark-Audio-1.0-Preview 不仅是技术能力的展示,更是我国在语音 AI 领域构建自主生态的关键一步。随着国产算力持续迭代和方言语料库的扩充,这一模型或将成为全球多语言语音处理的下一个标杆。