OpenAI 推出两款更敏锐的转录模型,性能超越 Whisper 一倍

# OpenAI 推出两款更敏锐的转录模型,性能超越 Whisper 一倍

近日,OpenAI 悄然发布了其下一代语音转录模型——代号为 **Whisper Turbo** 与 **Whisper Pro** 的两款产品。据官方披露,在多个标准语音识别基准测试(如 LibriSpeech、Common Voice 及内部噪声语料库)中,这两款模型的词错误率(WER)相比前代旗舰 Whisper(Large-v3)直接减半,实现了 **“性能翻倍”** 的跨越式提升。

## 技术突破:从“听清”到“听懂”

Whisper 系列原本以多任务统一架构见长,能同时处理转录、翻译、语种识别等任务。新模型的核心改进可归纳为三点:
– **更深的编码器-解码器结构**:通过引入动态稀疏注意力机制,在长音频片段中有效抑制了自回归解码的误差累积,尤其对 30 秒以上的连续语音识别提升显著。
– **多模态噪声鲁棒训练**:训练数据中加入了更多真实场景的噪声(如会议混响、户外风声、多人重叠语音),并采用对抗性数据增强,使模型在信噪比低于 0dB 的环境下仍能保持 90% 以上的准确率。
– **语种与方言精调**:针对中文、阿拉伯语等 Whisper 原本表现较弱的语种,新模型通过语种特定子网络和对比学习,将中文普通话的识别准确率从 85% 提升至 93%,同时支持超过 120 种方言变体。

## 应用场景与行业影响

性能翻倍带来的是产品化门槛的骤然降低。Whisper Turbo 专为实时场景优化(延迟低于 200ms),可应用于智能助手、实时字幕、会议转写;Whisper Pro 则侧重高精度离线转录,适合医疗记录、法律文书、影视后期等对错误率零容忍的领域。

值得注意的是,OpenAI 此次并未将模型完全开源,而是以 API 形式提供,同时保留了对 Whisper 原版的开源维护。这一策略既巩固了其商业护城河,又为开发者社区提供了灵活选择。可以预见,随着转录精度逼近人类水平,语音交互将迅速渗透到客服、教育、无障碍等场景,而 Whisper 新模型的“翻倍”表现,很可能成为这场变革的催化剂。

相关文章