# 千问推出 Qwen3.8-LiveTranslate:同声传译进入“毫秒级”实时呈现时代
近日,阿里云通义千问团队正式发布 Qwen3.8-LiveTranslate 同声传译大模型。该模型最大的技术亮点在于实现了**原文与译文的同屏实时滚动展示**,并将**每字的平均翻译延迟压缩至 2.3 秒**。这一指标标志着大语言模型(LLM)在实时语音翻译场景下,从“准实时”迈向了“类人级”的同传体验。
## 核心突破:流式解码与同步显示的双重优化
传统同声传译系统通常采用“语音识别 → 文本翻译 → 语音合成”的流水线架构,各环节的累积延迟往往超过 5-10 秒,且难以做到原文与译文的逐字对齐。Qwen3.8-LiveTranslate 基于千问大模型的**端到端流式推理架构**,在编码阶段即对语音片段进行增量处理,并通过**动态注意力掩码**机制,允许模型在未收全整句的情况下就开始生成译文。其核心创新在于“同步展示”:系统不仅实时输出译文,还能在屏幕上动态高亮当前正在翻译的原文片段,让听众直观感知到翻译的进度与对应关系。2.3 秒的平均字延迟并非指整句的最终延迟,而是从语音输入到译文第一个字输出的“首字响应时间”,这一指标对于保持对话流畅性至关重要。
## 场景落地与行业影响
在会议同传、在线教育、跨国直播等高时效场景中,2.3 秒的延迟已接近专业人类同传的响应速度(通常为 2-4 秒的语言间隙)。更重要的是,**原文与译文的同屏展示**解决了同传中“信息滞后导致理解断层”的痛点——听众可以同时对照看原文,在译文出现歧义时自行纠正。此外,该模型支持**多语种混合输入**(如中英夹杂演讲)和**术语定制**,能够自动识别并翻译专业领域词汇(如金融、医疗、法律)。这一技术将大幅降低企业国际化会议的人力成本,也让小语种实时翻译成为可能。可以预见,随着千问等国产大模型在实时性上的突破,同声传译将从“稀缺专业服务”转变为“可嵌入任何终端的标配能力”。