千问推出Qwen3.8-LiveTranslate:同传延迟低至2.3秒,还能保留你的音色
近日,千问团队正式发布了新一代实时语音翻译模型——Qwen3.8-LiveTranslate。该模型在端到端同声传译领域实现了关键突破:平均翻译延迟仅2.3秒,且在输出时能够完整保留原说话人的音色、语调与情感特征,这标志着AI同传从“内容准确”向“表达自然”迈出了实质性一步。
技术亮点:极低延迟与音色保留的双重突破
传统同传系统通常采用“语音识别→机器翻译→语音合成”的三段式流水线架构,每阶段都会引入不可忽视的延迟,总时延常在5秒以上。Qwen3.8-LiveTranslate基于千问自研的端到端语音翻译模型,直接对源语言语音进行语义理解并生成目标语言语音,跳过了中间文本转换环节,从而将端到端延迟压缩至2.3秒。这一数字已接近人类同传译员3秒左右的最优反应时间,使得AI同传在交互体验上具备了实用可行性。
更值得关注的是其“音色保留”能力。模型通过引入说话人嵌入向量和韵律编码器,在翻译过程中将原语音中的声纹特征、语速节奏和情感波动映射到目标语言语音中。这意味着用户听到的不再是机械的合成音,而是“本人在说另一种语言”的听觉效果。这种技术路线突破了传统TTS(文本转语音)单元选择拼接的局限,采用基于扩散模型的语音生成策略,在保持高自然度的同时降低了音色迁移的失真率。
应用前景与行业影响
从场景落地看,Qwen3.8-LiveTranslate有望在以下领域快速渗透:国际会议远程同传、跨国直播带货、海外客服本地化、语言学习辅助等。尤其对于需要高度信任感与亲切感的应用(如在线医疗咨询、商务谈判),保留原声的翻译方式能显著降低用户的心理距离感。
当然,该技术仍面临挑战:多语言间音色映射的保真度、噪声环境下的识别鲁棒性、以及长句翻译时情感延续的连贯性等,仍需更多真实场景数据的持续优化。但无论如何,Qwen3.8-LiveTranslate的出现,让“实时、自然、个性化”的AI同传从概念走向了可用,也为语音AI从“听得懂”到“说得像”的技术演进提供了重要参照。