# 京东于JDD大会发布EchoWM:开源可交互视听世界模型,长视频生成时长突破10分钟
在近日举办的京东云开发者大会(JDD)上,京东正式发布了其自研的**可交互视听世界模型——EchoWM**。该模型同时宣布开源,并在长视频生成领域实现了**单次生成时长突破10分钟**的行业里程碑。这一发布不仅标志着京东在AI多模态领域的技术跃迁,也为视频生成从“演示级”走向“实用级”提供了关键基础设施。
## 技术突破:从“单向生成”到“可交互世界”
与当前主流视频生成模型(如OpenAI Sora、Runway Gen-3)主要聚焦于文本到视频的“单向生成”不同,EchoWM的最大差异化在于**“可交互”**与**“视听融合”**两大特征。
– **可交互性**:用户不仅可以输入文本或图像指令,还能在视频生成过程中实时调整场景元素、视角、光照甚至物理规律(如重力、风速)。这得益于EchoWM在架构中内置了**动态世界状态编码器**,将视频帧视为连续物理状态的采样,从而支持“生成中修改-重新演绎”的闭环。
– **视听世界模型**:模型同时建模视觉像素流与音频信号(包括环境音、人声、动作音效),并在潜在空间(latent space)中实现视听对齐。这解决了现有模型“先做视频、后配声音”导致的音画不同步、语义错位问题,能生成**时空一致的完整视听片段**。
## 长视频生成:10分钟意味着什么?
当前主流文生视频模型(如Sora)公开演示片段多在1分钟以内,而EchoWM首次将**单段生成时长提升至10分钟以上**。这一突破并非简单扩大算力,而是通过**分层记忆-注意力机制**,将视频划分为“短时高频动作片段”与“长时场景演化片段”,分别用不同的注意力头处理,从而避免长序列下的上下文丢失。10分钟的视频在电商场景中可覆盖一次完整的商品开箱讲解、虚拟主播带货,或为用户生成一段完整的“第一人称旅行vlog”。
## 开源策略:构建行业生态的野心
京东宣布EchoWM**核心模型权重与基础训练框架开源**,并提供面向开发者的一站式推理API。这一策略与Meta的Llama系列类似,意在快速吸引开发者基于其构建应用(如虚拟试衣间、数字人客服、智能导购剧集),从而在电商、零售、教育等垂直场景形成数据飞轮。相比闭源模型,开源降低了企业构建专属视频生成引擎的门槛,而京东可依托自身供应链数据(商品3D模型、用户行为日志)持续优化基座模型。
## 应用前景:改变“内容-交互”范式
短期内,EchoWM最直接的落地场景是**电商内容生产**:商家输入商品描述即可生成10分钟级别的沉浸式导购视频,且用户可通过语音指令调整商品颜色、场景背景。中长期来看,该模型为“可交互数字世界”提供了底层引擎——用户不仅是内容的观看者,更是世界演变的参与者。但需注意,10分钟以上的生成仍然面临计算成本高昂、幻觉控制等挑战,京东需平衡模型精度与推理效率。
京东此次发布,或将加速视频生成从“短视频工具”向“交互式世界模拟器”的演进,而开源策略则让这一演进拥有了更广泛的生态底座。