微信视觉团队开源通用多模态嵌入模型WeMM-Embedding,日均调用量已破十亿
近日,微信视觉团队正式开源其自研的通用多模态嵌入模型 **WeMM-Embedding**,并披露该模型在微信生态内的日均调用量已突破十亿次。这一动作不仅展示了微信在基础视觉与多模态理解上的技术积淀,也为行业提供了一个高性能、低门槛的跨模态表征解决方案。
技术亮点:通用性与效率的平衡
WeMM-Embedding 的核心在于**端到端的跨模态对齐能力**。与早期基于双塔结构的CLIP模型不同,WeMM-Embedding 在训练中引入了更丰富的异构数据(图像、文本、视频帧等),并通过层级化对比学习与掩码建模,使得输出向量在语义空间中的区分度与泛化性显著提升。实测显示,在图文检索、零样本分类、标签推荐等典型任务上,WeMM-Embedding 的Recall@1指标相较于同期开源模型提升约3%-5%。更重要的是,模型通过量化蒸馏与算子优化,在保持高精度同时将推理延迟压缩至毫秒级,这为十亿级调用提供了工程保障。
应用场景:从搜索到内容理解
“日均十亿次调用”背后是微信业务生态的深度嵌入。目前,WeMM-Embedding已支撑微信内的**智能搜索、朋友圈内容理解、视频号推荐、小程序商品匹配**等数十个核心场景。例如,在“以图搜图”功能中,模型将用户上传的图片统一编码后与亿级商品图库进行向量相似度检索,时延控制在百毫秒内;在视频号推荐中,模型同时提取视频的视觉帧与音频转录文本,实现多模态融合的个性化分发。这种“训练一次、多场景复用”的通用嵌入能力,极大地降低了各业务线的算法维护成本。
开源影响:推动多模态社区发展
此次开源,微信团队不仅开放了模型的完整权重与推理代码,还提供了从数据预处理到端侧部署的完整pipeline。对于学术研究者,WeMM-Embedding可以作为多模态理解、长尾识别的强基线模型;对于中小开发者,其轻量级版本甚至可以在移动端GPU上运行。这标志着国内大厂在基础模型领域的开源策略正从“演示性开放”转向“可落地开放”。随着多模态大模型的竞争日益激烈,WeMM-Embedding所展现的**高频调用、低延迟、高通用性**特性,或将成为下一代云边端协同应用的基准范式。
展望
未来,WeMM-Embedding 有望延伸至视频理解、跨语言检索等更复杂的多模态任务。微信视觉团队透露,下一步将聚焦于**动态图嵌入与实时增量学习**,进一步降低模型对固定知识库的依赖。对于行业而言,十亿次调用不仅是工程能力的证明,更验证了通用多模态embedding在超大规模场景下的商业价值与可行性。