微信开源多模态大模型 WeMM-Embedding:日调用量破10亿,领跑国际权威榜单
近日,微信正式开源其自主研发的多模态大模型 **WeMM-Embedding**,并宣布该模型的每日调用量已突破 **10亿次**,同时在多个国际权威榜单(如 MSCOCO、Flickr30K、Zero-shot 检索等)上实现全面领跑。这一成果标志着微信在多模态基础模型领域的技术积累已进入规模化落地阶段,也为业界提供了一个兼顾性能与效率的开放范式。
技术亮点:统一多模态语义空间
WeMM-Embedding 的核心创新在于构建了 **图像与文本的统一嵌入空间**。通过采用跨模态对比学习与掩码建模相结合的预训练策略,模型能够将图片、文本乃至部分结构化数据映射到同一语义向量空间中,实现精准的跨模态检索与匹配。相比开源社区主流的 CLIP、SigLIP 等模型,WeMM-Embedding 在低资源场景下的泛化能力提升约 8%-12%,尤其在小样本和零样本任务上表现突出。其开源版本包含 Base 和 Large 两个规格,支持 PyTorch 与 TensorFlow 框架,极大降低了开发者的接入门槛。
应用落地:支撑微信生态亿级场景
每日 10 亿次的调用量并非偶然。WeMM-Embedding 已深度嵌入微信内部多项核心业务:**朋友圈内容推荐**(通过图片-文本匹配提升推荐多样性)、**搜一搜多模态搜索**(支持“以图搜图”和“图文混合查询”)、**小程序商品标题自动生成**等。据微信团队透露,该模型推动相关场景的点击率平均提升 15%,召回率提升 20% 以上。开源的版本与内部生产版本保持同源预训练权重,开发者可直接用于自身多模态检索、图像描述生成或图文排序任务。
行业意义:开源加速多模态生态进化
微信选择此时开源 WeMM-Embedding,其战略意图清晰:通过开放基础模型,吸引更多开发者和企业参与多模态应用创新,同时借助社区反馈反哺模型迭代。在国际权威榜单上,WeMM-Embedding 在 Recall@1、Recall@5 等核心指标上超越 OpenAI CLIP 和 Google ALIGN,验证了中国团队在多模态基础模型领域的技术竞争力。可以预见,这一开源举措将推动电商、内容平台、智能客服等领域的多模态应用进入“低成本、高精度”的新阶段,并可能引发新一轮的嵌入模型竞赛。
总结
WeMM-Embedding 的发布与开源,不仅是微信在 AI 基础设施上的一次重要投入,更标志着多模态大模型从实验室走向大规模生产环境的成熟。当每日调用量突破 10 亿次,技术领先转化为生态优势,多模态嵌入的未来正变得更加开放、高效且触手可及。