微信WeMM-Embedding已大规模应用:朋友圈搜索、视频号推荐均在使用,日调用量达10亿次

AI资讯19小时前发布 全启星小编
133 0

微信 WeMM-Embedding 大规模应用:朋友圈搜索与视频号推荐背后的技术底座

近日,微信旗下自研多模态向量化模型 **WeMM-Embedding** 正式宣布已在核心业务场景中实现大规模落地,覆盖朋友圈搜索、视频号推荐等关键功能,日均调用量突破 **10 亿次**。这一数字不仅标志着微信在 AI 特征表示层面迈入工业级应用阶段,更预示着多模态语义理解技术正从实验室走向亿级用户场景。

技术背景:从“关键词匹配”到“语义理解”的跃迁

传统搜索与推荐系统多依赖标签、关键词或协同过滤,难以捕捉用户真实意图中的模糊性、多义性及跨模态关联。WeMM-Embedding 采用 **Transformer 架构 + 对比学习** 的混合训练范式,能够将文本、图像、视频、音频等多模态信息统一映射到高维稠密向量空间,实现“语义等价”而非“字面匹配”。例如,用户在朋友圈搜索“夕阳下的背影”,系统不仅能匹配到含该关键词的文案,还能识别出配图中包含夕阳、人像剪影等视觉元素的内容。

应用场景:朋友圈搜索与视频号推荐的双轮驱动

在**朋友圈搜索**场景中,WeMM-Embedding 替代了传统的 Elasticsearch 倒排索引,使得搜索结果的相关性提升超过 30%,尤其对长尾查询、口语化表达(如“上次同学聚会那张照片”)的召回率显著改善。而在**视频号推荐**侧,该模型与用户行为序列模型协同,构建了“内容+用户”的双塔向量体系,将视频的封面、标题、背景音乐、弹幕文本等异构特征统一编码,有效缓解了冷启动问题和内容同质化。

技术挑战与行业意义

日调用量 10 亿次意味着模型需在毫秒级延迟内完成推理,同时兼顾高并发与低资源消耗。微信团队通过**模型量化(INT8)、知识蒸馏**以及**分布式向量检索引擎**(如 HNSW 图索引)将单次推理开销压缩至 0.5ms 以内。这一实践为行业提供了可复用的范式:**大规模 Embedding 系统不仅要准确,更要轻量、实时、可运维**。可以预见,随着微信生态内小程序、视频号直播、微信小店等场景的进一步打通,WeMM-Embedding 有望成为连接用户与内容的“语义高速公路”,推动社交平台从“信息流”向“意义流”进化。

相关文章