2026年9月,腾讯微信视觉团队正式宣布开源通用多模态嵌入模型WeMM-Embedding。该模型支持文本、图像多模态输入,推出2B、4B、9B三个不同参数版本适配差异化部署需求,目前已在微信搜索、推荐系统大规模落地,日调用量达十亿量级,此次开源将为全球AI开发者提供成熟技术底座,推动多模态AI在垂直场景的落地创新。

对于普通用户而言,微信搜一搜的跨模态搜图结果越来越精准、朋友圈信息流推荐的匹配度持续提升的背后,多模态理解技术早已成为支撑产品体验优化的核心底座。此次微信视觉团队对外开放的WeMM-Embedding,正是在内部打磨多年、支撑了微信生态大量核心业务的关键技术模块。
当前AI应用已经进入落地深水区,不管是检索增强生成(RAG)系统、跨模态内容搜索、个性化信息流推荐还是多模态内容风控,都需要能统一表征文本、图像等不同模态数据的嵌入模型作为底层支撑。但此前行业内的开源多模态嵌入模型大多存在两个痛点:要么缺乏大规模真实业务场景的验证,稳定性难以保证;要么参数结构单一,无法同时兼顾效果与部署成本,开发者往往需要耗费大量算力和人力做二次适配。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录