WeMM-Embedding – 腾讯推出的通用多模态嵌入模型家族

WeMM-Embedding 全称 WeChat Multi-Modal Embedding,是腾讯微信视觉团队推出的通用多模态嵌入模型家族,包含 2B、4B、9B 三种参数规格,基于 Qwen3.5 原生多模态底座训练完成,整体遵循 Apache 2.0 协议开源。模型可以将文本、图片、视频、视觉文档以及交错的多模态输入,统一映射到同一个向量空间,让不同形态的内容可以直接做语义匹配。这套模型早已落地微信内部业务,支撑视频号、公众号、朋友圈、电商板块的搜索与推荐能力。

WeMM-Embedding - 腾讯推出的通用多模态嵌入模型家族

WeMM-Embedding 特点

支持多模态混合输入,文本、图片、视频、视觉化文档可以单独提交,也可以交错组合输入,统一输出同规格向量。不用为不同模态分别部署独立模型,一套模型覆盖全模态检索需求。

采用套娃式维度设计,输出向量支持从 64 维到 4096 维灵活截取。高维版本保证检索精度,低维版本压缩存储与计算开销,业务侧可以根据存储预算直接截取对应维度,无需重新运行模型。

小参数规格实现越级效果。2B 版本在多模态基准测试中得分超过主流 8B 级嵌入模型,9B 版本登顶多项权威评测榜首。同等效果下硬件要求更低,推理速度更快,部署成本更可控。

模型权重与推理代码完全开源,适配 Transformers、SentenceTransformers 等主流框架。企业可以直接下载权重做本地化部署,也可以基于自身业务数据做二次微调。

WeMM-Embedding 技术原理

底层依托原生多模态 Transformer 架构,不同模态输入共享主干网络参数,不用拆分独立的文本、图像、视频编码通路。多模态内容经过统一的令牌化处理之后,进入同一套注意力网络完成语义编码。

训练采用两阶段流程。第一阶段使用海量跨模态配对数据做全域对齐,让文本与对应图片、视频在向量空间中相互靠近,搭建基础语义地图。第二阶段使用精选的困难负样本做精细调优,加入易混淆的相似内容作为干扰项,训练模型区分细微语义差异,提升近邻排序的准确率。

嵌入向量取自模型专属嵌入令牌的最后一层隐藏状态,经过 L2 归一化处理之后输出。归一化之后向量长度统一,匹配时只看语义方向,计算余弦相似度即可得到内容的相关程度。

WeMM-Embedding项目地址

  • GitHub仓库:https://github.com/Tencent/WeMM-Embedding

WeMM-Embedding功能

多模态内容向量化,将文本、图片、视频、文档转成标准向量,存入向量数据库供后续调用。

跨模态语义检索,用文字搜索图片、视频片段,或者用图片匹配对应文本、文档,实现任意模态到任意模态的检索。

语义相似度计算,判断两段内容的语义关联程度,支撑内容推荐、相关内容匹配。

内容去重排重,通过向量相似度识别重复、高度相似的内容,过滤冗余信息。

知识库向量构建,为多模态知识库生成向量索引,支撑检索增强生成的召回环节。

维度灵活裁剪,根据业务需求截取不同长度的向量,平衡精度与资源消耗。

适配多种推理部署框架,可快速接入现有业务系统。

WeMM-Embedding应用场景

内容平台搜索推荐,支撑图文视频全域搜索、个性化内容推荐,提升召回精准度。

电商商品检索,支持以图搜货、文字搜商品图片、视频款商品匹配,优化用户查找体验。

企业多模态知识库,构建包含文档、图片、视频的统一向量知识库,提升内部资料检索效率。

内容审核与去重,批量识别重复素材、违规相似内容,降低人工审核成本。

智能体记忆模块,将多轮交互的图文内容转成向量存储,实现长期记忆与快速召回。

数字资产管理,对海量图片、视频、文档素材做语义分类与标签化,方便素材调取。

本地化边缘场景部署,在端侧与边缘节点运行轻量版本,完成本地内容检索与匹配。

WeMM-Embedding同类产品对比

表格

对比维度WeMM‑EmbeddingQwen3‑VL‑Embedding‑2B
研发主体腾讯微信视觉团队阿里通义千问
支持模态文本、图片、视频、视觉文档、交错多模态输入,支持 MRL 可变向量维度输出文本、图片、视频多模态输入,固定输出向量维度
核心特色多模态统一向量空间,视频与图文文档检索表现突出,2B 小参数版本性能优异,Apache‑2.0 开源协议开源轻量化多模态向量模型,中文适配好,生态工具链完善,部署简单
适用场景多模态 RAG、视频检索、图文混排文档检索、内容推荐、私有化向量业务部署轻量多模态检索、本地知识库、图片文本跨模态搜索、中小型业务向量服务
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...