WeLM – 腾讯微信AI团队独立自研的大语言模型系列

WeLM是腾讯微信AI团队独立自研的大语言模型系列,从2022年10月首次发布至今已迭代四代,当前支撑微信原生AI助手”小微”的核心技术底座。与追求通用榜单天花板的开源大模型不同,适配微信生态、服务十亿级用户高频调用场景的国民级AI基础设施,所有技术选择都围绕”生态适配”与”资源效率”展开,在成本、延迟、上下文适配等维度做了针对性优化。

WeLM - 腾讯微信AI团队独立自研的大语言模型系列

WeLM核心特点

  • 极致的资源利用效率:采用高度稀疏的MoE(混合专家)架构,当前已部署的WeLM-80B总参数800亿,每次推理仅激活约30亿参数;正在开发的WeLM-617B总参数6170亿,激活参数230亿。通过单次推理仅激活部分专家的设计,将计算量控制在可服务十亿级用户的区间,配合KV-Mirror、分组查询注意力、多Token预测等结构优化,进一步压缩单轮推理成本。
  • 128K超长上下文窗口:针对微信场景原生适配,可一次性容纳聊天记录、收藏内容、浏览轨迹等多维度长文本信息(约9-10万字),支撑群聊总结、长文档分析、跨会话记忆等场景,无需用户频繁上传文件补充上下文。
  • 多模型协同的务实策略:采用”自研为主、外部补充”的架构,日常交互、生态内场景调度由WeLM主导,保证成本与效率;部分回答会调用DeepSeek等开源模型进行补充处理,平衡能力与成本。
  • 中文能力突出:2022年发布的10B版本已在14项中文NLP任务上超越同规模模型,零样本场景下性能匹敌参数量25倍的大模型。经过多代迭代后,中文理解、生成、多语言切换能力持续强化。
  • 与微信生态深度绑定:区别于通用大模型,WeLM原生适配微信的小程序、原生功能、社交关系链等生态组件,可直接调用生态内的服务完成用户指令,是微信AI能力的核心载体。
  • 低延迟即时响应:微信内的AI交互全是碎片化的即时需求,用户耐心只有几百毫秒。WeLM通过Hidden Decoding等技术将复杂推理过程全部放在模型内部完成,不在用户端展示冗长的生成过程,实测中几乎做到秒回。

WeLM技术原理

WeLM的技术演进分为两个阶段,从早期的稠密自回归模型升级到当前的稀疏MoE架构,同时持续迭代推理优化技术。

早期阶段(2022年V1版本)

初代WeLM采用和GPT-3一致的自回归解码器结构,使用RoPE相对位置编码提升长文本处理能力,搭配62k token的SentencePiece词表保留空格和Tab以适配下游任务。训练数据从10TB原始语料中经过去噪、去重、去评测数据等多重清洗后保留262B tokens高质量内容,在128张A100上训练24天,训练量与1750亿参数的GPT-3相当。同时通过multi-prompted training(多提示词微调)技术,让模型学会应对多样化指令,大幅提升零样本任务迁移能力。

当前阶段(V4及后续版本)

全面转向MoE架构,采用loss-free balance routing、未归一化sigmoid gate搭配共享专家的设计,网络结构借鉴Qwen系列做得更深。WeLM-80B在不到14T tokens的语料上训练完成,性能在同量级乃至更大规模系统中极具竞争力;再通过深度扩展(Depth Up-Scaling)做出130B变体,少量追加训练即可显著提升性能。

2026年7月14日,WeLM团队正式发布了Hidden Decoding at Scale技术创新,在100B+MoE规模上跑通了隐式序列推理能力:将一个token在序列维度上扩展成多个stream(隐藏计算流),通过标准因果注意力送入同一个Transformer,仅在最后一个流上计算预测损失,不需要新增任何主干参数。配合Stream-Factorized Attention(流分解注意力)技术,让大多数层只在同一条流内部做注意力,仅少数层做跨流混合,解决了序列扩展带来的注意力计算平方级膨胀问题。结果是80B模型的训练成本仅上涨5.1倍,617B模型仅上涨4.4倍,远低于朴素实现下16倍的理论开销,在不动参数的前提下,把额外算力藏进序列本身,让模型在输出前先在内部多走几步推理,提升复杂任务的处理能力。


WeLM主要功能

WeLM-80B(已部署于小微)

  • 聊天与搜索:支持多轮对话、内容搜索、中文文本生成、多语言理解与翻译、逻辑推理、数学解题,可处理128K以内的长文本内容。
  • 微信原生功能调用:可直接操作用户的微信功能,包括发送消息、调整设置、拨打电话、管理朋友圈、总结聊天内容、解析和生成图片、整理收藏夹信息等。执行发送消息等操作时会进行二次确认,转账需用户手动输入密码。
  • 小程序服务调度:可智能识别用户需求,自动调用对应的小程序完成服务,比如点外卖、打车、订酒店、挂号、充话费等,用户仅需确认最终操作即可。美团、京东、携程、得物、滴滴等平台已宣布接入微信AI生态。

WeLM-617B(开发中)

  • 智能小程序开发:面向微信生态内的复杂任务,支持用自然语言描述需求,自动生成形态完整的轻量应用,如碎片笔记、文案生成器、亲戚关系计算器、BMI健康助手等。
  • 小微工具生成:在保持适度激活参数的前提下,显著提升通用理解与逻辑推理能力,面向更复杂的微信生态任务。

WeLM应用场景

  • 国民级AI助手底座:作为微信原生AI助手”小微”的核心模型,服务14.39亿月活用户(2026年Q2财报数据)的日常碎片化需求,包括内容问答、信息整理、服务调度等,成为微信生态内的基础能力组件。腾讯总裁刘炽平在2026年Q2财报电话会议上透露,未来每个用户都将拥有专属智能体,智能体之间可以相互通信并完成交易。
  • 小程序生态重构:推动小程序从独立应用转变为可被AI直接调用的”技能”,用户无需主动搜索小程序,通过自然语言指令即可完成服务调用。小程序正在从”人找服务”升级为”AI找人、AI办事”,为开发者提供新的流量分发渠道——未来开发者关注的重点将从停留时长、页面PV转向调用次数和任务完成率。
  • 个人效率提升:帮助用户完成群聊重点总结、长文档信息提取、公众号/视频号内容分析、朋友圈”AI帮写”、收藏内容整理等日常效率任务,降低信息处理成本。
  • 生活服务自动化:覆盖外卖、出行、酒旅、医疗挂号等高频生活服务场景,简化传统需要多步点击的操作流程,实现”一句话完成服务”的体验。
  • 智能开发辅助:正在开发的617B版本面向微信生态内的复杂任务,可支持智能小程序开发、小微工具生成等场景,进一步降低应用开发门槛,推动用户和AI共同创造微信生态内容。

最后想说

WeLM的发布标志着微信正式将AI从”功能”升级为”操作系统级能力”。在腾讯内部,WeLM与混元大模型形成双轨并行格局——混元定位集团级通用基础模型,争取进入行业第一梯队;WeLM定位微信生态专用模型,专注场景适配与成本效率。高盛分析师在研报中指出,双轨并行虽然有效率损耗,但也保留了业务侧的灵活性,长期生态红利足以覆盖短期的重复建设成本。

在外部竞争中,微信小微的直接对手是字节系的豆包(超3亿用户),同时与阿里千问、百度文心等形成AI入口之争。微信的核心壁垒在于14.39亿月活(2026年Q2财报数据)和深度嵌入的社交、支付、小程序生态,这是任何独立AI应用都无法复制的上下文优势。

© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...