腾讯混元发布并开源新一代大语言模型Hy4 preview。总参数770B,每个token激活49B,上下文窗口突破100万Token。
更让人意外的是,Hy4 preview在自身研发过程中首次参与了训练方法、数据策略、评估体系和底层算子的自动优化,跑出了一个初步的”递归自我改进”闭环——模型自己给自己提速,端到端推理吞吐较基线提升了31.8%。

Hy4 preview特点
生产力导向,不是通用聊天玩具。 Hy4 preview从训练数据构建阶段就和腾讯内部的软件工程师、游戏开发者、金融分析师、安全专家深度绑定,用真实业务场景的高质量数据做共建。它不是在通用语料上”泛学”一通然后指望什么都能干,而是从源头就瞄准了”帮人干活”这个目标。
MoE稀疏激活,大参数不等于高成本。 770B的总参数听起来吓人,但每次推理只激活49B,不到总量的7%。这意味着它的实际推理开销远低于同等参数的稠密模型,在生产力场景下的高频调用中,算力账单不会失控。
百万级上下文,吃下整个代码仓库。 100万Token的窗口意味着可以一次性塞进一份完整的年报、一个中型项目的全部代码、或者几十篇关联论文,在全文范围内做理解和推理,不用来回切割拼接。
开源+普惠定价,降低试错门槛。 模型权重在HuggingFace、ModelScope、GitCode、CNB同步开源,提供FP8量化版本。API定价输入6元/百万tokens、输出18元/百万tokens、缓存命中0.3元/百万tokens,WorkBuddy和CodeBuddy还开了两周限时免费。
已知问题透明公开。 腾讯直接列出了模型的短板:复杂任务存在长思考和过度自我验证倾向,预训练和后训练仍有较大提升空间。这种”自曝其短”的做法在行业里不多见,也说明preview阶段的定位就是拿真实反馈来补短板,而不是包装成完美产品去卖。
Hy4 preview技术原理
Hy4 preview的架构和训练策略有几个值得拆开看的设计选择。
MoE架构:256个专家只激活8个
主干共78层,第一层采用标准FFN,其余77层均为MoE结构。每层包含256个路由专家和1个共享专家,每个token只激活top-8路由专家加共享专家。共享专家始终参与计算,负责捕获通用语言模式;路由专家按需激活,负责处理特定类型的输入。这种设计让模型在保持巨大参数容量的把单次推理的计算量控制在49B激活参数的水平上。
MTP投机解码:用10B小模型给大模型“加速”
主干之外原生内置1层MTP(Multi-Token Prediction),总参数10B,激活0.7B。它的工作方式是用小模型快速”猜”出接下来几个token,再让大模型一次性验证,猜对了就直接采纳,猜错了再回退重算。由于自然语言的冗余度很高,小模型的猜测命中率通常不低,实测能显著拉高推理速度,尤其在高并发场景下收益明显。
递归自我改进:模型优化自己的推理引擎
这是Hy4 preview最有话题性的技术点。模型在研发过程中首次全程参与了自身的优化流程——自主分析推理系统的性能瓶颈,围绕算子融合、通信优化等方向提出改进方案,运行实验并根据结果继续迭代。实验产生的代码、日志和反馈进入下一轮探索,形成闭环。最终结果是端到端推理吞吐较基线提升31.8%,在不同上下文长度和并发度下均取得稳定收益。
这还不是”模型自己训练自己”那种科幻叙事,而是在推理基础设施层面——算子怎么融合、通信怎么调度——让模型参与分析和优化。但即便如此,这已经是业界首次在旗舰模型的研发流程中跑通这种闭环,信号意义大于当前收益。
数据共建:从业务场景反向喂养模型
腾讯让混元团队和内部各业务线的顶尖专家联合构建训练数据。软件工程师提供真实的代码审查、调试、重构样本;游戏开发者提供引擎操作和项目迭代的交互数据;金融分析师提供财报解读、估值建模的分析链路;安全专家提供漏洞分析和合规审查的案例。这些数据的共同特征是”过程完整”——不是只给最终答案,而是保留了思考路径、试错过程和中间产物,让模型学到的不只是”输出什么”,还有”怎么想到这个输出的”。
Hy4 preview项目地址
- 项目官网:https://hy.tencent.com/research/hy4-preview
- GitHub仓库:https://github.com/Tencent-Hunyuan/Hy4-preview
Hy4 preview功能
软件工程
增强长程开发任务的理解、规划、调试与验证能力。具体来说,模型可以从零搭建Three.js微缩小镇等复杂前端项目,在理解需求后自主拆解任务、编写代码、调试运行、验证结果,前端页面的视觉审美和交互质量也有提升。对开发者来说,它不只是”写代码的”,更接近一个能独立跑通开发流程的初级工程师。
办公分析
复杂办公环境理解和金融分析能力显著增强。模型能处理跨文件的数据关联、多维分析,并完成从信息提取到文档、表格、演示文稿交付的完整流程。比如面对多份财报和研报,它能自动筛选关键数据、完成财务稽核、生成分析报告,不用人工在Excel和PPT之间来回搬运。
游戏开发
一句话需求直接生成可玩原型。开发者描述一个游戏概念,模型能生成可运行的原型,并熟练操作Unity等主流游戏引擎,通过多轮交互持续完善复杂项目。从”想法”到”可玩Demo”的链路被大幅压缩,独立游戏开发者和小型工作室可以用它快速验证创意。
科学研究
复杂科研问题的理解、推理与求解能力大幅提升。在AI研发、分子动力学模拟、凝聚态物理、基础数学等场景中均有突破。配合科研智能体Hyra,Hy4 preview在百年经典几何难题——三维Blaschke–Lebosgue问题上取得重大进展,将体积下界从0.380799推进至0.41104.距离Meissner四面体猜想给出的0.41986仅剩约2%的差距。
长文档处理
100万Token的上下文窗口让模型可以一次性处理超长文档。完整的年报、大规模代码仓库、几十篇关联论文,都可以在单次对话中喂入,模型在全文范围内做信息检索、交叉验证和综合分析,不用人工切割分段。
Hy4 preview应用场景
软件开发团队
日常编码、代码审查、Bug调试、项目架构设计。Hy4 preview的长程任务理解能力让它能跟上复杂项目的上下文,不是”写完一段就忘”的单轮工具,而是能在多轮交互中持续追踪项目状态的开发伙伴。CodeBuddy已同步接入。
金融投研与财务分析
财报解读、估值建模、行业对比分析、财务稽核。模型能跨多份文件提取数据、完成计算、生成格式规范的报告,把分析师从数据搬运和格式调整中解放出来,把精力集中在判断和决策上。
游戏独立开发者与小型工作室
从概念到可玩原型的快速验证。一句话描述游戏创意,模型生成初始Demo,开发者在此基础上通过多轮对话迭代完善。对于资源有限但创意丰富的小团队来说,这等于多了一个能动手干活的美术+程序。
科研机构与高校实验室
分子动力学模拟参数配置、凝聚态物理论证推导、基础数学问题求解。Hy4 preview配合Hyra在Blaschke–Lebosgue问题上的突破已经证明了它在前沿科研中的实际价值,适合需要大量文献阅读和数学推理的研究场景。
企业办公与知识管理
跨部门文档协作、会议纪要生成、内部知识库问答。WorkBuddy已同步接入Hy4 preview,2026年第二季度该平台以2097万次PC端月访问量排名国内办公智能体平台第一。对于需要处理大量内部文档、报告和数据的企业用户,百万级上下文窗口意味着可以一次性消化整个项目档案。
安全与合规审查
漏洞分析、代码安全审计、合规文档检查。腾讯安全专家参与数据共建,让模型在安全场景下的输出更贴合实际业务需求,适合需要高频安全扫描的开发团队和合规部门。
关于Hy4 preview想说的
它把大模型的竞争维度从参数规模拉到了真实生产力上。770B参数、100万上下文这些数字只是基础设施,真正有意思的是腾讯把模型和自家产品线(WorkBuddy、CodeBuddy、元宝、ima)深度绑定,用内部专家数据做定向强化,让模型在软件工程、办公分析、游戏开发、科学研究四个方向上都能”干活”而不是”聊天”。
递归自我改进的尝试也很有信号意义。虽然目前还只停留在推理基础设施优化的层面,离”模型自己训练自己”还有很远的距离,但这至少证明了大模型可以在自身研发流程中扮演实质性角色,而不只是被研究的对象。
局限也很明确:腾讯自己承认这是早期版本,复杂任务存在过度自我验证倾向,训练仍有较大提升空间。770B参数的部署门槛对中小团队来说依然不低,FP8量化版本虽然降低了门槛,但完整精度的私有化部署仍然需要相当规模的算力。不过从preview的定位来看,腾讯要的就是这个阶段的真实反馈——用开源换数据,用低价换生态,等正式版出来时,模型已经在真实场景里跑过几轮了。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



