Hy‑MT2‑1.8B 属于腾讯混元 Hy‑MT2 翻译模型系列,整套系列面向现实复杂翻译场景开发,圈内称这套系列为 “快思考” 翻译模型。系列一共提供 1.8B、7B、30B‑A3B(MoE)三种参数规格,1.8B 版本定位轻量化端侧部署,全部权重对外开源,项目托管在 GitHub 代码仓库。模型同时放出 FP8、GGUF、1.25bit 多套量化变体,开发者下载权重文件之后,本地设备就可以直接完成运行调用,不需要绑定云端翻译接口。配套同步开放 IFMTBench 评测集,用来检验模型对翻译指令的处理能力。

Hy-MT2-1.8B特点
覆盖 33 种语言双向翻译,语种范围包含欧洲主流语言、小语种、部分少数民族语言以及粤语方言。
经过 AngelSlim 工具做 1.25bit 极限量化之后,模型文件体积压缩到 440MB,推理运行速度相比原版提升 1.5 倍,普通手机、嵌入式硬件、低配电脑都可以承载运行压力。
同参数规模下,通用文本、业务材料、专业领域内容翻译输出水准高,多组公开测试数据集的打分结果,超过不少商用翻译接口。
输入翻译相关指令,模型接收文风、术语、格式约束条件,按照给出要求产出译文。
碰到 JSON、XML、程序代码、占位标记类内容,只翻译可读文字,原有标签、键名、符号、变量占位符完整保留在输出结果。全部翻译计算流程在本地设备完成,原始文本不会向外传输。
Hy-MT2-1.8B技术原理
底层采用解码器大语言模型结构。训练阶段混合 33 门语言海量平行对照文本、行业业务素材、翻译指令样本共同完成训练,学习区分文本中哪些片段需要翻译,哪些标记、代码片段保持原样输出。
AngelSlim 量化工具对模型权重执行低位宽压缩,搭配量化感知训练,缓解压缩操作带来翻译效果下滑问题,实现模型体积缩小,推理速度提升。推理环节接收源文本与翻译指令,直接逐词生成目标语言文本,不额外接入中间翻译处理模块。
仓库完整放出训练脚本,支持全参数微调、LoRA 微调,适配 DeepSpeed ZeRO 与 LLaMA‑Factory 工具链,开发者可以基于自有业务数据继续调整模型。
Hy-MT2-1.8B项目地址
- GitHub仓库:https://github.com/Tencent-Hunyuan/Hy-MT2
Hy-MT2-1.8B功能
完成 33 种语言互相转换,短句子以及长篇幅文档都可以处理。
接收自定义翻译指令,锁定译文行文风格,指定专有名词、行业术语输出写法。
传入参考背景资料,依托背景信息调整译文表达。
处理结构化配置、代码文件,锁定原有层级、缩进格式,只转换面向用户展示的文字。
识别分隔标记,译文中维持分隔符号的数量、位置,不对符号本身翻译修改。
脱离网络环境,本地设备完成整套翻译运算。
输出适配字幕、技术文档、配置文件的译文内容。
Hy-MT2-1.8B应用场景
手机、平板、嵌入式硬件搭建离线翻译工具,断网状态下完成文本转换。
软件国际化开发流程,批量处理程序配置、接口文档,生成多语言版本文件。
内部保密业务文档、私有知识库文本翻译,文件内容不用上传第三方服务器。
视频字幕批量处理,批量生成多语言字幕文件。
桌面客户端、本地小工具内置翻译模块,不再调用外部翻译 API。
论文、合同、行业资料本地转写,方便在本机完成稿件校对工作。
学术、翻译方向实验,拿来做指令跟随翻译相关测试,搭配 IFMTBench 完成效果评估。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



