Hy-MT2-1.8B – 腾讯混元端侧离线翻译模型详解

Hy‑MT2‑1.8B 属于腾讯混元 Hy‑MT2 翻译模型系列,整套系列面向现实复杂翻译场景开发,圈内称这套系列为 “快思考” 翻译模型。系列一共提供 1.8B、7B、30B‑A3B(MoE)三种参数规格,1.8B 版本定位轻量化端侧部署,全部权重对外开源,项目托管在 GitHub 代码仓库。模型同时放出 FP8、GGUF、1.25bit 多套量化变体,开发者下载权重文件之后,本地设备就可以直接完成运行调用,不需要绑定云端翻译接口。配套同步开放 IFMTBench 评测集,用来检验模型对翻译指令的处理能力。

Hy-MT2-1.8B - 腾讯混元端侧离线翻译模型详解

Hy-MT2-1.8B特点

覆盖 33 种语言双向翻译,语种范围包含欧洲主流语言、小语种、部分少数民族语言以及粤语方言。

经过 AngelSlim 工具做 1.25bit 极限量化之后,模型文件体积压缩到 440MB,推理运行速度相比原版提升 1.5 倍,普通手机、嵌入式硬件、低配电脑都可以承载运行压力。

同参数规模下,通用文本、业务材料、专业领域内容翻译输出水准高,多组公开测试数据集的打分结果,超过不少商用翻译接口。

输入翻译相关指令,模型接收文风、术语、格式约束条件,按照给出要求产出译文。

碰到 JSON、XML、程序代码、占位标记类内容,只翻译可读文字,原有标签、键名、符号、变量占位符完整保留在输出结果。全部翻译计算流程在本地设备完成,原始文本不会向外传输。

Hy-MT2-1.8B技术原理

底层采用解码器大语言模型结构。训练阶段混合 33 门语言海量平行对照文本、行业业务素材、翻译指令样本共同完成训练,学习区分文本中哪些片段需要翻译,哪些标记、代码片段保持原样输出。

AngelSlim 量化工具对模型权重执行低位宽压缩,搭配量化感知训练,缓解压缩操作带来翻译效果下滑问题,实现模型体积缩小,推理速度提升。推理环节接收源文本与翻译指令,直接逐词生成目标语言文本,不额外接入中间翻译处理模块。

仓库完整放出训练脚本,支持全参数微调、LoRA 微调,适配 DeepSpeed ZeRO 与 LLaMA‑Factory 工具链,开发者可以基于自有业务数据继续调整模型。

Hy-MT2-1.8B项目地址

  • GitHub仓库:https://github.com/Tencent-Hunyuan/Hy-MT2

Hy-MT2-1.8B功能

完成 33 种语言互相转换,短句子以及长篇幅文档都可以处理。

接收自定义翻译指令,锁定译文行文风格,指定专有名词、行业术语输出写法。

传入参考背景资料,依托背景信息调整译文表达。

处理结构化配置、代码文件,锁定原有层级、缩进格式,只转换面向用户展示的文字。

识别分隔标记,译文中维持分隔符号的数量、位置,不对符号本身翻译修改。

脱离网络环境,本地设备完成整套翻译运算。

输出适配字幕、技术文档、配置文件的译文内容。

Hy-MT2-1.8B应用场景

手机、平板、嵌入式硬件搭建离线翻译工具,断网状态下完成文本转换。

软件国际化开发流程,批量处理程序配置、接口文档,生成多语言版本文件。

内部保密业务文档、私有知识库文本翻译,文件内容不用上传第三方服务器。

视频字幕批量处理,批量生成多语言字幕文件。

桌面客户端、本地小工具内置翻译模块,不再调用外部翻译 API。

论文、合同、行业资料本地转写,方便在本机完成稿件校对工作。

学术、翻译方向实验,拿来做指令跟随翻译相关测试,搭配 IFMTBench 完成效果评估。

© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...