Ling-3.0-tiny – 蚂蚁百灵开源的轻量级混合推理MoE大语言模型

Ling-3.0-tiny 是蚂蚁百灵正式开源的一款轻量级混合推理MoE大语言模型。该模型总参数量为7.9B,但在推理时每个Token仅激活1.3B参数,以极低的计算成本实现了接近主流4B至12B级模型的综合能力。面向高效本地部署,让开发者在消费级硬件(如MacBook、Mac mini、DGX Spark)上即可运行具备Agent能力的智能模型,无需依赖云端API。模型同步提供BF16、FP8和INT4三种精度版本,已在Hugging Face和ModelScope平台开源。

Ling-3.0-tiny - 蚂蚁百灵开源的轻量级混合推理MoE大语言模型

Ling-3.0-tiny核心特点

  • 极致参数效率:7.9B总参数中每Token仅激活1.3B,以不到20%的激活比例承载了接近26B级模型的综合智能,在Artificial Analysis Intelligence Index评价体系中取得25分,仅比Gemma-4-26B-A4B低1分,同时超越Qwen3.5-9B、Gemma-4-12B等多个更大规模模型。
  • Agent能力突出:在Artificial Analysis Agentic Index中得分16,超越Gemma-4-31B,在工具调用、任务理解和流程推进方面表现优异,具备接入真实Agent工作流的能力基础。
  • 原生混合推理:同一模型同时支持快速响应模式和多步骤深度推理模式,可通过enable_thinking参数在单次请求中灵活切换,无需部署两套模型。2
  • 完全本地运行:所有推理过程在本地完成,数据不出设备,无云端API计费,满足隐私敏感场景的合规要求。在MacBook上实测首Token响应低于100毫秒,接近原生应用体验。
  • 多设备广泛适配:官方已在NVIDIA DGX Spark、Apple Silicon MacBook(M4 Pro)、Mac mini等设备上完成验证,覆盖从专业AI工作站到个人笔记本的完整设备谱系。
  • 三精度版本灵活选择:BF16版本适合研究评测和生产应用,FP8版本在效果与速度间取得平衡,INT4版本进一步压缩资源需求,面向算力受限的边缘设备。

Ling-3.0-tiny技术原理

  • KDA-MLA混合线性注意力架构:Ling-3.0-tiny延续Ling-3.0系列的混合线性注意力技术路线,将月之暗面自研的KDA(Kimi Delta Attention,增量注意力)与DeepSeek自研的MLA(Multi-Head Latent Attention,多头潜在注意力)按3:1比例交替堆叠。每4层包含3层KDA和1层MLA,KDA负责高效的增量上下文建模,MLA负责精确的全局注意力计算,两者协同在长上下文处理效率与模型表达力之间取得平衡。
  • 稀疏混合专家前馈网络:模型配置了128个路由专家组成的稀疏MoE前馈网络,每个Token仅激活8个路由专家和1个共享专家。通过可学习的路由器为每个Token动态分配最优专家子集,并辅以负载均衡损失函数防止专家崩溃,确保7.9B参数空间被高效且均匀地利用。这种设计使模型以1.3B的激活参数承载了远超同规模稠密模型的知识容量。
  • 原生混合推理机制:模型在架构层面内置了多条差异化推理通道,可根据任务复杂度动态选择轻量快速响应或深度链式思考路径。常规任务走快速通道直接输出,复杂任务自动启用多步推理,平衡数学推理精度与日常指令遵循的响应速度。
  • Multi-Token Prediction训练目标:采用多Token预测作为辅助训练目标,不仅提升了单次前向传播的信息产出效率,还为后续推理加速(如投机解码)提供了技术基础。
  • 端侧部署深度优化:针对本地推理场景进行了量化压缩与KV-Cache内存优化,FP8版本将持续生成速度提高约30%。在8K上下文长度下峰值内存占用仅约8.34GiB,使模型可在36GB内存的MacBook Pro上流畅运行。

Ling-3.0-tiny主要功能

  • 通用智能体任务执行:原生支持工具调用能力,无需外部插件即可生成符合工具接口规范的调用指令,可驱动浏览器UI控制与移动设备自动化操作,在GDPval-AA v2基准上取得772 Elo的高分。
  • 代码生成与辅助:在Terminal-Bench 2.1等代码Agent基准上表现均衡,可胜任代码编写、调试、审查等开发辅助任务,适合接入本地IDE工作流。
  • 数理科学推理:在IMO-AnswerBench上取得71.03分,在GPQA Diamond上取得73分,具备处理高等数学和科学推理问题的能力。
  • 长上下文理解:支持1M Token的上下文窗口,在AA-LCR等长上下文基准上保持稳定表现,可处理大型文档、代码库和知识库的检索与分析。
  • 高非幻觉率输出:在AA-Omniscience非幻觉率指标上取得69.38%的领先成绩,显著优于同级别竞品,在知识密集型任务中提供更可靠的事实性回答。
  • 指令精准遵循:在IFBench上取得63.61分,Multi-IF上取得83.15分,能够准确理解和执行复杂的多约束指令。
  • 本地知识引擎:集成obsidian-cli等工具后,可从本地文本库检索、整理并生成内容,在MacBook上复刻了Infinite Wiki(无限百科)的核心体验,支持划词生成上下文解释卡片和多层知识下钻。

Ling-3.0-tiny应用场景

  • 个人本地知识助手:部署在MacBook或Mac mini上,作为常驻式本地智能节点,持续提供知识库检索、文档分析、划词翻译、语法纠错和文本改写等服务,所有数据留存设备端,适合处理隐私敏感的个人信息。
  • 中小企业代码助手:开发团队可在单台DGX Spark上搭建独立运行的本地模型服务,为研发团队提供代码补全、调试辅助、单元测试生成和Pull Request审查,无需将代码上传至云端,保障知识产权安全。
  • 边缘设备Agent自动化:利用原生工具调用能力,驱动移动设备和浏览器执行自动化操作,如批量表单填写、网页信息抓取、UI测试回归验证等,适合开发测试中的批量试跑场景。
  • 企业内部任务智能体:接入企业内部知识库和业务系统,构建面向特定业务流程的任务智能体,如客服问答、工单处理、报告生成等,FP8版本在DGX Spark上两路并发聚合吞吐可达161 tokens/s,满足小规模团队的日常使用需求。
  • 教育与科研辅助:在高校实验室或个人学习环境中本地部署,为学生提供即时答疑、概念讲解和练习反馈,为研究人员提供论文分析、数据解读和文献综述辅助,无需联网即可使用。
  • 隐私合规场景:金融、医疗、法律等强监管行业对数据出域有严格限制,Ling-3.0-tiny的完全本地推理特性使其成为这些行业部署AI能力的理想选择,模型权重仅约7.85GB(FP8版本),部署门槛极低。
  • Mac mini常驻服务节点:将Mac mini作为低功耗、7×24小时运行的本地AI服务节点,为个人或小型团队持续提供API服务,支撑文档处理、定时任务执行和自动化工作流。

Ling-3.0-tiny同类产品对比

表格

对比维度Ling-3.0-tinyQwen3-Tiny
研发主体蚂蚁集团 InclusionAI(百灵)阿里云通义千问
模型架构稀疏 MoE 混合推理架构,总参 7.9B,单 Token 仅激活 1.3B 参数稠密 Transformer 架构,全参数激活推理
上下文窗口256K tokens128K tokens
核心特色支持思考 / 即时双推理模式,原生函数调用;推理成本极低,单消费级显卡可完整本地部署;MIT 协议开源,Agent 执行能力突出稠密架构部署门槛低,通用能力均衡,多语言覆盖完善,生态工具链成熟,微调适配简单
代表能力轻量智能体调度、长上下文语义检索、本地离线推理、高并发低成本 API 服务通用对话、内容创作、轻量代码辅助、文档摘要、端侧嵌入式推理
适用场景边缘设备离线部署、低成本 Agent 应用开发、高并发批量文本处理、隐私敏感业务场景低算力设备 AI 落地、轻量办公辅助、嵌入式智能场景、垂直小领域微调

Ling-3.0-tiny部署方式

表格

精度版本适用场景推荐设备
BF16研究评测、生产应用、完整精度DGX Spark、高配MacBook
FP8效果与速度平衡、日常使用MacBook Pro、Mac mini
INT4算力/内存受限环境入门级笔记本、边缘设备
模型权重可在Hugging Face(inclusionAI/Ling-3.0-tiny)和ModelScope平台免费下载,API调用可通过OpenRouter和Vercel AI Gateway获取。
© 版权声明
为这篇文章评分
10.0/ 10
3 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...