Ling-3.0-tiny 是蚂蚁百灵正式开源的一款轻量级混合推理MoE大语言模型。该模型总参数量为7.9B,但在推理时每个Token仅激活1.3B参数,以极低的计算成本实现了接近主流4B至12B级模型的综合能力。面向高效本地部署,让开发者在消费级硬件(如MacBook、Mac mini、DGX Spark)上即可运行具备Agent能力的智能模型,无需依赖云端API。模型同步提供BF16、FP8和INT4三种精度版本,已在Hugging Face和ModelScope平台开源。

Ling-3.0-tiny核心特点
- 极致参数效率:7.9B总参数中每Token仅激活1.3B,以不到20%的激活比例承载了接近26B级模型的综合智能,在Artificial Analysis Intelligence Index评价体系中取得25分,仅比Gemma-4-26B-A4B低1分,同时超越Qwen3.5-9B、Gemma-4-12B等多个更大规模模型。
- Agent能力突出:在Artificial Analysis Agentic Index中得分16,超越Gemma-4-31B,在工具调用、任务理解和流程推进方面表现优异,具备接入真实Agent工作流的能力基础。
- 原生混合推理:同一模型同时支持快速响应模式和多步骤深度推理模式,可通过enable_thinking参数在单次请求中灵活切换,无需部署两套模型。2
- 完全本地运行:所有推理过程在本地完成,数据不出设备,无云端API计费,满足隐私敏感场景的合规要求。在MacBook上实测首Token响应低于100毫秒,接近原生应用体验。
- 多设备广泛适配:官方已在NVIDIA DGX Spark、Apple Silicon MacBook(M4 Pro)、Mac mini等设备上完成验证,覆盖从专业AI工作站到个人笔记本的完整设备谱系。
- 三精度版本灵活选择:BF16版本适合研究评测和生产应用,FP8版本在效果与速度间取得平衡,INT4版本进一步压缩资源需求,面向算力受限的边缘设备。
Ling-3.0-tiny技术原理
- KDA-MLA混合线性注意力架构:Ling-3.0-tiny延续Ling-3.0系列的混合线性注意力技术路线,将月之暗面自研的KDA(Kimi Delta Attention,增量注意力)与DeepSeek自研的MLA(Multi-Head Latent Attention,多头潜在注意力)按3:1比例交替堆叠。每4层包含3层KDA和1层MLA,KDA负责高效的增量上下文建模,MLA负责精确的全局注意力计算,两者协同在长上下文处理效率与模型表达力之间取得平衡。
- 稀疏混合专家前馈网络:模型配置了128个路由专家组成的稀疏MoE前馈网络,每个Token仅激活8个路由专家和1个共享专家。通过可学习的路由器为每个Token动态分配最优专家子集,并辅以负载均衡损失函数防止专家崩溃,确保7.9B参数空间被高效且均匀地利用。这种设计使模型以1.3B的激活参数承载了远超同规模稠密模型的知识容量。
- 原生混合推理机制:模型在架构层面内置了多条差异化推理通道,可根据任务复杂度动态选择轻量快速响应或深度链式思考路径。常规任务走快速通道直接输出,复杂任务自动启用多步推理,平衡数学推理精度与日常指令遵循的响应速度。
- Multi-Token Prediction训练目标:采用多Token预测作为辅助训练目标,不仅提升了单次前向传播的信息产出效率,还为后续推理加速(如投机解码)提供了技术基础。
- 端侧部署深度优化:针对本地推理场景进行了量化压缩与KV-Cache内存优化,FP8版本将持续生成速度提高约30%。在8K上下文长度下峰值内存占用仅约8.34GiB,使模型可在36GB内存的MacBook Pro上流畅运行。
Ling-3.0-tiny主要功能
- 通用智能体任务执行:原生支持工具调用能力,无需外部插件即可生成符合工具接口规范的调用指令,可驱动浏览器UI控制与移动设备自动化操作,在GDPval-AA v2基准上取得772 Elo的高分。
- 代码生成与辅助:在Terminal-Bench 2.1等代码Agent基准上表现均衡,可胜任代码编写、调试、审查等开发辅助任务,适合接入本地IDE工作流。
- 数理科学推理:在IMO-AnswerBench上取得71.03分,在GPQA Diamond上取得73分,具备处理高等数学和科学推理问题的能力。
- 长上下文理解:支持1M Token的上下文窗口,在AA-LCR等长上下文基准上保持稳定表现,可处理大型文档、代码库和知识库的检索与分析。
- 高非幻觉率输出:在AA-Omniscience非幻觉率指标上取得69.38%的领先成绩,显著优于同级别竞品,在知识密集型任务中提供更可靠的事实性回答。
- 指令精准遵循:在IFBench上取得63.61分,Multi-IF上取得83.15分,能够准确理解和执行复杂的多约束指令。
- 本地知识引擎:集成obsidian-cli等工具后,可从本地文本库检索、整理并生成内容,在MacBook上复刻了Infinite Wiki(无限百科)的核心体验,支持划词生成上下文解释卡片和多层知识下钻。
Ling-3.0-tiny应用场景
- 个人本地知识助手:部署在MacBook或Mac mini上,作为常驻式本地智能节点,持续提供知识库检索、文档分析、划词翻译、语法纠错和文本改写等服务,所有数据留存设备端,适合处理隐私敏感的个人信息。
- 中小企业代码助手:开发团队可在单台DGX Spark上搭建独立运行的本地模型服务,为研发团队提供代码补全、调试辅助、单元测试生成和Pull Request审查,无需将代码上传至云端,保障知识产权安全。
- 边缘设备Agent自动化:利用原生工具调用能力,驱动移动设备和浏览器执行自动化操作,如批量表单填写、网页信息抓取、UI测试回归验证等,适合开发测试中的批量试跑场景。
- 企业内部任务智能体:接入企业内部知识库和业务系统,构建面向特定业务流程的任务智能体,如客服问答、工单处理、报告生成等,FP8版本在DGX Spark上两路并发聚合吞吐可达161 tokens/s,满足小规模团队的日常使用需求。
- 教育与科研辅助:在高校实验室或个人学习环境中本地部署,为学生提供即时答疑、概念讲解和练习反馈,为研究人员提供论文分析、数据解读和文献综述辅助,无需联网即可使用。
- 隐私合规场景:金融、医疗、法律等强监管行业对数据出域有严格限制,Ling-3.0-tiny的完全本地推理特性使其成为这些行业部署AI能力的理想选择,模型权重仅约7.85GB(FP8版本),部署门槛极低。
- Mac mini常驻服务节点:将Mac mini作为低功耗、7×24小时运行的本地AI服务节点,为个人或小型团队持续提供API服务,支撑文档处理、定时任务执行和自动化工作流。
Ling-3.0-tiny同类产品对比
表格
| 对比维度 | Ling-3.0-tiny | Qwen3-Tiny |
|---|---|---|
| 研发主体 | 蚂蚁集团 InclusionAI(百灵) | 阿里云通义千问 |
| 模型架构 | 稀疏 MoE 混合推理架构,总参 7.9B,单 Token 仅激活 1.3B 参数 | 稠密 Transformer 架构,全参数激活推理 |
| 上下文窗口 | 256K tokens | 128K tokens |
| 核心特色 | 支持思考 / 即时双推理模式,原生函数调用;推理成本极低,单消费级显卡可完整本地部署;MIT 协议开源,Agent 执行能力突出 | 稠密架构部署门槛低,通用能力均衡,多语言覆盖完善,生态工具链成熟,微调适配简单 |
| 代表能力 | 轻量智能体调度、长上下文语义检索、本地离线推理、高并发低成本 API 服务 | 通用对话、内容创作、轻量代码辅助、文档摘要、端侧嵌入式推理 |
| 适用场景 | 边缘设备离线部署、低成本 Agent 应用开发、高并发批量文本处理、隐私敏感业务场景 | 低算力设备 AI 落地、轻量办公辅助、嵌入式智能场景、垂直小领域微调 |
Ling-3.0-tiny部署方式
表格
| 精度版本 | 适用场景 | 推荐设备 |
|---|---|---|
| BF16 | 研究评测、生产应用、完整精度 | DGX Spark、高配MacBook |
| FP8 | 效果与速度平衡、日常使用 | MacBook Pro、Mac mini |
| INT4 | 算力/内存受限环境 | 入门级笔记本、边缘设备 |
模型权重可在Hugging Face(inclusionAI/Ling-3.0-tiny)和ModelScope平台免费下载,API调用可通过OpenRouter和Vercel AI Gateway获取。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



