LFM2.5-2.6B是由人工智能初创企业Liquid AI于2026年8月5日正式发布的一款开源端侧智能体模型。该模型隶属于 Liquid AI 的 Liquid Foundation Models(LFM)系列,拥有仅 26亿(2.6B)参数,专为在智能手机、笔记本电脑、物联网设备等终端上完全本地运行而设计。
LFM2.5-2.6B无需依赖云端API,即可在设备端支持完整的智能体工作流,包括规划、工具调用与多步骤复杂任务处理。它以极小的体积实现了接近大模型数倍参数量的智能体能力,被业界视为”端侧智能体真正落地”的标志性产品。

LFM2.5-2.6B核心特点
1. 极致轻量,手机可跑
仅26亿参数的规模,使得LFM2.5-2.6B可以完全在智能手机上本地运行,无需联网、无需云端算力支持。用户无需担心隐私数据上传,也无需承担API调用费用。
2. 智能体能力突出
不同于传统的轻量级对话模型,LFM2.5-2.6B 专为智能体工作流设计,具备:
- 任务规划能力:可将复杂目标分解为可执行子步骤
- 工具调用能力:能准确生成函数调用格式,与外部工具交互
- 多步骤处理:支持连续多轮决策,完成链式任务
3. 性能媲美四倍体量模型
4. 推理速度优异
- 在 M5 Max 芯片上:220 tokens/秒
- 在普通智能手机上:稳定30 tokens/秒
这一速度足以保证流畅的实时交互体验。
5. 多语言支持增强
通过扩展现有分词器,LFM2.5-2.6B 显著提升了对非拉丁字母语言的处理能力,包括中文、阿拉伯文、日文、韩文等,词表规模达到 128K。
6. 完全开源
基础版本与后训练版本均已上线 Hugging Face 平台,供全球开发者自由下载、微调和二次开发。
LFM2.5-2.6B技术原理
混合架构设计
LFM2.5-2.6B 继承了 LFM2 系列的混合架构设计,核心组件包括:
- 短程门控卷积(Short-range Gated Convolution):负责捕捉局部上下文特征,计算效率高,适合处理短距离依赖关系,在端侧设备上运行开销极低。
- 分组查询注意力(Grouped Query Attention, GQA):在保持全局建模能力的同时,大幅降低KV缓存的内存占用,使得长上下文推理在有限内存的设备上成为可能。
两种机制交替堆叠,兼顾了局部特征提取的效率与全局语义理解的质量,支持 32K 上下文长度。
大规模预训练
- 预训练数据规模:约 34万亿(34T)Token
- 覆盖多领域、多语言文本
- 分词器经过专门优化,扩展至128K词表,增强非拉丁文字编码效率
四阶段后训练流程
LFM2.5-2.6B 的后训练采用精心设计的四阶段流水线:
表格
| 阶段 | 名称 | 作用 |
|---|---|---|
| 第一阶段 | 监督微调(SFT) | 在高质量指令-响应对上训练,建立基础指令遵循能力 |
| 第二阶段 | 教师特化(Teacher Specialization) | 利用领域专家模型生成针对性训练数据,强化特定能力维度 |
| 第三阶段 | 多领域在策略蒸馏(Multi-domain On-policy Distillation) | 从多个大模型中蒸馏知识,覆盖代码、数学、推理、对话等多领域 |
| 第四阶段 | 智能体强化学习(Agent RL) | 在真实智能体环境中进行强化学习,优化规划、工具调用和多步决策能力 |
这一训练路径使模型不仅具备通用语言能力,更在智能体场景下获得了经过验证的实战能力。
端侧推理优化
- 模型结构针对移动端 CPU/NPU 计算特性优化
- 支持 GGUF 等量化格式,可通过 llama.cpp 等主流推理框架部署
- 内存占用控制在移动设备可承受范围内
- 推理延迟低,响应流畅
LFM2.5-2.6B核心优势
1. 隐私安全
所有推理完全在本地设备完成,用户数据不出设备,天然满足隐私合规要求,适用于医疗、金融、法律等敏感场景。
2. 零成本运行
无需云端API调用,无需按token付费,一次部署即可无限次使用,大幅降低智能体应用的运营成本。
3. 低延迟、离线可用
不依赖网络连接,在飞行模式、地下室、偏远地区等无网环境下依然可用。推理延迟仅取决于本地算力,无网络往返开销。
4. 小体积大能力
26亿参数实现接近10B级模型的智能体性能,打破了”大模型才能做复杂任务”的固有认知。在指令遵循和工具调用维度上,性能/参数比极为突出。
5. 开源生态友好
完全开源,开发者可自由下载、微调、量化、部署。社区可基于此模型构建垂直领域智能体,无需从头训练。
6. 多语言与多场景适配
128K词表覆盖全球主要语言,四阶段后训练确保模型在对话、推理、工具调用、信息提取等多种任务上均有良好表现。
LFM2.5-2.6B性能表现
基准测试亮点
- 指令遵循:在IFBench等指令遵循基准上表现优异,可媲美近四倍参数量的模型
- 工具调用:在BFCL等函数调用/工具使用基准上,准确率和格式合规性均处于同规模领先水平
- 智能体任务:在规划、多步推理、环境交互等智能体评测中表现突出
- 数学与推理:具备较强的逻辑推理和数学计算能力
已知局限
- 编程能力:与头部大参数模型相比,在复杂代码生成和调试任务上仍存在可感知的差距。这是轻量化模型在参数容量上的固有取舍。
- 超长文本生成:受限于32K上下文和参数规模,在超长连贯文本创作方面不如大模型。
- 知识广度:26亿参数的知识容量有限,对于极冷门领域的知识问答可能不够全面。
LFM2.5-2.6B应用场景
1. 手机端AI助手与智能体
在手机本地运行智能体,自动完成日程管理、信息整理、跨App操作等任务,无需将用户数据上传云端。
2. 离线环境智能工具
在飞机、船舶、矿山、偏远地区等无网络覆盖的场景中,提供本地AI决策支持、文档处理、信息查询等服务。
3. 隐私敏感行业
- 医疗:在院内设备本地处理病历分析、辅助诊断建议
- 金融:在终端设备完成合规审查、风险评估的初步推理
- 法律:本地合同分析、条款提取,数据不出律所
4. IoT与边缘计算
在智能家居、工业传感器、车载系统等边缘设备上部署轻量智能体,实现本地决策与响应,降低对云端的依赖。
5. 开发者工具集成
- 代码补全与简单调试辅助
- 本地RAG检索增强生成
- 数据提取与格式转换
- 自动化测试脚本生成
6. 教育与研究
作为轻量级开源模型,适合学术界研究端侧AI、模型压缩、智能体训练方法论等方向,低硬件门槛降低了研究成本。
7. 嵌入式智能体产品
智能手表、AR眼镜、翻译机、学习机等嵌入式产品可集成LFM2.5-2.6B,实现本地AI交互而无需持续联网。
模型版本与获取
表格
| 版本 | 说明 |
|---|---|
| LFM2.5-2.6B(基础版) | 预训练完成的基座模型,适合开发者自行微调 |
| LFM2.5-2.6B(后训练版) | 经过四阶段后训练的指令/智能体模型,可直接使用 |
两个版本均可在 Hugging Face 平台免费下载。支持 GGUF、SafeTensors 等主流格式,兼容 llama.cpp、Ollama、vLLM 等推理框架。
与同系列模型的关系
表格
| 模型 | 参数量 | 发布时间 | 定位 |
|---|---|---|---|
| LFM2-2.6B | 26亿 | 2025年12月 | 第二代基础模型 |
| LFM2-2.6B-Exp | 26亿 | 2025年12月 | 纯RL实验版本 |
| LFM2.5-1.2B-Instruct | 12亿 | 2026年1月 | 超轻量指令模型 |
| LFM2.5-1.2B-Thinking | 12亿 | 2026年1月 | 端侧推理模型 |
| LFM2.5-2.6B | 26亿 | 2026年8月 | 端侧智能体模型(最新) |
LFM2.5-2.6B 是该系列中面向智能体场景的最新旗舰端侧模型,相比前代在工具调用、多步规划和强化学习训练方面有了质的飞跃。
最后想说
LFM2.5-2.6B 代表了端侧AI从”能对话”到”能做事”的关键跨越。它以仅26亿参数的体量,通过混合架构设计、34T Token大规模预训练和四阶段精细后训练,实现了接近四倍体量模型的智能体能力,同时保持了在手机上30 tokens/秒的流畅推理速度。
对于追求隐私保护、离线可用、低延迟响应的开发者和企业而言,LFM2.5-2.6B 提供了一个真正可落地的端侧智能体基座。它的开源属性更为社区创新打开了广阔空间——从手机本地助手到IoT边缘决策,从隐私计算到离线工具,LFM2.5-2.6B 正在重新定义”小模型能做什么”的边界。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



