MiniCPM 是面向端侧设备打造的开源大模型家族,由 OpenBMB 社区、面壁智能联合清华大学共同推出。整套模型全部开源,覆盖纯文本、视觉多模态、全模态音视频交互、百万 token 长文本等不同方向,参数量跨度从 0.5B 到 9B,手机、嵌入式开发板、普通消费级显卡都可以完成部署。整套模型分为纯文本基座、视觉多模态、全模态交互、长上下文专用四大分支,不同分支下迭代多个版本,适配不同硬件条件与业务需求。
纯文本基座模型系列
该系列只处理文本输入输出,侧重推理、代码、工具调用、长文本阅读,适合离线文本助手、本地知识库、Agent 开发场景,硬件门槛更低。
MiniCPM3 系列
MiniCPM3‑4B 是这一代的核心版本,4B 参数量,在推理、代码编写、工具调用任务表现突出。工具调用评测榜单中,9B 以内规模模型里拿到靠前分数。模型原生支持 Function Calling、代码解释器能力,支持 128K 上下文窗口。配套衍生版本包含 MiniCPM‑2B、MiniCPM‑1B,参数量下调之后,内存占用进一步降低,适合算力有限的嵌入式硬件。量化压缩之后,普通笔记本就可以本地跑通整套模型。
MiniCPM4 / MiniCPM4.1 系列
2025 年推出,引入可训练稀疏注意力架构。8B 版本与 0.5B 轻量版本同步放出,0.5B 版本参数量极小,训练数据体量不高,但评测得分优于同尺寸不少开源模型。8B 稀疏版本在部分端侧芯片上,推理速度对比稠密模型提升幅度巨大。原生预训练支持 32K 上下文,借助 YaRN 技术扩展至 128K,文档阅读、本地知识库问答可以直接使用。MiniCPM4.1 升级混合推理能力,数学、代码、逻辑推理得分继续提升,稀疏架构训练稳定性得到优化,开发者可以基于该版本继续二次微调。
MiniCPM5 系列
2026 年更新的新一代稠密文本模型,放出 MiniCPM5‑1B、MiniCPM5‑2B 版本。内置混合思考机制,同一个模型权重可以切换快速回答模式与深度思考模式,输出时自带思考标记。官方配套完整的部署、微调操作文档,附带 Agent 开发示例代码。面向资源受限设备做了专项优化,适合本地桌面小助手、轻量智能体项目开发。
MiniCPM‑SALA
属于长文本专项版本,采用稀疏注意力加线性注意力混合架构。25% 网络层使用稀疏注意力做重点内容捕捉,剩余 75% 使用线性注意力降低计算开销。上下文窗口可以达到百万 token 级别,消费级 RTX5090 显卡就可以完成百万长度文本推理。KV‑Cache 占用大幅下降,处理超长小说、完整项目代码库、整本文档解析场景,推理速度相比稠密基线模型提升 3.5 倍。
MiniCPM‑V 视觉多模态系列
只接收图像、视频、文本输入,输出文本结果。主打手机端离线看图、文档识别、OCR、短视频内容解析,适配 iOS、安卓、鸿蒙系统。
MiniCPM‑V 2.6
8B 参数量,早期旗舰多模态版本。单图、多图、短视频理解能力较强,手写文字识别、文档图表解析表现亮眼。支持实时视频帧解析,量化版本 7GB 显存就可以运行。早期很多端侧看图 AI 应用都基于该版本二次开发。
MiniCPM‑V 4.6
1.3B 参数量轻量化版本,同尺寸模型当中综合表现处于第一梯队。引入 ViT 早压缩技术,视觉编码计算开销降低一半以上,支持 4 倍、16 倍两种视觉 token 混合压缩策略。6GB 内存的手机设备就可以流畅运行,图片、短视频、扫描文档都可以识别,适合手机 APP、AIPC 内置视觉助手。
MiniCPM‑o 全模态交互系列
在图像视频理解基础上增加音频输入、语音输出,实现端到端音视频图文全链路交互,支持流式数据输入输出。
MiniCPM‑o 4.5
9B 参数量全双工模型。可以接收实时视频流、麦克风音频流,同步输出文字与语音,做到边看画面、边听声音、边生成语音回复。模型完成端到端训练,不需要拆分 ASR、TTS 组件,减少多模块拼接带来的延迟。适合端侧实时对话硬件、机器人交互、智能座舱离线语音视觉助手项目。
MiniCPM 各版本选型参考
硬件资源、业务目标决定模型选择方向。普通手机、低功耗嵌入式设备优先选 MiniCPM5‑1B、MiniCPM‑V4.6;笔记本、中端显卡做文本知识库,优先 MiniCPM3‑4B、MiniCPM4.1‑8B;需要读取几十万字、上百万字文档,优先 MiniCPM‑SALA;要做图片文档识别选 MiniCPM‑V 系列;需要语音、视频实时交互,选用 MiniCPM‑o 系列。
整套模型全部开源,开发者可以直接下载权重,做量化、微调、二次开发。商业场景使用需要遵守对应开源许可协议,部署前核对模型版本的许可条款。

© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



