MiMo-V3 是小米推出的全新一代 MiMo 系列大模型,搭载自研 HySparse 2 稀疏注意力架构,面向长上下文智能体任务深度优化,在百万 token 上下文场景大幅削减算力开销与显存占用。模型延续 MiMo 系列全模态能力,支持图文、文档、多类型文件的联合解析,在 Agent 多轮交互、长代码库处理、海量文档研读场景的评测指标实现提升。针对智能体持续迭代式任务的特性做专项优化,缓解多轮对话中上下文膨胀带来的性能衰减,兼顾推理质量与推理成本,适配企业智能体开发、专业代码工程、海量资料处理等复杂任务。

MiMo-V3特点
采用 HySparse 2 全新稀疏注意力模块,百万 token 长度下预填充计算量大幅下降,KV 缓存体积显著压缩。
长上下文检索指标提升,长文档内信息定位的出错概率降低。
适配智能体连续交互场景,多轮工具调用过程保持稳定输出。
全模态输入支持,可读取图片、PDF、扫描文档、表格等多种格式素材。
支持多档量化权重,可在不同算力设备完成本地部署。
多语言与中文方言理解能力保留,代码生成、逻辑推演的评测分数相比前代版本提升。
MiMo-V3技术原理
基于 MoE 混合专家架构,HySparse 2 引入 KV 桥接与 KV 重用两套机制,交叉解码器复用自解码器隐藏状态构建 KV 向量,稀疏层复用前序注意力层缓存与索引。
预训练阶段加入大量智能体交互日志、长代码工程、百万字级文档样本,学习持续增长上下文环境下的任务规划逻辑。
多模态编码器将图像、文档的视觉特征映射至文本语义空间,和主干大模型共享表征体系。
推理调度模块动态分配专家子网,仅激活任务相关参数,减少闲置算力消耗。
缓存机制重构,长会话持续交互时复用历史 KV 数据,降低重复编码带来的显存压力。
MiMo-V3功能
百万级长文档深度解析,一次性加载整套代码库、多份合同、长篇技术手册,提取关键信息。
智能体多轮任务执行,联动工具调用完成多步骤复杂工作流,自主规划子任务。
全模态内容解读,解析截图、图表、扫描件,提取数据并开展逻辑推演。
代码工程处理,完成大型项目重构、漏洞排查、单元测试编写、代码评审。
结构化内容输出,生成表格、JSON、配置文件、接口文档等标准化格式。
多语种与方言文本处理,完成翻译、文本摘要、资料整编。支持 API 调用与本地权重部署,适配私有化业务环境。
MiMo-V3应用场景
企业搭建自研 Agent 系统,处理多轮业务工单、跨系统自动化任务。
软件开发团队维护大型代码仓库,批量开展代码迁移、缺陷扫描。
科研团队研读海量文献,梳理文献脉络,解析实验图表与研究数据。
法务岗位批量处理合同卷宗,比对多版文档差异,标记关键条款。
智能硬件厂商开发端侧 AI 能力,在本地设备运行轻量化模型。
独立开发者基于模型基座微调,搭建垂直领域专属应用。
MiMo-V3如何使用
访问小米 MiMo 官方平台,注册开发者账号,开通模型调用权限,在模型列表选中 MiMo-V3。网页端直接输入提示词,上传 PDF、图片等文件,提交请求获取模型返回结果。复杂 Agent 任务在提示词内写明任务步骤、工具调用规则与输出格式。
API 调用时配置请求参数,填入 MiMo-V3 模型标识,设置上下文窗口、采样参数。长文档任务开启 KV 缓存相关配置,降低 token 消耗。本地部署场景,下载对应量化权重,使用 vLLM、Text Generation WebUI 等推理框架加载模型,配置 GPU 显存参数。
模型微调准备格式化领域数据集,使用官方脚本启动微调流程,训练完成导出专属权重。业务上线前,构造长文本、多轮连续交互测试用例,验证长上下文稳定性。业务应用层增加结果校验环节,复核模型输出内容。
MiMo-V3同类产品对比
表格
| 项目 | MiMo-V3 | Qwen3.8-Omni-Flash |
|---|---|---|
| 研发主体 | 小米 | 阿里通义千问 |
| 产品定位 | HySparse2 稀疏架构全模态大模型,面向 Agent 智能体长任务场景 | 轻量化全模态旗舰模型,兼顾多模态理解与通用推理 |
| 核心特色 | 1M 上下文,HySparse2 稀疏注意力,预填充算力与 KV 缓存大幅压缩,原生多模态,Agent 任务效率高,适合长循环智能体执行 | 图文音一体化,推理速度快,中文理解优异,API 调用成本友好,工具调用能力成熟 |
| 适用场景 | 设备端 + 云端 Agent 自动化、长文档连续任务、多模态智能体、硬件原生 AI 助手 | 企业多模态业务、图文问答、批量内容处理、通用 AI 应用开发 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



