小米 MiMo 团队对外放出 MiMo-V2.6 模型强化学习训练实时面板,行业少见的直播形式,让外界可以直接查看模型训练全流程数据。页面包含 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 两个版本,训练步数、样本总量、Token 消耗、训练开销以及评测指标全部对外可见,训练过程出现的节点故障、数据集异常等记录同样保留在面板内。

这套训练直播页面,把模型后训练阶段的真实状态完整呈现。传统大模型研发大多只对外公布最终评测结果,训练中的波动、故障与成本数据不会对外展示。MiMo-V2.6 采用 Agent 强化学习框架,训练批次规模维持 1568×16,单轮训练处理海量样本,在长上下文环境下完成多任务测试。
模型底层架构延续 MiMo 系列 MoE 混合专家设计,针对智能体任务做强化学习扩展。训练体系分为三层,分别对应大规模计算调度、多框架混合任务环境,以及带案例与评分标准的奖励评估模块。系统会持续对模型输出结果打分,迭代调整模型在工具调用、代码编写、复杂推理任务上的表现。DeepSWE v1.1 基准测试分数随训练推进持续更新,Pro 版本与 Flash 版本的能力曲线实时展示在面板。
MiMo-V2.6 分为 Pro 和 Flash 两个分支。Pro 版本侧重复杂推理与高强度 Agent 任务,消耗算力更高。Flash 版本偏向均衡的推理速度与成本,适配更多线上部署场景。两个版本同步推进训练,团队会根据实时指标调整样本集与超参。
面向开发者,MiMo-V2.6 可以接入各类 Agent 开发项目,处理代码生成、复杂任务规划、工具调用类需求。企业侧可以基于模型搭建自动化工作流,依托长上下文能力处理大量文档与代码文件。小米 MiMo 团队计划在后续几周,逐步放出本次强化学习对应的技术细节。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



