Mage 是微软推出的轻量级多模态模型家族,在固定的 4B 参数预算下构建,旨在让先进的视觉理解与视觉生成能力在 realistic 计算预算下可用于受控实验、后训练研究和垂直领域应用。

Mage 家族围绕”codec-aligned efficiency“(编解码对齐效率)的共享理念组织——将表征能力花在信号真正存在的地方——同时覆盖理解与生成两个方向:
表格
| 模型 | 任务 | 规模 |
|---|---|---|
| Mage-VL | 图像与视频理解、主动流式处理 | 4B |
| Mage-Flow | 文本到图像生成、指令式图像编辑 | 4B |
两个模型都足够紧凑,可以在 modest 硬件上训练、微调和部署,但在各自领域仍能与规模更大的开源系统竞争。
Mage核心特点
Mage-VL(理解侧)
表格
| 特点 | 说明 |
|---|---|
| Codec-native 视觉编码器 | 视觉编码器 Mage-ViT 完全从头训练,采用生物启发的 I/P 预测块机制,将视觉 token 使用量削减 75% 以上 |
| 主动流式理解 | 单一模型内置主动流式门控(proactive streaming gate),可实时感知并响应视频事件,无需单独变体 |
| 视频理解领先 | 在固定 4B Qwen3 骨干下,替换为 Mage-ViT 后在所有视频与时序定位基准上超越 Qwen3-VL-4B |
| 空间智能突出 | 在 VSI-Bench、CrossPoint、EmbSpatial 等空间智能基准上明显领先同规模模型 |
| 推理加速 | 视觉 token 减少带来 最高 3.5 倍 的 wall-clock 推理加速,视频训练长度可达 8 倍 |
Mage-Flow(生成侧)
表格
| 特点 | 说明 |
|---|---|
| 原生分辨率生成 | 单个 checkpoint 支持从 512 到 2048 的任意分辨率,包括极端 4:1 宽高比 |
| 高效 tokenizer | Mage-VAE 在重建保真度上匹敌 FLUX.2-VAE,但编码/解码 MACs 分别减少约 12 倍/22 倍 |
| 统一生成与编辑 | 同一 4B 家族同时支持文生图和指令式图像编辑,无需分离架构 |
| 完整模型谱系 | 每个任务均提供 Base、RL 对齐、4-step Turbo 三种变体 |
| 系统级训练加速 | 原生分辨率打包 + 融合 CUDA 内核将每步训练时间从 ~1.93s 降至 ~0.78s(~2.5 倍更快) |
Mage核心优势
1. 小参数大能力 4B 参数即可在图像生成质量上匹敌或超越 20B 级别的 Qwen-Image、32B 级别的 FLUX.2,以及 6B 级别的 Z-Image。在图像编辑上也能与 20B 的 FireRed-Image-Edit 竞争。
2. 计算友好 模型规模控制在 4B,训练、微调和部署均可在 modest 硬件上完成。Mage-Flow-Turbo 在单张 A100 上生成 1024² 图像仅需 0.59 秒,峰值显存约 18-20 GB,为对比系统中最低。
3. 统一架构 理解与生成共享”codec-aligned efficiency”设计哲学,视觉信号在哪里,表征能力就花在哪里,避免冗余计算。
4. 即插即用 提供 Python API、CLI 和 Gradio Web UI,支持 Hugging Face 自动下载和缓存,开箱即用。
Mage项目地址
- 项目官网:https://microsoft.github.io/Mage/
- GitHub仓库:https://github.com/microsoft/Mage
Mage核心功能
Mage-VL
- 图像理解:图文问答、OCR、视觉推理
- 视频理解:长视频理解、时序定位、事件检测
- 主动流式处理:实时视频流的事件门控解说,可泛化到真实直播场景
- 空间智能:视觉空间推理、跨点定位、嵌入空间理解
Mage-Flow
- 文生图:支持任意分辨率(512 到 2048)、任意宽高比的自然语言图像生成
- 指令式图像编辑:语义内容编辑、外观变换、图像修复、结构感知输出
- 多图编辑:支持将多个参考图像融合编辑
- 批量生成:不同分辨率、不同 prompt 可在一次 packed forward 中并行生成
Mage应用场景
表格
| 场景 | 说明 |
|---|---|
| 学术研究 | 4B 规模适合受控实验和后训练研究,可在单卡上复现和扩展 |
| 垂直领域微调 | 模型小巧,易于在特定领域数据上微调(医疗影像、工业设计、时尚等) |
| 实时视频分析 | Mage-VL 的主动流式能力适合监控、直播解说、实时内容审核 |
| 电商视觉设计 | 快速生成商品主图与场景图,一键更换背景、调整色调 |
| 广告创意迭代 | 借助 Turbo 版本的实时推理能力,批量生成广告创意图加速 A/B 测试 |
| 游戏概念美术 | 批量产出角色与场景原画,RL 版本的高美学表现减少后期修图 |
| 社交媒体内容 | 输入描述即可生成适配的配图,无需专业设计技能 |
| 图像修复翻新 | 使用 Edit 版本修复老旧照片、损坏图像,还原清晰度与色彩 |
Mage开源与使用
表格
| 项目 | 许可证 | Hugging Face |
|---|---|---|
| Mage-VL | Apache-2.0 | microsoft/Mage-VL |
| Mage-ViT | MIT | microsoft/Mage-ViT |
| Mage-Flow | MIT | microsoft/Mage-Flow |
快速开始(文生图):
Python
from mage_flow import MageFlowPipeline
pipe = MageFlowPipeline.from_pretrained("microsoft/Mage-Flow", device="cuda")
img = pipe.generate(["A close-up portrait of an elderly African man..."],
steps=20, cfg=5.0, heights=[1024], widths=[1024])[0]
img.save("output.png")
一句话总结
Mage 是微软推出的 4B 参数轻量级多模态模型家族,包含 Mage-VL(图像视频理解与主动流式处理)和 Mage-Flow(原生分辨率图像生成与编辑)两大分支,以 codec-aligned efficiency 为核心设计理念,在 modest 硬件上即可实现与数十亿参数模型竞争的性能。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



