蚂蚁集团正式开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。该模型基于Ling-3.0-flash的MoE架构拓展,总参数124B,单次推理仅激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口达256K Token。不同于传统“一次性看图生成”的视觉模型,它引入视觉反馈闭环机制,能按“观察→行动→验证→修正”的逻辑执行任务,在图片转网页、GUI自动化、医疗报告解读等场景中,可根据执行结果持续调整输出,在Artificial Analysis Intelligence Index v4.1.1评测中较纯文本版提升4分。

Ling-3.0-flash-VL特点
低激活参数,推理成本低:124B总参数里每次只激活5.5B,MoE稀疏架构的设计让它在保持大模型理解能力的同时,推理开销接近轻量模型,适配高频调用场景。
视觉反馈闭环:执行任务时不是“一次生成完事”,而是会主动观察操作结果,对比预期目标,发现偏差后自动修正,比如生成网页代码后会自己渲染检查,有问题就调整,不用人工反复改。
视觉能力反向提升文本智能:原生多模态联合训练下,视觉信息的引入没有拉低文本能力,反而让模型的综合智能得分比纯文本版更高,图文混合任务不用切换模型。
多模态输入兼容性强:支持任意分辨率的图像、短视频、长文档输入,256K上下文窗口能一次性处理长视频分析、多页扫描件解读这类长序列任务。
Ling-3.0-flash-VL技术原理
Ling-3.0-flash-VL的语言主干沿用42层混合架构,按5:1比例交替堆叠KDA(Kimi Delta Attention)线性注意力层与Gated MLA层,配合1/64稀疏MoE机制,在控制激活参数规模的同时保留足够的表达能力。视觉侧引入任意分辨率ViT编码器,通过两层MLP投影器将视觉特征对齐到文本空间,再用VideoRoPE做时空编码,让模型能理解图像里的空间关系和视频里的时序变化。
视觉反馈闭环的核心是把任务拆成四个环节:模型先观察当前输入和已有结果,根据目标规划下一步动作,执行后主动验证输出是否符合预期,发现偏差就调整参数或重新执行,直到结果达标。比如在图片转网页任务里,它会先分析设计稿的布局,生成代码后自己渲染页面,对比原图检查组件位置、样式是否一致,不一致就修改代码,直到还原度达标。

Ling-3.0-flash-VL功能
视觉感知与理解:能识别图像里的物体、场景、文字,理解复杂表格、图表、扫描件的内容,准确率在CountBench、MMMU-Pro等评测里超过同参数竞品。
多模态Agent执行:不止能“看懂”,还能基于视觉信息执行操作,比如识别网页界面元素后自动点击、填表,看设计稿直接生成可运行的前端代码。
长序列多模态处理:256K上下文窗口支持一次性分析长视频、几十页的PDF文档,提取关键信息不丢失上下文。
双模式推理:和纯文本版一样支持思考模式和非思考模式,复杂任务开思考模式提升准确率,高频低延迟场景用非思考模式加快响应。
Ling-3.0-flash-VL应用场景
前端开发辅助:把设计稿、网页截图扔进去,直接生成可运行的HTML/CSS代码,还会自己检查渲染效果调整,省去手动对照改代码的时间。
医疗场景:解读医学影像、检验报告,跨文档整合患者的检查数据,标注异常指标和风险点,辅助医生快速梳理病情。
GUI自动化:识别手机、电脑界面元素,自动完成跨应用操作,比如批量填表、抓取页面信息,适配测试、运营这类重复操作多的工作。
文档智能处理:解析扫描件、合同、财务报表,提取关键条款、数据,直接输出结构化的结果,不用再人工录入。
视频内容分析:分析短视频、监控视频的内容,提取关键帧、标注事件,适合内容审核、安防这类场景。
Ling-3.0-flash-VL同类产品对比
表格
| 对比维度 | Ling-3.0-flash-VL | Qwen3-VL-Flash |
|---|---|---|
| 研发主体 | 蚂蚁集团百灵大模型 | 阿里通义千问 |
| 产品定位 | MoE 架构视觉语言模型,面向视觉 Agent 任务,支持图文、短视频理解,自带视觉闭环校验能力 | 轻量化多模态模型,兼顾图文、长视频、文档解析,适合通用多模态推理业务 |
| 核心特色 | 总参 124B,激活仅 5.1B,256K 上下文,视觉反馈闭环,擅长 UI 自动化、图片转网页、医疗报告解读,开源多量化版本 | 256K 上下文窗口,强文档图表识别,空间定位能力突出,微调生态完善,API 部署成熟稳定 |
| 适用场景 | GUI 智能体、网页原型生成、截图代码开发、医疗图文分析、私有化 Agent 项目 | 长文档图文解析、截图 OCR 图表理解、多模态 RAG、通用企业视觉问答 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



