Ling-3.0-flash-VL – 蚂蚁开源百灵系列首个原生多模态大模型

蚂蚁集团正式开源百灵系列首个原生多模态大模型Ling-3.0-flash-VL。该模型基于Ling-3.0-flash的MoE架构拓展,总参数124B,单次推理仅激活5.5B参数,原生支持图像、文本与视频输入,上下文窗口达256K Token。不同于传统“一次性看图生成”的视觉模型,它引入视觉反馈闭环机制,能按“观察→行动→验证→修正”的逻辑执行任务,在图片转网页、GUI自动化、医疗报告解读等场景中,可根据执行结果持续调整输出,在Artificial Analysis Intelligence Index v4.1.1评测中较纯文本版提升4分。

Ling-3.0-flash-VL - 蚂蚁开源百灵系列首个原生多模态大模型

Ling-3.0-flash-VL特点

低激活参数,推理成本低:124B总参数里每次只激活5.5B,MoE稀疏架构的设计让它在保持大模型理解能力的同时,推理开销接近轻量模型,适配高频调用场景。

视觉反馈闭环:执行任务时不是“一次生成完事”,而是会主动观察操作结果,对比预期目标,发现偏差后自动修正,比如生成网页代码后会自己渲染检查,有问题就调整,不用人工反复改。

视觉能力反向提升文本智能:原生多模态联合训练下,视觉信息的引入没有拉低文本能力,反而让模型的综合智能得分比纯文本版更高,图文混合任务不用切换模型。

多模态输入兼容性强:支持任意分辨率的图像、短视频、长文档输入,256K上下文窗口能一次性处理长视频分析、多页扫描件解读这类长序列任务。

Ling-3.0-flash-VL技术原理

Ling-3.0-flash-VL的语言主干沿用42层混合架构,按5:1比例交替堆叠KDA(Kimi Delta Attention)线性注意力层与Gated MLA层,配合1/64稀疏MoE机制,在控制激活参数规模的同时保留足够的表达能力。视觉侧引入任意分辨率ViT编码器,通过两层MLP投影器将视觉特征对齐到文本空间,再用VideoRoPE做时空编码,让模型能理解图像里的空间关系和视频里的时序变化。

视觉反馈闭环的核心是把任务拆成四个环节:模型先观察当前输入和已有结果,根据目标规划下一步动作,执行后主动验证输出是否符合预期,发现偏差就调整参数或重新执行,直到结果达标。比如在图片转网页任务里,它会先分析设计稿的布局,生成代码后自己渲染页面,对比原图检查组件位置、样式是否一致,不一致就修改代码,直到还原度达标。

Ling-3.0-flash-VL - 蚂蚁开源百灵系列首个原生多模态大模型

Ling-3.0-flash-VL功能

视觉感知与理解:能识别图像里的物体、场景、文字,理解复杂表格、图表、扫描件的内容,准确率在CountBench、MMMU-Pro等评测里超过同参数竞品。

多模态Agent执行:不止能“看懂”,还能基于视觉信息执行操作,比如识别网页界面元素后自动点击、填表,看设计稿直接生成可运行的前端代码。

长序列多模态处理:256K上下文窗口支持一次性分析长视频、几十页的PDF文档,提取关键信息不丢失上下文。

双模式推理:和纯文本版一样支持思考模式和非思考模式,复杂任务开思考模式提升准确率,高频低延迟场景用非思考模式加快响应。

Ling-3.0-flash-VL应用场景

前端开发辅助:把设计稿、网页截图扔进去,直接生成可运行的HTML/CSS代码,还会自己检查渲染效果调整,省去手动对照改代码的时间。

医疗场景:解读医学影像、检验报告,跨文档整合患者的检查数据,标注异常指标和风险点,辅助医生快速梳理病情。

GUI自动化:识别手机、电脑界面元素,自动完成跨应用操作,比如批量填表、抓取页面信息,适配测试、运营这类重复操作多的工作。

文档智能处理:解析扫描件、合同、财务报表,提取关键条款、数据,直接输出结构化的结果,不用再人工录入。

视频内容分析:分析短视频、监控视频的内容,提取关键帧、标注事件,适合内容审核、安防这类场景。

Ling-3.0-flash-VL同类产品对比

表格

对比维度Ling-3.0-flash-VLQwen3-VL-Flash
研发主体蚂蚁集团百灵大模型阿里通义千问
产品定位MoE 架构视觉语言模型,面向视觉 Agent 任务,支持图文、短视频理解,自带视觉闭环校验能力轻量化多模态模型,兼顾图文、长视频、文档解析,适合通用多模态推理业务
核心特色总参 124B,激活仅 5.1B,256K 上下文,视觉反馈闭环,擅长 UI 自动化、图片转网页、医疗报告解读,开源多量化版本256K 上下文窗口,强文档图表识别,空间定位能力突出,微调生态完善,API 部署成熟稳定
适用场景GUI 智能体、网页原型生成、截图代码开发、医疗图文分析、私有化 Agent 项目长文档图文解析、截图 OCR 图表理解、多模态 RAG、通用企业视觉问答
© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...