Qwen-UI-Agent是阿里巴巴千问大模型团队发布的GUI(图形用户界面)智能体基座模型,定位为”以真实世界为中心的下一代GUI智能体”。让AI能够像人类一样”看懂”屏幕界面并直接操作应用程序,充当数字设备上的通用执行器。该模型覆盖移动端、PC桌面端、网页端以及深度搜索(DeepSearch)四大环境,目标是解决大量未开放API的传统软件应用的智能化操作难题——无需改造原有程序,AI仅凭视觉理解屏幕即可完成操作。

Qwen-UI-Agent特点
- 全场景跨端覆盖:一个模型同时支持手机、电脑、网页浏览器和深度搜索四种环境,不是针对单一平台的专用工具,而是面向所有带屏幕的数字设备的通用执行基座。
- 真机驱动的训练与评测体系:搭建了覆盖100余台真实手机、150余款主流应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建MobileWorld-Real真机基准(400余项任务、100余款应用),打通”从模拟到真实”的最后一公里。
- 性能全面领先:截至2026年8月发布时,该模型在多项GUI基准测试中全面对标乃至超越GPT-5.6 Sol、Claude Opus 4.8、Gemini 3.1 Pro等业界旗舰模型。移动端MobileWorld得分82.1%,分别领先GPT-5.6 Sol、Claude Opus 4.8达12.0和14.6个百分点;真机基准MobileWorld-Real达92.2%;AndroidDaily高达97.5%,接近满分。电脑端OSWorld-Verified达79.5%,浏览器WebArena达73.6%位列所有对比模型第一,ScreenSpot-Pro界面定位达81.5%刷新SOTA。
- 安全机制贯穿全流程:面对违法或高风险请求直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,在关键步骤主动停手并向用户说明情况,待获得明确确认后再继续执行。
- 通用能力不降级:在强化GUI操作能力的同时,模型的通用对话和Agentic能力全面保持或超越训练基座模型,并在这两类任务上大幅领先GUI专用模型。
Qwen-UI-Agent项目地址
- 项目官网:https://tongyi-mai.github.io/Qwen-UI-Agent/
- GitHub仓库:https://github.com/Tongyi-MAI/MAI-UI
Qwen-UI-Agent技术原理
Qwen-UI-Agent的技术架构围绕”视觉理解—任务规划—动作执行—反馈迭代”的闭环展开,核心技术路径包括以下几个方面:
大规模真机环境训练:团队搭建了超100台真实手机、150余款应用的物理设备集群,模型在真实设备环境中进行任务构建、轨迹采集和训练迭代,而非仅在模拟器中运行。这解决了传统GUI Agent在仿真环境与真实设备之间存在的”最后一公里”差距——真实App的加载延迟、弹窗干扰、动态布局等问题只有在真机上才能充分暴露和解决。
GUI+CLI混合动作空间:模型的动作空间不局限于传统的屏幕点击、滑动、输入等GUI操作,还融合了命令行(CLI)执行能力。在电脑端任务中,CLI动作占比近半,约40%的动作以批量形式(Batched Actions)输出,即单次决策可同时生成多个连续操作,大幅缩短执行轨迹、提升任务效率。这意味着模型能根据任务性质自主选择最优执行路径——该点屏幕时点屏幕,该走命令行时走命令行。
超长轨迹在线强化学习:模型支持在超过100步的超长执行轨迹上进行在线强化学习(RL)训练,配合约10000个并发环境同时rollout,结合自适应课程学习机制,持续攻克长程复杂任务。传统GUI Agent的训练往往受限于短轨迹,难以处理需要多步推理和跨应用协作的复杂任务,而这一技术突破使模型能够胜任涉及多个App、多个步骤的端到端工作流。
AutoResearch式AI驱动数据飞轮:系统搭载AI驱动的闭环迭代机制,将人类从”亲自执行每个阶段”转变为”高层监督和干预关键节点”。模型在真实任务中产生的成功与失败轨迹被自动收集、评估和筛选,高质量轨迹回流至训练流程,形成”执行→反馈→优化→再执行”的持续进化循环,使模型能力随使用不断增长。
Harness跨设备协同框架:依托Harness框架,模型具备主动服务能力,支持手机与电脑之间的任务无缝衔接,还能与DeepSearch深度搜索系统联动,将网页信息检索与界面操作有机统一。例如航班取消通知触发后,Agent可自动搜索替代航班、征求用户同意后在手机端完成改签、再到电脑端更新会议日程和表格。
Qwen-UI-Agent功能
- 移动端全应用操作:支持在150余款主流手机App中执行任务,包括社交(微信、小红书)、出行(12306、高德)、办公(钉钉)、购物(朴朴超市)、本地生活(大众点评)等,覆盖信息查询、内容发布、订单操作、设置修改等完整操作链路。
- 桌面端跨应用工作流:在电脑端支持跨应用程序的复杂任务编排,如从相册提取收据图片、移动到远程桌面文件夹、按日期重命名、创建Excel汇总账单等多步骤跨应用操作。
- 浏览器自动化与深度搜索:支持网页端的信息检索、表单填写、内容提取等自动化操作,与DeepSearch深度搜索联动,可将网络调研与界面操作结合,完成跨网站比价、信息综合等任务。
- GUI+CLI混合执行:在电脑端任务中可自动判断何时使用图形界面操作、何时切换至命令行执行,支持批量动作输出,显著提升文件处理、数据操作等任务的效率。
- 安全分级响应:对任务执行过程中的安全等级进行自动判断——违法请求直接拒绝、高风险操作主动拦截、敏感操作(支付/删除/授权)暂停等待用户确认,实现”能执行也懂停手”的安全边界。
- 跨设备任务接力:基于Harness框架,支持在手机和电脑之间无缝切换任务上下文,例如手机端查完高铁信息后自动在电脑端安排会议,无需用户手动传递信息。
- 长程任务稳定执行:支持超过100步的超长执行轨迹,能够完成涉及多个应用、多个决策节点的复杂工作流,如出差行程规划(查高铁→查地铁→算时间→安排会议)等端到端任务。
Qwen-UI-Agent应用场景
- 个人效率助手:用户用自然语言描述复杂的多步骤任务(如”帮我查高铁、算到公司时间、安排会议”),Agent自动在手机和电脑上的多个App中完成全部操作,省去手动切换应用和逐步操作的繁琐流程。
- 电商运营与比价:自动跨多个电商网站调研产品、核对价格、生成比价方案,适合运营人员和消费者进行商品对比和选品决策。
- 企业办公自动化:自动完成文件整理、数据汇总、报表生成、会议纪要安排等重复性办公任务,尤其适合处理涉及多个办公软件协作的复杂工作流。
- 无API传统软件智能化:针对大量没有开放API接口的传统软件应用(如老旧ERP系统、行业专用软件),无需改造原有程序,AI通过”看屏幕”即可完成操作,极大拓展了智能体的应用边界。
- 手机厂商系统集成:据2026年8月初的公开信息,阿里已开源了MAI-UI系列中的2B和8B轻量版本,为手机厂商提供可定制、可部署的GUI Agent基座能力,厂商可基于此训练和适配自家系统,构建深度集成到操作系统中的AI助手。不过,截至2026年8月,旗舰版权重尚未开放下载。
- 云端手机Agent服务:阿里云已在无影云手机的Agentic Mobile产品中集成千问模型与云端Android容器,按实例规格和使用时长计费,为企业提供云端手机自动化操作能力。
- 测试与质量保障:可用于App的自动化测试,模拟真实用户操作路径,覆盖多设备、多应用的功能验证和回归测试场景。
Qwen-UI-Agent同类产品对比
表格
| 对比维度 | Qwen-UI-Agent(阿里通义) | UI-TARS 2(字节跳动) |
|---|---|---|
| 研发主体 | 阿里通义千问 MAI-UI 团队 | 字节跳动 Seed 团队 |
| 核心定位 | 全场景通用 GUI 智能体基座模型 | 端到端多模态 GUI 交互智能体 |
| 覆盖环境 | 移动端、桌面端、网页端、深度搜索,支持 GUI+CLI 混合执行 | 移动端、网页端为主,覆盖基础桌面操作 |
| 核心技术 | 百台真机训练集群、长程在线强化学习、AutoResearch 数据飞轮、统一混合动作空间 | 大规模 GUI 轨迹监督训练、高精度视觉元素定位、端云协同调度 |
| 核心特色 | 多真机基准成绩领跑;单轮批量动作输出;敏感操作安全拦截;跨端有状态主动服务 | 视觉定位精度高;端侧小版本可离线运行;原生适配字节系产品生态 |
| 代表能力 | 真机 APP 全链路操作、桌面系统任务执行、浏览器深度检索、界面 + 命令行混合作业 | 移动端 APP 自动化、网页信息抓取、界面元素精准识别、轻量办公工作流 |
| 适用场景 | 企业级 RPA 升级、跨端办公自动化、复杂长程任务执行、通用数字设备执行器 | 移动端交互辅助、轻量办公提效、内容生产自动化、无障碍交互支持 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



