Qwen-CUA – 阿里巴巴通义实验室推出的原生计算机使用智能体框架

Qwen-CUA是阿里巴巴通义实验室推出的原生计算机使用智能体(Computer-Use Agent, CUA)框架,其核心能力是让大模型直接通过视觉感知屏幕界面,像人类一样操作鼠标键盘完成跨应用任务,无需依赖特定软件的API或DOM结构。该框架基于通义千问多模态大模型(Qwen-VL)开发,在权威基准测试 OSWorld-Verified 中达到 86.2 分,显著领先于多数开源及闭源竞品,成为当前性能最强的开源CUA系统之一

Qwen-CUA - 阿里巴巴通义实验室推出的原生计算机使用智能体框架

Qwen-CUA核心特点

  • 纯视觉驱动的界面交互:完全脱离DOM依赖,仅通过高分辨率屏幕截图理解界面元素(如按钮、输入框),无需访问网页结构或应用内部接口,可操作任意图形化软件(包括无API的专业工具)。
  • 跨平台与通用性:支持 Windows、macOS、Linux 等主流操作系统,覆盖浏览器、桌面应用及专业软件(如Excel、Photoshop、CAD)。
  • 端到端任务执行闭环:从任务理解、界面解析到动作生成全程由单一模型驱动,无需人工拆分步骤或预设规则,支持长链条任务。

Qwen-CUA技术原理

  1. 多模态感知与决策架构
    • 视觉编码器:基于Qwen-VL的改进版模型,将屏幕截图转换为结构化界面描述(如元素类型、位置、文本内容)。
    • 任务规划模块:结合自然语言指令与当前界面状态,生成分步操作计划,并动态调整执行路径。
    • 动作生成器:输出精确的鼠标点击坐标、键盘输入序列等底层操作指令,通过系统级API注入到目标应用。
  2. 关键技术创新
    • 动态坐标映射:解决界面缩放、滚动导致的坐标偏移问题,确保操作精准性。
    • 错误恢复机制:当操作未触发预期界面变化时,自动回溯并尝试替代方案(如重试点击或调整输入内容)。
    • 轻量化沙箱集成:可选配隔离环境运行,避免对主机系统造成干扰。

Qwen-CUA核心优势

  • 性能领先:在 OSWorld-Verified 基准测试中得分 86.2(满分100),大幅超越早期开源模型,接近人类水平(72.4分)。
  • 部署灵活性开源可扩展,采用Apache 2.0协议,开发者可自由修改模型或集成到自有系统。支持本地化运行,敏感数据无需上传云端,满足企业级隐私要求
  • 泛化能力突出适应陌生界面,即使面对未训练过的软件,也能通过通用视觉模式识别基础元素。对界面微小变化(如弹窗遮挡、字体调整)具备容错能力。

Qwen-CUA项目地址

  • GitHub仓库:https://github.com/xlang-ai/Qwen-CUA
  • 技术论文:https://github.com/xlang-ai/Qwen-CUA/blob/main/paper/Qwen-CUA.pdf

Qwen-CUA应用场景

  • 企业级自动化:替代传统规则驱动的机器人流程自动化(RPA),处理无API接口的遗留系统(如老旧ERP、行业专用软件)。自动从多个独立应用中提取数据并生成报告,避免人工复制粘贴
  • 软件测试与开发:模拟真实用户操作,验证界面兼容性与功能逻辑,无需为每个应用编写测试脚本。在VS Code等IDE中自动执行代码调试、插件安装等重复操作。
  • 无障碍与专业工具:为视觉障碍用户提供界面导航指导,将视觉信息转化为语音指令。操作MATLAB、SPSS等无开放接口的科研工具,批量执行数据处理任务
  • 安全与研究:在沙箱中自动化分析可疑程序行为,避免主机感染风险。记录AI操作轨迹,用于优化界面设计或训练强化学习模型。

Qwen-CUA将大模型的视觉理解能力直接转化为操作系统级的控制能力,解决了传统自动化工具对API依赖过重、泛化性差的痛点。其开源属性进一步降低了企业构建定制化智能体的门槛,尤其适合需操作封闭式专业软件混合多系统工作流的场景。

© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...