Orchard – 微软研究院开源的一个用于训练和评估AI智能体的框架

Orchard 是微软研究院开源的一个用于训练和评估AI智能体(Agentic AI)的框架。它旨在解决当前智能体研究中普遍存在的基础设施壁垒,通过提供一个可复用、轻量级的环境服务,让研究人员能够以更低成本、更高效率地开发跨任务、跨领域的强大智能体。

Orchard - 微软研究院开源的一个用于训练和评估AI智能体的框架

Orchard核心特点

  • 环境与训练解耦:将沙盒环境管理(Orchard Env)与模型训练逻辑分离,环境成为可复用的标准化服务,不同任务可共用同一套基础设施。
  • 跨任务、跨框架复用:同一套环境服务可同时支持软件工程、网页导航、个人助理等多种任务,并能与 Codex、OpenClaw 等不同的智能体部署框架(Harness)无缝集成。
  • 极致降本增效:通过高效的资源管理,Orchard 的运行成本相比主流商业平台可降低超过 90%,同时保持极低的执行延迟(0.28秒)。
  • 小模型,大能力:证明了使用参数量相对较小的开源模型(如 30 亿-40 亿参数),也能在复杂任务上达到甚至超越参数量大十倍的顶尖闭源模型的性能。
  • 开源开放:不仅开源了框架代码,还发布了训练数据、评估方法和完整的训练流程(Recipes),旨在推动整个研究社区的发展。

Orchard技术原理

Orchard 的核心是其环境服务 Orchard Env
  1. Kubernetes 原生:Orchard Env 构建在 Kubernetes 之上,能够轻松创建、管理和扩展成千上万个隔离的沙盒环境,为大规模并行训练和评估提供基础。
  2. 统一的接口:它为各种异构环境(如代码仓库、网页浏览器、桌面应用、移动设备等)提供统一的接口,使得智能体可以用一致的方式与不同环境交互。
  3. 在真实部署框架中训练:这是 Orchard 的关键创新。传统方法通常在简化的环境中训练智能体,再部署到复杂的真实框架中,这会产生“训练-部署”的偏差。Orchard 允许智能体直接在最终部署的框架(如CodexOpenClaw)中进行端到端训练,确保训练和部署环境完全一致,从而大幅提升智能体的可靠性和性能。
  4. 模块化训练流程:Orchard 提供了一套可组合、可复现的训练流程组件,包括数据整理、课程学习(Curriculum Design)、监督微调(SFT)、强化学习(RL)和评估套件。

Orchard主要优势

  • 降低研究门槛:研究人员无需从零开始搭建复杂且昂贵的沙盒环境,可以专注于智能体算法本身的创新。
  • 提升训练效率:通过在真实部署框架中直接训练,避免了环境不一致带来的性能损耗,训练出的智能体更可靠。
  • 实现经验复用:Orchard 鼓励将训练过程中产生的轨迹(Trajectories)作为持久化资产保存下来,例如用于训练价值模型(Value Model)来 rerank 候选方案,让智能体的经验能够不断积累和传承。
  • 数据高效:Orchard-GUI 等项目证明,通过精心的训练方法,仅用少量数据就能训练出强大的智能体,降低了对海量人工标注数据的依赖。

Orchard项目地址

  • 项目官网:https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
  • GitHub仓库:https://github.com/microsoft/Orchard

Orchard应用场景

Orchard 框架本身是一个通用平台,其能力通过不同的“配方”(Recipes)在特定领域展现:
  1. Orchard-SWE (软件工程智能体)
    • 任务:自主解决真实代码库中的软件缺陷(Bug)。
    • 能力:能够理解复杂的代码库、定位问题、编写修复补丁并通过测试。在 SWE-bench Verified 基准测试中,仅用约 30 亿参数的模型就达到了 69.7% 的解决率,加入价值模型重排序后提升至 73.0%,性能比肩参数量大十倍的顶尖系统。
  2. Orchard-GUI (图形界面智能体)
    • 任务:像人类一样通过视觉理解来操作网页浏览器,完成自然语言描述的任务。
    • 能力:能够解读网页布局、与动态界面交互。在 WebVoyager、Online-Mind2Web 等多个网页导航基准测试中,作为最强的开源 GUI 智能体,其性能与 OpenAI、Google 的闭源系统相当。
  3. Orchard-Claw (个人助理智能体)
    • 任务:处理日常办公任务,如读写邮件、管理日历、跨工具协调工作流。
    • 能力:通过在多个真实部署框架(如 ReACT, ZeroClaw)中训练,显著提升了在复杂办公场景下的任务成功率和可靠性。

最后想说

Orchard的价值在于它试图解决 AI Agent 研发中的“基础设施税”问题。在过去,研究人员想要训练一个能写代码或操作浏览器的智能体,大部分精力都耗费在搭建沙盒环境、处理并发、管理资源等与算法无关的“脏活累活”上。这导致了严重的重复造轮子现象,且门槛极高。

Orchard 通过 Kubernetes 原生的架构,将这些环境基础设施标准化、服务化,相当于为 AI 智能体建造了一个标准化的“训练工厂”。这种将“环境”与“训练”解耦的思路,是 Agent 研发从手工作坊迈向工业化流水线的重要一步。它让研究人员可以专注于模型和策略本身,而不是被基础设施所累。

© 版权声明
为这篇文章评分
10.0/ 10
2 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...