Codex Harness是OpenAI全面开源的AI智能体执行框架,以Apache-2.0协议发布在GitHub(openai/codex仓库)。它不是一个大模型,也不是一个聊天助手,而是驱动Codex App、CLI、VS Code插件运行的底层执行引擎——负责管理对话状态、工具调用、沙箱执行、流式输出和人工审批等全部”脏活累活”。OpenAI内部曾依靠这套框架,由3名工程师在5个月内驱动Codex Agent产出接近100万行可上线代码,完整走通了从业务逻辑、单元测试、CI配置到监控看板的全生命周期。此次开源的核心是Harness的三层集成接口,覆盖从CI脚本到产品级Agent的全场景构建需求。

Codex Harness特点
- 不是模型,是”操作系统”:Harness的本质是Agent的运行时基础设施,模型负责思考,Harness负责把思考变成动作——读写文件、跑命令、搜网页、调工具。它不绑定特定模型,支持接入OpenAI、DeepSeek等任意兼容端点。
- “反套壳”设计哲学:OpenAI明确提出”不应该要求团队把业务流程硬塞进通用聊天框”,而是把Agent带入围绕实际工作设计的专业软件中。开发者保留全部界面、数据、业务规则控制权,AI仅作为底层隐形助手。
- 三层集成接口覆盖全场景:提供codex exec(轻量CLI)、Codex SDK(程序化编排)、Codex app-server(持久会话驱动)三种接入方式,从CI脚本到产品级Agent应用一网打尽。
- Harness设计对性能有决定性影响:在ARC-AGI-3基准测试中,仅对Harness做保留推理与上下文压缩两项优化,GPT-5.6 Sol得分从13.3%飙升至38.3%,输出Token数量减少六倍——同一模型、不同Harness策略,效果差距达3倍。
- Rust核心+TypeScript SDK双栈实现:底层codex-rs用Rust编写,保证高性能和安全隔离;上层SDK提供TypeScript和Python接口,兼顾工程效率与开发体验。
Codex Harness技术原理
Codex Harness采用控制逻辑、模型推理、沙箱执行三层解耦架构,核心设计主张是”尽可能做薄做轻”——Harness仅提供必要的安全环境和基础接口,探索、决策和执行的逻辑尽量交给模型自身。
底层:Rust核心(codex-rs)
整个Harness的底层由Rust实现的codex-rs驱动,包含以下关键子模块:app-server(驱动VS Code插件和桌面App的JSON-RPC服务)、exec-server(非交互式任务执行服务)、sandboxing(跨平台沙箱隔离,覆盖Linux和Windows)、execpolicy(执行策略与权限控制)、skills(可复用Skill框架)、hooks(生命周期钩子)、tools(工具调用运行时)、mcp-server(MCP协议服务端)、thread-store/history(持久化会话存储)、model-provider(模型提供方抽象层)等。
中间层:Agent循环与状态管理
Harness负责完整的Agent循环——调用模型、采样、提供上下文(任务目标、可用工具、下一步指令),模型返回响应(通常是工具调用),Harness执行工具并将结果反馈给模型,如此循环直到任务完成。核心机制包括:
- 超长时任务自主执行:单任务可连续自主运行6小时以上,完整闭环完成Bug复现、代码修复、自测、提交PR、处理构建报错等工程全流程,任务崩溃中断后支持续跑。
- AGENTS.md结构化知识库调度:摒弃传统无节制拼接长上下文的模式,依靠结构化文档配置,智能读取项目规范、工程文档、业务规则,有效降低大模型幻觉。AGENTS.md仅约100行,作为”目录”指向更深层的文档,实现渐进式信息披露。
- 上下文压缩与推理保留:通过retained reasoning和context compaction技术,在保持推理质量的同时大幅压缩上下文Token消耗。
- 跨会话状态持久化:将进度、断点、未完成任务持久化到PROGRESS.md等文件,新会话自动读取,解决跨会话失忆问题。
上层:安全沙箱与人工介入
原生内置沙箱隔离,可定义权限边界;高危操作(修改数据库、发送消息、删除文件等)强制触发人工审批(Human-in-the-loop),必须获得业务人员确认后才可执行。宿主应用可决定Agent在哪里运行、能访问什么文件、哪些操作需要审批,企业牢牢守住安全边界。
Codex Harness功能
- codex exec(CLI命令行工具):最轻量的接入方式,适合CI流水线、后台一次性自动化任务。运行有边界的Agent工作流,直接输出结构化结果,支持指定工作目录,简单高效。
- Codex SDK(TypeScript/Python):面向应用开发的编程接口,开发者可用代码创建、启停、恢复Agent任务线程,流式获取任务执行事件,精准控制任务生命周期。
- Codex app-server(核心引擎):本次开源最重要的模块,基于JSON-RPC标准化客户端协议。业务应用可对接本地Codex进程,实现持久会话、实时事件监听、随时中断任务、把自有业务工具暴露给Agent、对接审批流程。支持Sign in with ChatGPT、模型发现和配置管理等附加功能。
- 跨平台沙箱隔离:原生支持Linux和Windows沙箱,Agent在隔离环境中执行所有操作,防止越权访问。
- MCP协议集成:内置MCP服务端,支持将外部工具和数据源暴露给Agent使用,实现与第三方系统的无缝对接。
- Skills可复用技能框架:将常用操作封装为可复用的Skill模块,Agent可自动调用,避免重复开发。
- 生命周期钩子(Hooks):支持在Agent执行的关键节点插入自定义逻辑,实现灵活的流程控制。
- 模型提供方抽象:支持替换底层模型,可接入OpenAI、DeepSeek、七牛云等任意兼容OpenAI接口的模型端点。
Codex Harness应用场景
- 软件工程自动化:核心场景。Agent可自主完成Bug复现、代码修复、自测、提交PR、处理构建报错的完整工程闭环,单任务连续运行6小时以上。OpenAI内部已用此框架完成百万行级代码的自动迭代。
- 企业级产品嵌入:将Agent嵌入自有的业务仪表盘、运营看板、客服系统等专业界面中,用户无需切换到聊天框,在熟悉的业务界面中即可获得AI辅助。OpenAI官方演示的物流看板Relay即是典型——用户选中延误货单,系统自动分析并生成恢复方案,经人工审批后执行。
- CI/CD流水线集成:通过codex exec在持续集成流水线中无人工干预地运行Agent任务,自动修复构建失败、更新依赖、生成测试用例等。
- 税务与财务自动化:Thrive Holdings和Crete已将Harness嵌入专业报税系统,成功处理7000份申报表,准备时间缩短三分之一,兼顾复杂业务逻辑与风控校验。
- 云平台应用构建:思科(Cisco)基于Codex SDK搭建App Builder,客户用自然语言即可生成自定义云应用,复杂流程调度全部由Harness在后台完成。
- 安全运营与客服:安全分析师可在预警队列界面中直接调用Agent分析事件,客服工程师可在账户历史界面中让Agent自动排查问题,无需切换到通用聊天框。
- 私有化Agent开发:企业可基于开源Harness快速搭建内部私有代码Agent、运维自动化机器人、业务工作流智能体,无需从零构建状态管理、沙箱、审批等底层能力。
- 非编程领域扩展:OpenAI总裁Greg Brockman强调”Codex能驱动的远不止编程工具”,社区已有人将其改造为电子表格编辑器、浏览器自动化工具等,智能体本身是通用的,产品形态是可变的。
Codex Harness同类产品对比
表格
| 对比维度 | Codex Harness(OpenAI) | DeepSeek Harness(深度求索) |
|---|---|---|
| 研发主体 | OpenAI | 深度求索 DeepSeek |
| 产品定位 | 生产级通用 Agent 运行时底座,Codex 全系列智能体的统一执行引擎 | 全插件化可定制 Agent 框架,支持核心执行链路全模块插拔重构 |
| 核心架构 | Rust 核心引擎 + TypeScript SDK,控制逻辑 / 模型推理 / 沙箱执行三层解耦,内置标准化 Agent 循环 | 全插件化设计,Agent 循环、模型适配、会话存储、沙箱、审批策略均为可替换组件 |
| 核心特色 | 经过大规模生产环境验证;长时任务支持断点续跑;沙箱安全隔离机制完善;原生深度适配 GPT 系列模型;可直接嵌入业务系统 | 核心决策回路可拆装重构;模型无关设计,兼容多类大模型;自定义程度极高;插件生态灵活度强 |
| 代表能力 | 对话状态管理、工具调用路由、多轮任务续跑、权限审批管控、沙箱安全执行、多端统一底座 | 插件化 Agent 循环定制、多模型统一调度、自定义审批策略、模块化工具接入、可重构工作流 |
| 适用场景 | 企业级 Agent 业务嵌入、软件工程自动化、生产环境智能体部署、多端统一智能体开发 | 高度定制化 Agent 研发、异构模型统一调度、特殊业务流程智能体、自研 Agent 系统底座 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



