WorkBuddy Bench是腾讯推出的多领域AI智能体能力评测基准套件,专为评估AI智能体在真实工作场景中的综合执行能力而设计。从真实业务场景逆向构造任务,彻底剥离公开题库依赖,实现抗”答案污染”的公平评测。该基准横跨代码、网页、办公、安全四大工作领域,包含260个防作弊任务,通过严格的隔离环境运行机制,首次系统性揭示了当前主流模型在复杂任务执行中的能力断层,尤其在安全领域任务中,模型平均得分差距高达8.6分,凸显评测敏感性。

WorkBuddy Bench核心特点
1. 真实场景抗污染设计
- 逆向工程任务生成:所有任务均从真实的代码提交、拉取请求或业务场景中提取并改写,而非基于公开题库修改,确保提示词无法通过网络搜索匹配到原始线索,从根本上防止模型”背答案”。
- 动态版本管理:通过任务构造方式与版本控制双重机制抵御数据污染,而非简单封闭题库。
2. 多领域全覆盖评测
- 四大工作域协同验证:
- 代码领域(80题):仓库级软件工程能力,侧重隐藏测试通过率;
- 网页领域(70题):前端制品交付能力,依赖规则检查与视觉模型评判;
- 办公领域(50题):多文件业务流程处理,以确定性规则为主、LLM评判为辅;
- 安全领域(60题):红蓝对抗实战能力,采用纯规则化评分且布设五层反作弊机制。
- 拒绝平均分误导:因各子集评分逻辑差异显著,不提供套件整体平均分,避免跨域能力误判。
3. 强防作弊机制
- 安全子集五层防护:禁用字面量扫描、输入重命名、覆盖篡改测试、编码依赖混淆、低权重诱饵干扰,确保红队(38题)与蓝队(22题)任务结果可信。
- 环境隔离运行:所有评测在隔离容器中执行,模型与沙箱严格分离,禁用联网搜索与人工提问功能,强制验证纯推理能力。
WorkBuddy Bench技术原理
1. 任务构造与验证逻辑
- 统一任务包格式:四大子集共享标准化任务目录结构,但各自采用独立验证逻辑:
- 代码类依赖隐藏测试用例通过率;
- 网页类结合规则检查+LLM/VLM多模态评判,要求交付端到端制品;
- 办公类以确定性规则检查为主(权重0.7–0.95),辅以证据支撑的LLM评判;
- 安全类完全规避大模型裁判,仅通过
scoring.py脚本三次取平均生成分数。
2. 评测框架敏感性控制
- 双框架交叉验证:默认使用腾讯自研的CodeBuddy Code框架,同时兼容Claude Code,通过对比不同框架下的表现差异识别模型脆弱点。
- 关键参数锁定:推理深度调至最高、上下文扩展至200k tokens,禁用WebSearch与AskUserQuestion功能,确保评测聚焦模型原生能力。
3. 能力衰减量化模型
- 任务复杂度映射:将任务难度与模型表现衰减关联,例如安全子集在不同框架下评分绝对变动平均达8.6分,揭示框架选择对结果的显著影响。
- 效率-效果权衡分析:通过统计输出token量、执行轮次等指标,量化模型”费劲程度”,如DeepSeek-V4-Pro在代码任务中需44轮交互才能完成,而GPT-5.5以更少token实现相近得分。
WorkBuddy Bench核心功能
1. 能力断层精准诊断
- 跨域能力对比:直接横向比较模型在四大工作域的表现,例如Claude Opus4.8在多数子集登顶,但GLM-5.2在安全领域反超,GPT-5.5仅在办公领域领先。
- 框架依赖性检测:识别模型对特定执行框架的敏感度,如Claude Opus4.8在CodeBuddy框架下拒答13次,而在Claude框架中仅拒答2次。
2. 抗污染评测闭环
- 开源数据集透明化:公开任务目录、环境镜像、评估工具、测试用例及参考方案,允许社区复现与扩展,同时通过构造逻辑抵御污染。
- 动态版本迭代机制:针对潜在爬取风险,通过版本管理持续更新任务库,维持评测有效性。
3. 细粒度效能报告
- 多维性能热力图:输出按领域、难度、框架划分的得分分布,直观展示模型优势与短板。
- 执行过程可追溯:记录每一步操作日志,支持回溯分析失败原因(如权限错误、逻辑断层)。
WorkBuddy Bench项目地址
- 项目官网:https://workbuddybench.com/
- GitHub仓库:https://github.com/Tencent/workbuddy-bench
WorkBuddy Bench应用场景
1. AI智能体研发验证
- 客观能力标定:为开发者提供可量化的跨领域能力基准,避免仅依赖单一场景(如代码修Bug)的片面结论。
- 算法优化方向指引:通过安全子集的高敏感性结果,针对性改进模型在对抗性任务中的鲁棒性。
2. 企业级工具选型参考
- 场景适配评估:企业可根据自身业务重心(如金融行业侧重安全、运营团队侧重办公自动化),筛选在对应子集表现最优的模型。
- 成本-效果权衡:结合模型执行效率数据(如token消耗、任务完成率),评估实际部署的经济性。
3. 学术研究与技术演进
- 能力边界探索:系统研究模型在真实工作分布中的表现极限,例如发现跨语言代码任务支持薄弱、办公类缺乏OCR与GUI交互等共性缺陷。
- 评测标准共建:作为首个开源的多领域智能体评测套件,推动行业形成更贴近实际工作流的评估规范。
WorkBuddy Bench将AI评测从实验室理想环境推进到真实工作场景。它证明当前模型在复杂任务中存在显著断层:即便顶级模型(如Claude Opus4.8)在安全领域任务中也可能因框架差异导致8.6分波动,而开源模型在跨域任务中的表现普遍低于闭源模型15分以上。这一基准不仅为技术选型提供客观依据,更揭示了AI智能体从”能对话”到”能干活”的关键瓶颈——对真实业务逻辑的理解与抗干扰执行能力,直接指向下一代智能体的研发方向。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



