事件与背景
2026 年 8 月 11 日,腾讯开放 WorkBuddy Bench——一套面向编码智能体(coding agent)的评测基准,覆盖 Code、Web、Office、Security 四大企业高频场景,共 260 项任务。该基准由优图实验室、科恩安全实验室、云鼎安全实验室与 WorkBuddy 团队联合构建,评测框架与 Agent Skill 在 GitHub 开源,数据集在 HuggingFace 发布,arXiv 论文 2607.20911 于 7 月 23 日上线。
关键事实
| 子集 | 任务数 | 领域 |
|---|---|---|
| Code | 80 | 仓库级 SWE(Python),18 类开发者/PM/算法/QA/运维角色任务 |
| Web | 70 | 前端/GUI(HTML/CSS/JS),页面交互、数据可视化、设计分析 |
| Office | 50 | 办公数据/文件工作流(xlsx/csv/pdf/docx) |
| Security | 60 | 安全/漏洞(红+蓝),真实漏洞复现、恶意样本分析、Agent 攻击面探测 |
技术机制或行业解释
WorkBuddy Bench 的核心设计是抗污染(contamination-resistant)任务构造:任务从真实工程场景逆向构造,而非套用公开榜单,避免模型训练数据泄漏导致分数虚高。评测采用"任务 + 隔离沙箱 + 隐藏测试"的方式——给定任务与沙箱工作区,Agent 需产出正确变更(补丁、工件或报告),再由测试套件、规则检查与 LLM 评判多元评分,并在双框架下交叉验证,保证开源可复现、可审计的端到端评测。评测框架基于 Harbor 构建,支持在 Docker 沙箱中批量运行 Agent 并记录轨迹、测试结果与效率。
影响与意义
对 Agent 评测生态,这是中国厂商对"基准污染危机"的正面回应:OpenAI 在 8 月退役 SWE-bench Verified 并审计 SWE-Bench Pro,承认公开榜单可被训练数据污染,而 WorkBuddy Bench 把抗污染构造作为第一性设计原则。对企业选型,260 项任务覆盖办公文档、前端、安全攻防等真实高频场景,比单一 SWE 基准更能反映 Agent 在实际工作中的价值;对开源社区,评测框架 + Agent Skill 的组合降低了企业自建评测的成本,可能推动 Agent 评测从"论文附赠"走向"工程标配"。
风险边界
抗污染设计能降低数据泄漏风险,但无法完全消除(模型可能见过类似工程任务);隐藏测试与 LLM 评判的可靠性需随使用验证;任务数量与覆盖面虽广,仍以英文/工程任务为主,中文与特定行业场景覆盖有限;评测分数与真实生产环境的 Agent 价值之间仍有差距,需要结合成本、稳定性等维度综合判断;基准的长期维护与任务更新节奏尚待观察。
后续观察
关注 WorkBuddy Bench 上各主流模型/Agent 的实测成绩与排名;跟踪其任务集的更新频率与社区贡献机制;对比其与 SWE-bench Verified、SWE-Bench Pro、Harbor 等基准的评测结果一致性;观察安全域(60 项攻防任务)是否成为 Agent 安全评估的参考标准。
AI Master 解读
核心事件
腾讯 8/11 开源 WorkBuddy Bench——260 项编码 Agent 评测任务,覆盖代码/网页/办公/安全四域,以抗污染任务构造为核心卖点。
行业影响
为什么重要: 在 OpenAI 退役 SWE-bench Verified、公开承认基准污染危机的背景下,WorkBuddy Bench 用"从真实工作逆向构造任务 + 隐藏测试多元评分 + 双框架交叉验证"直接回应评测可信度问题。260 项任务中代码 80、网页 70、办公 50、安全 60,覆盖面从 SWE 修复延伸到前端、办公文档与攻防,正是企业里 Agent 真实被部署的高频场景。它把"评测"从学术榜单变成可审计、可复现的工程基础设施,对 Agent 选型与采购都有直接参考价值。
AI Master 建议
用 WorkBuddy Bench 的子集在自有模型/Agent 上跑一遍,对比官方公布的成绩判断真实差距;关注其安全域(60 项攻防任务)的评测方法,可作为 Agent 安全能力的参考基准;跟踪该基准的维护节奏与社区反馈,判断是否纳入长期评测体系。
