腾讯 WorkBuddy 团队最新开源了 2 个 Agent Skill:wbbench-report-skills 和 wbbench-run-setup。
WorkBuddy Bench 是 WorkBuddy 产品工程实践的副产品——腾讯将内部用于模型选型、Harness 回归测试和任务分布分析的体系整体打包成了开源基准测试。
多模型 Agent 工作台的选型结果显示:GLM-5.2 在安全场景下表现突出,GPT-5.5 的 Token 消耗最低,Claude Opus 综合能力最强。这也解释了 WorkBuddy 为何选择多模型动态切换策略,而非单一依赖自家模型。

重点不是榜单数字,而是为了让别人复现这套选型,团队在仓库的 .agents/skills/ 下放置了两个 Agent Skill:一个负责把评测跑起来,一个负责把报告写对。在 Claude Code 或 CodeBuddy Code 等 Skill 感知的客户端中一句话唤起,就能一阶段一确认地跑完整轮评测。

真正值钱的不是基准本身那 260 道任务(Code 80、Web 70、Office 50、Security 60),而是这两个 Skill 把跑评测和写报告里最容易踩的坑,直接固化成了 Agent 可执行的 Playbook。

两个 Skill 的分工很明确:wbbench-run-setup 负责把评测跑起来,wbbench-report-skills 负责把报告写对。一个管跑,一个管分析。
Skill 1:7 阶段评测流程
wbbench-run-setup 是一个 7 阶段(0 到 6)的交互式 Playbook,从零配置的 checkout 一路带到跑完分析:
- 阶段 0:拉取数据集
- 阶段 1:配置环境
- 阶段 2:写模型配置
- 阶段 3:填写 .env 凭据
- 阶段 4:编写 job 文件
- 阶段 5:dry-run 确认后执行
- 阶段 6:交给 report skill 出报告

设计特点:
- 读实时模板,不靠记忆:不会因模板演进还拿旧字段处理
- 运行时发现选项,不硬编码:避免使用可能过时的列表
- 一阶段一确认:全程用用户语言回复

Skill 2:报告生成
wbbench-report-skills 路由 Office、Web、Code 三个 Benchmark 的报告生成。第一步不是分析,而是先甄别 RUN_DIR 到底是哪一层。

Harbor 的结果目录有三层嵌套:
- JOB 层:只有时间戳子目录,没有 job.log
- RUN 层:单次评测运行,有 job.log 加若干子目录(这才是正确层)
- TRIAL 层:有 trial.log 加 verifier/,对应单道题
选错了层,整份报告就错了。Skill 的策略是:选不出唯一候选就回头问用户,绝不猜默认路径。

甄别完后,三步生成报告:校验 RUN_DIR、运行 workbuddy_bench.scorer.metrics 生成 metrics.json、再写 report.md。输入产物全程只读,只往 REPORT_DIR 写东西,不修改 Harbor 原件,也不重跑评测。

报告卫生的关键规则:
- reward ≠ pass_rate:reward 是主分,取每任务 reward 均值,build_error 记 0 进分母;pass_rate 是 verifier 得分 ≥ 1.0 的 trial 占比,即整题全通过比例
- Rule-only 和 Rule+Judge 评分契约不同,不能直接比较
- 每个判断必须绑定 task id 加证据,不能只甩个均分
- 只改测试、不动产品代码的改动不算有效修复,除非任务本身就是 Test Generation

相关链接
- 论文标题:Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
- arXiv:2607.20911
- GitHub:https://github.com/Tencent/workbuddy-bench