🌍 背景与动机 现有 Coding Agent 基准存在两类问题:SWE-bench 等公开静态基准虽然可复现,但任务和解法长期暴露在网上,容易受到数据污染影响,而且主要集中于 bug fixing;真实生产基准虽然更贴近实际使用,却通常是闭源的,难以审计和复现。Tencent WorkBuddy Bench 因此希望兼顾真实任务分布、抗污染、开放性与可复现性,并将评估范围扩展到 Code、Web、Office 和 Security 四类真实工作。 🚀 主要贡献 论文提出 Tencent WorkBuddy Bench,共包含 260 个任务:Code 80、Web 70、Office 50、Security 60,并统一在 CodeBuddy Code 和 Claude Code 两种 Agent Harness 下运行。其核心创新是distribution-informed、contamination-resistant 的任务构造方式:不直接复制公开 Issue,而是根据真实工作分布设计并重写任务;同时针对不同领域采用最合适的验证机制,包括 hidden tests、规则检查、LLM Judge、Agent Judge 和完全确定性的程序化评分。 📊 主要结果 实验显示没有一个模型能够在所有工作场景中占优:Claude Opus 4.8 在 8 个 Track-Harness 组合中领先 5 个,GPT-5.5 在 Claude Code 下以 86.05 获得 Office 第一,而开源权重模型 GLM-5.2 在 Security 两个 Harness 下分别达到 76.32 和 80.86,均排名第一。另一个重要发现是 Harness 本身会显著影响模型排名,尤其 Security 中两个 Harness 的平均绝对分数变化达到 8.6 分。细粒度分析进一步表明,当前 Agent 的主要瓶颈并不只是“写代码”,而是理解模糊需求、定位正确上下文、遵守接口与业务约束,以及完成交互、状态维护和跨文件一致性的完整工作闭环;同时,更长的推理或更多 Token 也并不必然带来更高成绩。 --- Github:Tencent/workbuddy-bench 论文:2607.20911 #howto入门vibecoding #腾讯 #workbuddy #howto用好AI