WeChat (PaperAgent)
ai-engineeringai-tools
Original source

爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌

Summary

腾讯 WorkBuddy 团队开源了内部用于模型选型的评测基准 WorkBuddy Bench,包含四大赛道(Code/Web/Office/Security),揭示了其多模型切换架构的决策依据。

核心发现

  • 没有全能冠军:Claude Opus 4.8 拿 5 块榜(Code 双榜、Web 双榜、Office cbc),GLM-5.2 以开源模型身份拿下 Security 双榜,GPT-5.5 拿 Office cc
  • Harness 敏感性极强:换 harness 后排名直接洗牌(Security 赛道七模型平均位移 8.6 分)
  • GPT-5.5 是全场最省 token 的高分者(输出量远小于其他模型但分数接近或领先)
  • 花钱多 ≠ 分数高:DeepSeek-V4-Flash 输出量是 GPT-5.5 的 3.3 倍,分数却低 14.74 分

四大赛道设计亮点

  1. Code(80 任务):只有 10 个是修 Bug,五种角色(开发者/算法工程师/PM/QA/运维)+ 18 细分类目;刻意欠规格,Agent 必须自己从仓库找上下文
  2. Web(70 任务):artifact-not-chat 契约——路径下没有可运行工件就是零分
  3. Office(50 任务):评最终工作区状态而非答案文本,双通道评分(Rule checks + LLM Judge)
  4. Security(60 任务):全程无 LLM 裁判 + 五层反作弊,红蓝队全景覆盖,复现真实 CVE

方法论亮点

  • 任务来源锚定真实上游工件(开源 commit/PR、真实 CVE),不含用户 prompt
  • 抗污染设计:改写成口语化、欠规格请求,搜索引擎无法匹配
  • 双 Harness 评分(cbc + cc),刻意不报总平均分

关键洞察

  • 这解释了 WorkBuddy 为什么做多模型切换而不是绑定混元——不同赛道最优模型不同
  • 98.4% 功能来自 harness 的结论(引用上篇 MBZUAI 论文)再次印证:工具层比模型层更关键
  • 论文地址:https://arxiv.org/pdf/2607.20911
  • 产品页:https://workbuddybench.com/