爆火的腾讯WorkBuddy发了篇论文,公开了自家底牌
- URL: https://mp.weixin.qq.com/s/wJaS0G69mm-DJEn7ItUJ_g
- Date Saved: 2026-08-10
- Source: WeChat (PaperAgent)
- Tags: ai-engineering, ai-tools
Summary
腾讯 WorkBuddy 团队开源了内部用于模型选型的评测基准 WorkBuddy Bench,包含四大赛道(Code/Web/Office/Security),揭示了其多模型切换架构的决策依据。
核心发现
- 没有全能冠军:Claude Opus 4.8 拿 5 块榜(Code 双榜、Web 双榜、Office cbc),GLM-5.2 以开源模型身份拿下 Security 双榜,GPT-5.5 拿 Office cc
- Harness 敏感性极强:换 harness 后排名直接洗牌(Security 赛道七模型平均位移 8.6 分)
- GPT-5.5 是全场最省 token 的高分者(输出量远小于其他模型但分数接近或领先)
- 花钱多 ≠ 分数高:DeepSeek-V4-Flash 输出量是 GPT-5.5 的 3.3 倍,分数却低 14.74 分
四大赛道设计亮点
- Code(80 任务):只有 10 个是修 Bug,五种角色(开发者/算法工程师/PM/QA/运维)+ 18 细分类目;刻意欠规格,Agent 必须自己从仓库找上下文
- Web(70 任务):artifact-not-chat 契约——路径下没有可运行工件就是零分
- Office(50 任务):评最终工作区状态而非答案文本,双通道评分(Rule checks + LLM Judge)
- Security(60 任务):全程无 LLM 裁判 + 五层反作弊,红蓝队全景覆盖,复现真实 CVE
方法论亮点
- 任务来源锚定真实上游工件(开源 commit/PR、真实 CVE),不含用户 prompt
- 抗污染设计:改写成口语化、欠规格请求,搜索引擎无法匹配
- 双 Harness 评分(cbc + cc),刻意不报总平均分
关键洞察
- 这解释了 WorkBuddy 为什么做多模型切换而不是绑定混元——不同赛道最优模型不同
- 98.4% 功能来自 harness 的结论(引用上篇 MBZUAI 论文)再次印证:工具层比模型层更关键
- 论文地址:https://arxiv.org/pdf/2607.20911
- 产品页:https://workbuddybench.com/