2026年7月24日,腾讯正式推出面向编码智能体的多领域评测套件WorkBuddy Bench,相关研究论文已发布于预印本平台arXiv。该套件整合代码、网页、办公、安全四大工作场景共260个真实业务衍生任务,从设计根源杜绝智能体“背答案”问题,可精准衡量编码智能体的通用能力与跨场景迁移能力,填补了行业此前评测场景割裂、基准不透明的空白。随着编码智能体进入规模化落地阶段,评测失真的问题已经成为制约行业发展的核心瓶颈之一。过去业内对编码智能体的评测始终处于分散状态:测代码修复能力依赖SWE-bench,测前端生成能力参考Design2Code,面向生产环境的评测基准大多闭源不可审计,不同维度的评测结果很难交叉验证,也无法反映智能体在真实办公场景下的综合表现。不少厂商甚至专门针对公开题库做定向优化,导致评测结果和实际落地效果出现明显断层。本次发布的WorkBuddy Bench核心优势并不在于任务规模,而在于完全独立的任务生成逻辑,相关研究成果已同步上传至预印本平台arXiv,所有评测规则完全公开可审计。 整套基准覆盖仓库级软件工程、前端制品生成、多文件办公自动化、红蓝队安全攻防四大核心工...