拒绝背答案?腾讯WorkBuddy Bench如何用真实场景重构AI智能体评测体系

0 阅读

在人工智能大模型迅速迭代的过程中,开发者与研究人员面临着一个新的痛点:如何准确评估模型在真实复杂工作流中的表现?传统的评测基准,如专注于代码修复的SWE-bench或面向前端生成的Design2Code,虽然各有侧重,但彼此割裂,且往往因为题库泄露导致模型通过“背答案”获得虚高分数,难以反映其在生产环境中的真实能力。腾讯近日发布的WorkBuddy Bench,试图打破这一局限,提出了一套横跨代码、网页、办公及安全四大领域的综合评测体系。这一举措不仅重新定义了智能体评测的维度,更在方法论上对“防作弊”与“真实性”进行了深度探索。

从割裂场景到全链路闭环

WorkBuddy Bench的核心创新在于其覆盖范围的广度与场景构建的真实性。不同于以往单一维度的测试,该基准将四个截然不同的工作领域整合在同一框架下:仓库级软件工程(代码)、前端制品生成(网页)、多文件业务流程(办公)以及红蓝队安全对抗。这种设计模拟了一个现代数字员工可能面临的多样化任务图谱。

具体来看,四个子集分别包含80、70、50和60个任务,总计260道测试题。这些题目并非从公开题库中简单改编,而是源于真实的代码提交、拉取请求(PR)或业务场景。研发团队通过“逆向工程”的方式,将这些复杂的工程记录改写为简短、口语化且带有角色扮演色彩的请求。这种构造方式的关键在于,提示词中不包含可被搜索引擎直接索引的PR链接或提交线索,从而从根本上切断了模型通过记忆或网络搜索来获取标准答案的路径。

值得注意的是,腾讯并未公布整个套件的平均分。这是因为四个子集各自拥有独立的验证逻辑,分数维度不可直接横向比较。例如,代码类关注隐藏测试的通过率,网页类依赖规则检查与多模态评判,办公类偏向确定性规则,而安全类则采用纯粹的代码审计评分。这种去中心化的评分策略,反而更贴近真实世界中不同任务类型需要不同评估标准的事实。

构筑防污染的坚固防线

在评测设计中,最大的挑战往往不是题目难度,而是数据集的污染风险。一旦测试集公开,模型极易通过微调或检索机制“记住”答案,导致评测失效。WorkBuddy Bench通过一套严密的机制来抵御这种污染。

首先,任务的构建过程实现了严格的隔离。在任务目录下,工作空间、环境镜像、评估工具、测试用例及参考方案虽已公开,但任务的提示词与最终的评分资产是在智能体运行结束后才引入的。这意味着,在推理过程中,模型全程无法看到评分标准,无法通过逆向推导评分规则来优化输出。

其次,针对安全子集,团队部署了五层反作弊机制,包括禁用字面量扫描、输入重命名、覆盖篡改测试、编码依赖检测以及低权重诱饵投放。安全任务涉及38道红队攻击题和22道蓝队防御题,且白盒审计锚定了binutils、curl、nginx等知名开源项目的真实CVE漏洞。这种高颗粒度的安全测试,确保了模型不仅要能回答问题,更要具备在对抗性环境下的鲁棒性。

此外,评测环境的隔离性也至关重要。所有任务均在沙箱容器中执行,模型与宿主系统完全分离。默认框架采用CodeBuddy Code或Claude Code,上下文窗口扩展至200k,并明确禁用了WebSearch和AskUserQuestion功能。这一设定排除了外部信息获取的干扰,纯粹考察模型自身的推理、规划与执行能力。

角色模拟与信息不对称的真实感

WorkBuddy Bench的另一大亮点在于其对“人”的因素的模拟。任务不仅包含技术指令,还赋予了智能体特定的角色身份。代码任务涵盖了开发者、算法工程师、产品经理、QA和运维五种角色,而安全任务则赋予更专业的安全研究员角色。

更为关键的是,任务提示故意设计了“信息不充分”的情境。模型不会被直接告知目标文件、代码模式或边界条件,而是需要像真实员工一样,通过上下文检索、依赖分析和逻辑推断来重建任务全貌。这种设计极大地提升了评测的信度,因为它测试的不再是简单的指令遵循能力,而是问题解决能力(Problem-Solving)和上下文理解能力。

榜单背后的性能差异与技术启示

基于WorkBuddy Bench的排行榜展示了多家主流模型族的表现,其中分数为0–100的思考模式三次平均值。结果显示,Claude Opus 4.8在代码、网页、办公及安全多个榜单中占据主导,拿下五个第一,显示出其在通用智能任务上的强劲实力。GLM-5.2则在安全领域的两个榜单中登顶,凸显其在安全对抗方面的特定优势;而GPT-5.5则摘得办公类(CC框架)第一。

然而,榜单也揭示了框架敏感性带来的显著影响。安全子集的重排最为剧烈,平均绝对变动达到8.6个点。例如,Claude Opus 4.8在CC框架下拒答了13次,而在CBC框架下仅拒答2次;相比之下,GPT-5.5在CBC框架下仅拒答2次。这表明,不同的推理框架或系统提示词对模型的安全策略和行为边界有着决定性影响。

效率方面,数据同样耐人寻味。GPT-5.5以较少的输出Token数获得了不俗的分数,显示出其较高的推理效率;而DeepSeek-V4-Pro在代码任务中消耗了大量Token并进行了44轮交互,虽然结果可靠,但显得更为“费力”。这种效率与准确性的权衡,对于企业级应用选型具有重要的参考价值。

局限性与未来演进

尽管WorkBuddy Bench在方法论上取得了显著突破,但团队也坦诚地指出了当前的局限性。代码子集仍以Python为主,跨语言支持相对较少,这在一定程度上限制了对多语言生态的评估能力。此外,开源发布本身带来的爬取污染风险,仍需依靠严格的版本管理来缓解。评判器的偏差尚未完全量化,办公类任务偏重文本处理,尚未涵盖OCR与GUI交互,这些均为未来的改进方向。

近期,团队计划校准网页评分标准并扩充公开榜单,以进一步提升评测的覆盖面和准确性。对于希望将“真实工作分布”搬进考场的研究者而言,WorkBuddy Bench已经敞开了一扇门。它不仅提供了一套数据,更提供了一种思路:在AI智能体日益融入核心业务流程的今天,评测体系必须从“做题家”转向“实干家”,从单一技能测试转向复杂场景下的综合素养评估。

随着大模型从通用对话向垂直领域深度渗透,像WorkBuddy Bench这样强调真实性、防污染和多维度的评测基准,将成为衡量AI落地能力的关键标尺。它提醒我们,真正的智能不在于能记住多少知识,而在于能在不确定的环境中,独立、安全、高效地解决未曾见过的问题。