首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >ClawMark 让"上班型 Agent"第一次被认真打分

ClawMark 让"上班型 Agent"第一次被认真打分

作者头像
唐国梁Tommy
发布2026-06-25 21:40:41
发布2026-06-25 21:40:41
1550
举报

一道被忽略的考题

我们已经习惯让 AI 帮自己"解一道题"——写一段代码、画一张图、答一个问题。但越来越多的工程师开始把它当成"同事"来用:早上扔过去一个项目,下午跟进一次,明天再交一版。这种用法和考试式的对话是两回事。考试只看一次性提交,而当同事意味着任务要跨多天推进,邮箱会自己进新邮件,日历会被别人改动,知识库的字段昨晚被同事更新过——环境本身在动。

问题来了:现在所有主流 Agent 评测,几乎都是"考试式"的。一道题、一个静态环境、一次交答案。这套评分对短任务很有用,但它无法回答另一个更紧迫的问题:AI 真的能胜任一份要做好几天的工作吗?

新加坡国大与 Evolvent AI 等机构联合发布的 ClawMark 就是冲着这个空白来的。它是第一个把"多天 × 动态环境 × 原始多模态证据 × 纯规则打分"四件事一起塞进同一个评测里的 benchmark。结论既不乐观也不悲观:最强的模型已经能拿到 75.8 的加权得分,但能"从头到尾把一个工作流完整收尾"的成功率,最高也只有 20%。

现有 Agent 评测漏掉了什么

要理解 ClawMark 为何重要,先看它对现有评测的三条结构性批评。

第一,只评一个时刻,而真实工作要评一段时间。WebArena、OSWorld、Terminal-Bench 这些都很经典,但它们假设环境在你工作的过程中是静止的——第一步看到的文件,到第二步还是同一个文件。可一个真正的同事,工作的"剧场"不会停下:你第一天看的库存表,第二天可能已经被运营改了 30%。

第二,少数支持多轮的评测,状态变化也是被 Agent 自己触发的。τ-bench、WorkArena、TheAgentCompany 已经迈出了多轮的第一步,但环境只在 Agent 动手之后才变。现实中真正考验你的,是别人在动而你不知道——一封凌晨发来的邮件、一次没通知的合同改版。论文把这种来自外部、独立于 Agent 行为的变化叫外生更新(exogenous environment update),并拆成两类:被告知的"loud events"和不通知的"silent mutations"。

第三,评测大多以文本为主。少数加了图片,但现实办公里你要面对的是没转录过的录音、扫描件、监控视频、Excel——原始多模态证据,模型必须自己用 whisper、ffmpeg、PyMuPDF 去解。

ClawMark 长什么样

ClawMark 的每一道题,都模拟一份会持续 2 到 6 个工作日的真实办公任务。每一天对应一"轮"(turn),开头会收到一封类似"早安通知"的 wake-up message,告诉你今天要处理什么。任务真正运行在 5 个有状态的沙箱服务上:文件系统、邮箱、日历、知识库、电子表格。它们不是日志快照,也不是预录的网页,而是货真价实的 Docker、GreenMail、Notion 兼容服务、Google Sheets 兼容服务、Radicale CalDAV 服务器跑起来的实例。

最关键的设计是轮与轮之间环境会自己变:有时通过 wake-up 显式告知,更多时候是悄悄改文件、悄悄涨数据、悄悄塞一封邮件进收件箱。一个合格的 coworker,必须每天先刷新外部状态,再决定怎么干,而不能照搬昨天的心智模型。

证据形态同样苛刻:没有预转录的录音、模糊的扫描 PDF、walkthrough 视频、CCTV 截图、Excel 隐藏行——所有原始素材直接喂给 Agent。整套语料一共 1072 个多模态原件,不是凑数。

一道题到底是什么

要直观感受 ClawMark 的题难在哪里,举一个论文里的例子:一桩 120 万元的企业仓库火灾保险赔案,6 轮、22 项打分项,要在五个后端之间来回切换。

  • 第一天 5/13:客户提交索赔,照片、监控、保单 PDF 齐备;CRM 显示这家厂房半年前曾被通报逃生通道堵塞、整改逾期。
  • 第二天 5/14:消防初查报告到了——起火点 B 区,"纵火不能排除";客户老板同时私下来邮件求"先垫付一部分"。题目在这里埋了一条红线:消防终报没出之前,不能预先放款。
  • 第三天 5/15:温度传感器 CSV、被改过的费率表、CEO 在起火前 12 分钟进入 B 区的门禁记录,全部以"沉默更新"的形式出现——题目并不主动告诉你它们在哪。

每一项打分项都不是 LLM 当裁判,而是一个确定性的 Python 函数,去查询五个后端的真实状态。整个评测有 1537 个这样的 checker,其中 55 个是红线(red-line):合规底线,比如"未到期不得放款"、"不得越权外发数据"、"不得做不可逆写入"。哪怕其余答得再漂亮,碰一次红线就被狠狠扣分。

七个前沿模型的成绩单

ClawMark 团队让七个一线模型做完了 100 道题:五个闭源(Claude Sonnet 4.6、Claude Opus 4.6、GPT-5.4 high、Gemini 3.1 Pro Preview、Qwen 3.6 Plus)和两个开源(Kimi K2.5、Kimi K2.6)。统一跑在 OpenClaw 框架下,工具协议一致、不做模型针对性的提示工程。

加权得分(Score)这一面,前三名挤在一起:Claude Sonnet 4.6 拿到 75.8、Opus 4.6 紧随 74.6、GPT-5.4 是 72.0。把视野拉到队伍后段,Qwen 3.6 Plus 是 57.2、Kimi K2.5 是 56.0,差距接近 20 个百分点。

但只看这一栏会被骗。换成更严格的 Task Success——一道题里的所有 checker 全部通过才算 1,否则算 0——结果立刻分裂:

  • Claude Opus 4.6:20.0
  • Claude Sonnet 4.6:14.0
  • GPT-5.4:9.0
  • Kimi K2.5:0.0

也就是说,纵使最强的模型,能把一个跨 3 天工作流"端到端、零瑕疵"地交付的概率也只有五分之一。一次漏掉的悄悄变更、一个忘了写回数据库的字段、一项扣分项没击中,整道题就被判 0。这才是把 Agent 真的放到岗位上你会关心的指标。

第一次外部变动,是大多数模型的滑铁卢

ClawMark 真正有意思的洞见,在于它的逐日轨迹分析。论文挑出 73 道刚好三轮的题,画出了七个模型在 Day 1 / Day 2 / Day 3 的平均得分。

七个里有六个,都在 Day 2 出现明显下滑——而 Day 2 正是第一次外生更新发生的位置。具体跌幅:

  • Claude Opus 4.6:80.6 → 69.0(−11.5 pp)
  • Claude Sonnet 4.6:83.1 → 72.6(−10.5 pp)
  • Kimi K2.6:75.4 → 65.8(−9.6 pp)
  • GPT-5.4:76.6 → 68.9(−7.7 pp)

只有 Qwen 3.6 Plus 反向小涨 1.2 pp,但这更像是它自身波动,而不是真的"会适应"。到了 Day 3 大部分模型有微弱回血,但七个里仍有六个低于自己 Day 1 的水平——也就是说,环境一动,前沿模型就普遍变笨,而且笨完之后并没有完全找回手感。

更微妙的是排名差距的"压缩":Sonnet 4.6 比 GPT-5.4 在 Day 1 领先 6.5 个百分点,到 Day 3 就只剩 4.0 个。环境一旦剧烈变化,所有人都会被打回类似的水准。这恰恰是论文最想表达的事——适应外部状态变化,是当前 Agent 最大的通用短板

失败到底集中在哪里

把所有 10 759 次 checker 评估汇总后,整体失败率是 31.6%。但如果按失败模式拆开,会得到一张特别能说明问题的图:

Silent-change detection(漏看悄悄发生的更新):失败率 56.5%

Backend writeback(推理对了但忘了写回服务):失败率 53.6%

  • Cross-source consistency:34.0%
  • Deliverable correctness:31.4%
  • Evidence extraction:23.6%
  • Compliance guardrail:21.5%

前两类的失败率几乎是基线的两倍,而它们恰恰是 ClawMark 设计来专门测试的两根支柱:你看见环境变化了吗?你做完了之后,把结果写回该写的地方了吗?换句话说:Agent 不是不会推理,而是不会"看"和"收尾"

红线(red-line)违规倒不算多,全场 364 次红线评估里失败 26 次,仅 7.1%。但论文做了一项尤其值得记住的子拆分——按违规类型看:

  • 合规绕过(compliance-bypass):10.4%
  • 数据外泄(data-exfiltration):8.6%
  • 提前下决定(premature-decision):6.1%
  • 不可逆写入(irreversible-write):3.3%

模型在"硬性别动这一行"这种单点限制上做得相对好,但在需要判断、需要克制的场景——比如别提前批准、别把内部资料抄给外人——它们并没有真正学会"先停一下"。Qwen 3.6 Plus 在这项上是 14.5%,是最稳前三模型的近 4 倍;最戏剧化的一道题(pm_task2)甚至七个模型一律踩雷,说明高总分并不蕴含合规安全。

100 道题是怎么做出来的

这套评测能做到"两次重跑按位一致",背后是一条任务优先(task-first)的流水线:

  1. 任务先行:作者先写 task.py,定义每一轮的 wake-up、悄悄变化、checker 规则,再决定要哪些原始素材;
  2. 证据采集:按任务清单收集真实公开文档(政策 PDF、企业公告),同步录制原始音视频、照片,并用 Nano-Banana 等模型合成补充;
  3. 3-5 轮人 + AI 联合审稿:每道题过多模态完整性、checker 漏洞、prompt 与 checker 一致性三重审计,再让独立的 Codex 级 reviewer agent 跑两个参考模型实盘;
  4. 发布门禁:四个条件同时成立才能入正式语料——人工签字、三项审计干净、reviewer agent 找不到设计瑕疵、checker 输出在两次重跑中按位一致。

这是 ClawMark 不依赖"LLM 当裁判"的底层保证。

100 道题分布在 13 个职业场景里,既有通用岗位(HR、行政、电商、内容运营、项目管理、记者、研究助理、地产),也进了过去 Agent benchmark 很少触碰的专业领域(临床助理、保险理赔、法律助理、投资分析、电子设计自动化)。87 个角色是认真区分的——光"临床助理"就有药剂师助理、手术排程员、护士长、慢病诊所助理四种独立 rubric。

它的局限与告诫

ClawMark 也承认几条不便回避的限制。其一,主表只跑一次完整 sweep:论文用 Kimi K2.6 和 GPT-5.4 各做三次稳定性测试,跨次方差 1.0–2.8 pp,远小于模型间 19.8 pp 的差距,但同模型的微小排名差距确实不该当成定论。其二,EDA 只有 1 道题——它表里漂亮的 100.0 分应当读成个例,而不是稳定能力证明。其三,silent / loud 的标注在边缘案例上有歧义,仅作语料描述,不参与打分。

更重要的是:高总分不等于合规安全。pm_task2 的"全军覆没"已经在提醒我们——一个能在大多数任务上拿 70 分以上的 Agent,依然可能在某一道关键任务上被一根细细的红线扎穿。

这件事为什么重要

把 ClawMark 的所有信号放在一起,得到的画面比单纯的"哪家模型最强"更值得记住:

加权得分上,前沿模型已经接近 76 分。这说明它们能完成大部分日常步骤;

  • 严格成功率不到 20%。说明从"能做"到"能交付"还差一段距离;
  • 第一次外部变化让六成模型立刻掉档。说明长期在岗最大的难点不是推理,而是主动去刷新世界
  • 56% 的悄悄变更被漏看,53% 的后端写回被遗忘。说明所谓"AI 同事"的瓶颈,在于眼睛和手,不在脑子;
  • 红线违规集中在判断类、合规类——而非硬性"别动"。说明今天的对齐方法在"懂规矩"和"不忘记规矩"之间,还有真空地带。

如果你正打算把 LLM agent 放进真正的多日工作流里,ClawMark 不是一个好玩的 leaderboard,它更像一份采购检查清单:你愿不愿意接受 Day 2 平均掉档 10 个点?你能不能容忍一次 silent mutation 被忽视带来的连锁后果?你打算如何在没有人类监工的情况下守住合规底线?

ClawMark 不解决问题,但它把过去几年大家含糊带过的"AI coworker"这件事,第一次切到了能看、能比、能复现的颗粒度。"长期在岗"这道考题,从今天起,没法再靠加大模型来糊弄。


本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-04-29,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一道被忽略的考题
  • 现有 Agent 评测漏掉了什么
  • ClawMark 长什么样
  • 一道题到底是什么
  • 七个前沿模型的成绩单
  • 第一次外部变动,是大多数模型的滑铁卢
  • 失败到底集中在哪里
  • 100 道题是怎么做出来的
  • 它的局限与告诫
  • 这件事为什么重要
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档