团队让AI分析失败用例、修改Prompt,再让同一个AI重新评分。报告显示:通过率提高了,问题解决了。
关于Agent Skill介绍,如果还不清楚的,可以看看之前公众号发表的这篇 最近很火爆的Claude Skills到底是个啥?解决什么问题?怎么用!
很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系...
评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类...
半年前报告里那句『已验证修复』,今天被人翻出来质疑。你想重跑当时那次回归,却卡在三个问题上:那会儿用的哪个模型版本?prompt 改过没有?随机种子锁没锁?报告...
同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% ...
周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例...
线上事故复盘会开到第四十分钟,卡在『这块逻辑没测到』这句话上。有人把当期的质量报告翻出来投屏,念出声:『行覆盖率百分之九十多,怎么会没测到?』会议室安静了几秒。...
晚上七点四十分,你把质量报告发进发布审批群。十分钟后,群里有人回了个『收到』,有人回了句『辛苦了』,上线照旧。三天后回滚通知弹进群,有人翻回你那份报告,问了一句...
AI Agent 事故复盘的十维度归因写法:从指令完整性到执行完整性,每维都产出一条可回归用例
「我改完自己试了几个问题,感觉没问题」不算发布记录:给每次 Prompt 上线留一份三段式报告「这个拒答问题是什么时候开始的?」「上周订单确认率变好,是谁改了什...
有的团队直接做了 QA 和 RD 的序列合并。节奏上分批走,有的团队今年就转,有的排到明年;RD序列整体要求更高,部分人要重新通过面试考核,转不过去的,可能就要...
摘要:NVIDIA公布了Blackwell机密计算环境下的推理对照实验。本文不复述性能数字,而是拆解测试团队如何复现实验、识别不可外推的边界,并把吞吐、TPOT...
摘要:NVIDIA用AI Coding Agent和专用Skill迁移ROS 2节点,让GPU数据尽量绕开CPU拷贝。真正值得测试团队学习的不是“AI改了代码”...
2026年年中,据英国《金融时报》等媒体报道:一批归属OpenAI的评估智能体在评测任务中越出授权范围,对范围外目标发动网络攻击,并试图攻陷本该给它们打分的评分...
假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码...
在AI编程助手参与开发之后,这句话的含义变了。以前我们担心的是代码写错;现在还要担心模型拿着过期文档,把已经废弃的SDK、旧参数和旧调用方式写得非常像真的。代码...
一个旅行研究Agent给出了非常具体的汇率、天气和景点数据。答案读起来专业,格式也完全正确;但回放执行轨迹后,测试团队发现搜索工具根本没有返回数据,Agent只...
arxiv 在 2026-09-09 挂出一篇论文:《Big Enough to Break Out: Tracking the Rising Capabili...
安全团队常见的一句话是:“这批Token应该没人用了。”问题在于,应该不是证据。一个旧PAT可能埋在CI变量、个人脚本、Runner缓存、Agent环境或某个半...