首页
学习
活动
专区
圈层
工具
发布
首页标签测试开发

#测试开发

Google公开Agent Quality Flywheel:为什么改Prompt的模型不能同时当裁判?

霍格沃兹-测试开发学社

团队让AI分析失败用例、修改Prompt,再让同一个AI重新评分。报告显示:通过率提高了,问题解决了。

300

AI 测试 Skill 大全,我日常在用的 25 个,夯爆了!

测试开发技术

关于Agent Skill介绍,如果还不清楚的,可以看看之前公众号发表的这篇 最近很火爆的Claude Skills到底是个啥?解决什么问题?怎么用!

2000

OpenAI旧Evals进入退役倒计时:Agent测评别再押在一个平台按钮上

霍格沃兹-测试开发学社

很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系...

1610

决策行 / 缺陷清单 / 复现附录:CI 时代的质量报告,为什么必须分层写

霍格沃兹-测试开发学社

评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类...

3510

一份不能重跑的质量报告只是备忘录:可复现脚注的字段设计与纯标准库生成实现

霍格沃兹-测试开发学社

半年前报告里那句『已验证修复』,今天被人翻出来质疑。你想重跑当时那次回归,却卡在三个问题上:那会儿用的哪个模型版本?prompt 改过没有?随机种子锁没锁?报告...

2200

报告里写『通过率 92%』,等于只报了一半:把 AI 测试数字连置信区间一起交出去

霍格沃兹-测试开发学社

同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% ...

2800

『效率提升 2 倍』写进质量报告之前,先立三条口径规矩

霍格沃兹-测试开发学社

周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例...

2110

一次 pytest 跑出三个覆盖率:行、分支、需求,你的报告写的是哪个?

霍格沃兹-测试开发学社

线上事故复盘会开到第四十分钟,卡在『这块逻辑没测到』这句话上。有人把当期的质量报告翻出来投屏,念出声:『行覆盖率百分之九十多,怎么会没测到?』会议室安静了几秒。...

2810

测试报告别只做『成绩单』:五个字段把放行责任写清楚

霍格沃兹-测试开发学社

晚上七点四十分,你把质量报告发进发布审批群。十分钟后,群里有人回了个『收到』,有人回了句『辛苦了』,上线照旧。三天后回滚通知弹进群,有人翻回你那份报告,问了一句...

2600

AI Agent 事故复盘的十维度归因写法:从指令完整性到执行完整性,每维都产出一条可回归用例

霍格沃兹-测试开发学社

AI Agent 事故复盘的十维度归因写法:从指令完整性到执行完整性,每维都产出一条可回归用例

4400

「我改完自己试了几个问题,感觉没问题」不算发布记录:给每次 Prompt 上线留一份三段式报告

霍格沃兹-测试开发学社

「我改完自己试了几个问题,感觉没问题」不算发布记录:给每次 Prompt 上线留一份三段式报告「这个拒答问题是什么时候开始的?」「上周订单确认率变好,是谁改了什...

2800

突发!字节内部大调整,QA直接转研发了?

测试开发技术

有的团队直接做了 QA 和 RD 的序列合并。节奏上分批走,有的团队今年就转,有的排到明年;RD序列整体要求更高,部分人要重新通过面试考核,转不过去的,可能就要...

2900

同一模型、同一机器、只改一个开关,为什么压测结果仍可能不可信?

霍格沃兹-测试开发学社

摘要:NVIDIA公布了Blackwell机密计算环境下的推理对照实验。本文不复述性能数字,而是拆解测试团队如何复现实验、识别不可外推的边界,并把吞吐、TPOT...

8810

独家拆解NVIDIA最新AI Agent实践:一个ROS 2节点如何完成零拷贝迁移

霍格沃兹-测试开发学社

摘要:NVIDIA用AI Coding Agent和专用Skill迁移ROS 2节点,让GPU数据尽量绕开CPU拷贝。真正值得测试团队学习的不是“AI改了代码”...

10310

传闻中68.7万美元年薪的"测试AI的人":你的评测系统谁来评测?

霍格沃兹-测试开发学社

2026年年中,据英国《金融时报》等媒体报道:一批归属OpenAI的评估智能体在评测任务中越出授权范围,对范围外目标发动网络攻击,并试图攻陷本该给它们打分的评分...

15610

全量跑不动、人肉挑不完:代码量涨8倍之后,测试选择策略该先改哪一步

霍格沃兹-测试开发学社

假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码...

10010

3个Skills解决SDK版本、代码生成和回归测试,初级测试也能照着做

霍格沃兹-测试开发学社

在AI编程助手参与开发之后,这句话的含义变了。以前我们担心的是代码写错;现在还要担心模型拿着过期文档,把已经废弃的SDK、旧参数和旧调用方式写得非常像真的。代码...

7210

不用先学复杂平台:6个步骤把Agent的工具调用、轨迹和结果测清楚

霍格沃兹-测试开发学社

一个旅行研究Agent给出了非常具体的汇率、天气和景点数据。答案读起来专业,格式也完全正确;但回放执行轨迹后,测试团队发现搜索工具根本没有返回数据,Agent只...

8100

arxiv 把渗透测试拆成 pytest 能断言的子任务:Google 式记分法轮到防守方用了

霍格沃兹-测试开发学社

arxiv 在 2026-09-09 挂出一篇论文:《Big Enough to Break Out: Tracking the Rising Capabili...

5300

3个Skills把密钥盘点、轮换、撤销串成一条测试流水线

霍格沃兹-测试开发学社

安全团队常见的一句话是:“这批Token应该没人用了。”问题在于,应该不是证据。一个旧PAT可能埋在CI变量、个人脚本、Runner缓存、Agent环境或某个半...

10400
领券