首页
学习
活动
专区
圈层
工具
发布
首页标签AI测试解决方案

#AI测试解决方案

TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

Google 开源 ARTEMIS:AI Agent 如何接管 Android 真机测试?

霍格沃兹-测试开发学社

它不是帮你简单生成几段 Appium 脚本,而是让 AI Agent 直接操作 Android 真机或模拟器:理解自然语言测试任务、识别页面、点击控件、跨 Ap...

000

RAG 不一定需要大模型重排:Jev 能不能做 Context Filtering?

霍格沃兹-测试开发学社

传统方案会用 Embedding 阈值、Cross-Encoder Reranker,或者再调用一次 LLM 做筛选。

000

Tool、MCP、Skill 越来越多,Jev 能解决 Agent 路由吗?

霍格沃兹-测试开发学社

但当能力数量变成 50 个、100 个甚至更多,路由本身就开始成为 Agent Harness 的核心问题。

000

Jev 进入 Agent Guardrail:高风险 Tool Call 该怎么测?

霍格沃兹-测试开发学社

当 Tool Call 开始真正影响外部系统,Guardrail 就不再只是一个“安全功能”,而是必须被系统测试的一条关键链路。

200

Jev 与概率校准:AI 决策系统该怎么测试?

霍格沃兹-测试开发学社

当 AI 开始直接参与分类、路由、风险判断和业务决策以后,测试工程师要验证的,已经不只是“结果对不对”,还包括:

800

Jev 发布不到一周,为什么它这么快进入 Agent 工程?

霍格沃兹-测试开发学社

Jev 发布不到一周,已经被 Vercel AI Gateway、LangChain 等 Agent 基础设施快速接入。

300

秋招项目生成了Python、Java两套SDK,面试时怎样证明它们不是“都能跑,但结果不同”?

霍格沃兹-测试开发学社

摘要:面向应届生设计一个多语言SDK契约测试项目,用黄金向量验证序列化、错误码和流式取消,比单纯生成客户端更能体现测开能力。

2600

同一份PR重跑三次,AI评审每次都发现新问题:这是能力增强,还是结果不稳定?

霍格沃兹-测试开发学社

摘要:新版Copilot Review会展示后续才发现的Previously missed问题。本文给出重复运行、变形补丁和问题级召回的稳定性评测方法。

2810

GitHub把覆盖率门禁开放给API后,最先暴露的可能不是低覆盖,而是各仓库标准完全不同

霍格沃兹-测试开发学社

摘要:GitHub 9月18日支持用REST API管理代码覆盖率规则。本文说明怎样把最小覆盖率、最大下降幅度、例外和规则漂移纳入测试。

3010

SDK生成器已经开源,最难的却不是“能不能生成”:六种语言怎样证明行为一致?

霍格沃兹-测试开发学社

摘要:Google与Speakeasy开放OpenAPI生成工具后,本文聚焦生成式SDK的质量门:同一规范在不同语言里必须保持序列化、错误、流式取消和版本来源一...

2710

Agent Harness 又要多一层?Jev 开始接管这些高频判断

霍格沃兹-测试开发学社

该调用哪个 Tool?加载哪个 Skill?哪些上下文值得保留?这次操作有没有风险?执行结果需不需要人工检查?

3310

Agent 里为什么不该什么都交给大模型?Jev 给了一个新答案

霍格沃兹-测试开发学社

看起来没有 ChatGPT、Claude 这类大模型那么“全能”,但如果你真正做过 Agent、RAG 或 AI 测试平台,就会发现:

14310

GitHub把覆盖率门禁开放给API后,最先暴露的可能不是低覆盖,而是各仓库标准完全不同

霍格沃兹-测试开发学社

一个组织有40个仓库。A仓要求覆盖率80%,B仓只要新增代码不下降,C仓因为迁移时临时关过一次门禁,半年后没人记得打开。

3000

Copilot会自动关闭自己提过的问题:AI代码评审最该测的,变成了“它为什么消失”

霍格沃兹-测试开发学社

第一次评审,AI指出“退款接口缺少幂等键”。开发提交第二版,只改了变量名。再次评审后,这条评论却从待办区消失了。

2310

OpenAI把Codex Harness开放出来后,我反而更关心一个问题:Agent连续跑几天,到底该怎么测?

霍格沃兹-测试开发学社

OpenAI新发布的Agents API让开发者可以直接使用Codex背后的Harness和基础设施,Agent开始真正具备跨小时甚至跨天执行任务的能力。但Ag...

9400

Playwright突然开始推CLI + Skills:AI写UI测试,为什么反而不想给Agent塞一堆MCP Tool了?

霍格沃兹-测试开发学社

Playwright官方现在已经明确给Coding Agent提供playwright-cli和可安装Skills;GitHub Agentic Workflo...

8600

AI写代码越来越快,测试工程师还在比“一天写多少用例”吗?

霍格沃兹-测试开发学社

GitHub最新披露的大规模Rust迁移里,AI Agent写了大部分代码。这会让很多测试工程师紧张:开发都能大批量生成,自动化测试还有价值吗?

5700

常青翻新|给 RAG 检索层建一份『金标准问答集』:换 embedding、改分块,也别让召回悄悄塌下去

霍格沃兹-测试开发学社

团队做了一次看起来无害的优化:把 embedding 模型换成新版本,顺手把分块从 512 改到 1024,理由是「大段落语义更完整」。上线后抽查了几条问答,回...

7410

资深测试工程师越来越少写『全覆盖用例』,而是先画一张风险地图:Risk-Based Testing 到底怎么落地

霍格沃兹-测试开发学社

打开一个迭代的质量看板,会看到一组很矛盾的数字:用例总数比上个季度又涨了一截,需求覆盖率显示 100%,几乎所有功能点后面都挂着一串绿色的对勾。可这个版本上线,...

2810

相关产品

  • AI测试解决方案

    TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

领券