TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。
它不是帮你简单生成几段 Appium 脚本,而是让 AI Agent 直接操作 Android 真机或模拟器:理解自然语言测试任务、识别页面、点击控件、跨 Ap...
传统方案会用 Embedding 阈值、Cross-Encoder Reranker,或者再调用一次 LLM 做筛选。
但当能力数量变成 50 个、100 个甚至更多,路由本身就开始成为 Agent Harness 的核心问题。
当 Tool Call 开始真正影响外部系统,Guardrail 就不再只是一个“安全功能”,而是必须被系统测试的一条关键链路。
当 AI 开始直接参与分类、路由、风险判断和业务决策以后,测试工程师要验证的,已经不只是“结果对不对”,还包括:
Jev 发布不到一周,已经被 Vercel AI Gateway、LangChain 等 Agent 基础设施快速接入。
摘要:面向应届生设计一个多语言SDK契约测试项目,用黄金向量验证序列化、错误码和流式取消,比单纯生成客户端更能体现测开能力。
摘要:新版Copilot Review会展示后续才发现的Previously missed问题。本文给出重复运行、变形补丁和问题级召回的稳定性评测方法。
摘要:GitHub 9月18日支持用REST API管理代码覆盖率规则。本文说明怎样把最小覆盖率、最大下降幅度、例外和规则漂移纳入测试。
摘要:Google与Speakeasy开放OpenAPI生成工具后,本文聚焦生成式SDK的质量门:同一规范在不同语言里必须保持序列化、错误、流式取消和版本来源一...
该调用哪个 Tool?加载哪个 Skill?哪些上下文值得保留?这次操作有没有风险?执行结果需不需要人工检查?
看起来没有 ChatGPT、Claude 这类大模型那么“全能”,但如果你真正做过 Agent、RAG 或 AI 测试平台,就会发现:
一个组织有40个仓库。A仓要求覆盖率80%,B仓只要新增代码不下降,C仓因为迁移时临时关过一次门禁,半年后没人记得打开。
第一次评审,AI指出“退款接口缺少幂等键”。开发提交第二版,只改了变量名。再次评审后,这条评论却从待办区消失了。
OpenAI新发布的Agents API让开发者可以直接使用Codex背后的Harness和基础设施,Agent开始真正具备跨小时甚至跨天执行任务的能力。但Ag...
Playwright官方现在已经明确给Coding Agent提供playwright-cli和可安装Skills;GitHub Agentic Workflo...
GitHub最新披露的大规模Rust迁移里,AI Agent写了大部分代码。这会让很多测试工程师紧张:开发都能大批量生成,自动化测试还有价值吗?
团队做了一次看起来无害的优化:把 embedding 模型换成新版本,顺手把分块从 512 改到 1024,理由是「大段落语义更完整」。上线后抽查了几条问答,回...
打开一个迭代的质量看板,会看到一组很矛盾的数字:用例总数比上个季度又涨了一截,需求覆盖率显示 100%,几乎所有功能点后面都挂着一串绿色的对勾。可这个版本上线,...