首页
学习
活动
专区
圈层
工具
发布
首页标签模型测试

#模型测试

8个AI测试基准模型介绍和横向对比

A小码哥

随着 AI 模型能力的快速演进,基准测试(Benchmark)也从简单的单一维度评估转向多元化的能力测评。本文横向对比 8 个独立的 Benchmark,帮助开...

100

6 份企业文档交给 AI 审计,连无文字流程图都被拿捏了!

Neolnfra

先把几个硬数字放前面,没时间的朋友看完这段就可以走了。这次扛大梁的模型是 Seed-2.1-pro-0915,我冲的就是它的视觉理解和 Agent 工具调用,这...

7420

算法模型进入生产环境后的版本治理:qModel 开源算法模型平台如何实现模型版本管理与迭代控制

吴同

在模型规模较小的阶段,团队可能通过文件目录、版本命名或者人工记录维护不同模型版本。但随着模型数量增加、迭代频率提升,这种方式逐渐难以满足企业级模型管理需求。

13110

AI越来越强了,为什么测试人反而越来越累!(为打工人发声)

测试开发技术

AI 的能力这两年是肉眼可见地变强了。写代码、画原型、出文档,以前要一个团队分头做的事,现在一个人带着几个 AI 就能全部包揽,工作产出抵得上从前的一个小团队。...

17810

#WorkBuddy#白嫖免费模型也是需要技巧的

A股狂魔

我在 WorkBuddy 上挂了一堆定时任务(automation):A 股数据每天增量更新、盘前晨检、第二数据源交叉校验、波段策略每晚训练、社群选股池……前前...

37810

三维模型减面工具横向实测:10组样本多软件对比记录

斯裕科技

很多三维从业者日常会直接使用3dsMax、Blender、Maya、虚幻引擎自带的减面工具或插件完成模型轻量化。但在处理高面数大模型、CAD装配体、带骨骼/贴图...

8800

qModel 开源算法模型平台v1.4.2 模型版本管理:支持版本创建、对比、切换与回滚

吴同

随着参数调整、数据变化、算法优化和业务规则更新,同一个模型会不断产生新的版本。如果仍然主要依赖文件名、目录或人工记录进行管理,随着版本数量增加,容易出现版本关系...

9610

RAG评测指标

质量保障小乔

RAG 评测指标按照「检索层-生成层-端到端层-工程层-专项安全层」五层架构拆解,覆盖从底层组件能力到最终业务价值的全链路;按评测方式可分为客观量化指标、LLM...

17510

Agent 评测报告模板

质量保障小乔

【填写说明:明确本次评测核心目标,例如验证新版本工具调用优化效果、评估端到端任务达标率、对比两个模型版本的能力差异、排查线上失败案例根因】

13810

大模型幻觉测试

质量保障小乔

本方法为企业级可落地的全流程幻觉测试体系,融合学术界权威基准与工业界工程实践,覆盖从口径定义、用例设计、自动化执行、量化打分到归因优化的完整闭环。

14510

【面试题】RAG相关面试题

质量保障小乔

首先明确:RAG领域没有官方统一命名的“命中率”术语,行业通常所说的「命中率」默认指检索命中率(Hit Rate),是信息检索领域的经典指标。

11510

基于 LangSmith Traces 的 RAG 分层评测方案

质量保障小乔

本方案基于 LangSmith 原生 Trace 数据结构,遵循分层解耦、全链路可追溯、指标可量化的原则,将 RAG 评测拆解为检索层、生成层、端到端层三个层级...

11610

AI测试核心问题

质量保障小乔

通过故意破坏输入条件,验证AI生成用例的抗干扰能力,避免“输入稍微变就生成废用例”。

13010

Agent 评测方法、工具和指标体系

质量保障小乔

Agent 评测不能只看“最终回答对不对”,而要同时评估:是否正确理解任务、规划是否合理、工具是否正确调用、环境状态是否真正改变、失败时是否恢复、安全边界是否守...

47410

LLM / RAG / Agent 的评估工具

质量保障小乔

LLM RAG Agent 三类场景的评估工具对比,按“工具→定位→核心能力→适用场景”结构化呈现。

19410

HAR文件如何辅助RAG评测

质量保障小乔

HAR(HTTP Archive),是W3C事实标准的HTTP会话存档文件,本质是JSON格式,完整记录一次会话下全部HTTP/HTTPS请求与响应全量数据。

17410
领券