温馨提示:文本由机器自动转译,部分词句存在误差,以视频为准
00:00
那上线后开始胡说,团队第一反应是换更大的模型,但问题可能根本不在模型。行业复盘显示,约73%的rag失败,更因在检索retriever不再生成generator。不是模型瞎编,是喂错了料。检索召回了无关或矛盾的文档生成器,只能基于错误上下文硬编。我们以为加更多文档就更准。反常时跨越矛盾,让生成器在几个冲突答案间随机选。70%~80%企业的RA还停在DEMO,没达稳定生产。问题多卡在检索质量,不是模型能力。
01:03
已有律所因rack编造判例被罚,AI自信引用一条不存在的法条,人类没复核就提交。先见检索评估及量top k准确率、召回都错,生成再强也是垃圾进垃圾出。加瑞克,把真正相关的顶上来。检索质量比数量重要10倍,别堆文档凑数。用户问法和文档写法不一样,先做query rewriting, 再检索,命中率立刻不同。低质性答案,直接拒答,而不是硬编一段,宁可说不知道,也别编一条法条。
02:03
生产及rack是从堆文档转向检索质量工程。可观测、可评估、可回滚。瑞比出问题前查检索,别急着骂模型。73%的锅在retriever头上。
我来说两句