参考资料
可信的 RAG 评估集
RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。
评估五元组
问题 + 类别 + 预期来源 + 必需事实 + 预期行为
对于可回答的问题,系统应给出有证据依据的正确答案;对于不可回答的问题,系统应拒答。
优质评估集测试什么
| 维度 | 重要性 | Meridian 演示 |
|---|---|---|
| 事实查找 | 查找精确的数字、名称、日期或要求。 | 35 道题 |
| 引用查找 | 查找准确的 SOP 或文档编号。 | 7 道题 |
| 多跳 | 汇总来自多个文档的证据。 | 9 道题 |
| 跨语言 | 将问题与用另一种语言编写的来源匹配。 | 5 道题 |
| 缩略词 | 解析领域术语和缩写。 | 3 道题 |
| 不可回答 | 衡量系统是否拒答,而不是奖励幻觉。 | 6 道题 |
真实标准规则
- 每个预期来源都必须存在于语料库中。
- 每个必需事实都必须以原文形式出现在预期来源中。
- 不可回答的问题既不能有预期来源,也不能有必需事实。
- 根据元数据匹配检索来源,而不是根据片段中的任意文本匹配。
- 比较系统改动时,保持评估集不变。
不合格的测量
不能仅因为向量结果的片段文本提到了预期文档编号,就把它算作命中。
更好的测量
只有当来源元数据标识出预期文档时,才能将其算作命中。
信任边界
评估工具即使存在错误,也可能输出看起来很有把握的百分比。因此要用重音符号、多来源问题、正文交叉引用、缺失引用和拒答来测试评分器本身。