沈毅全栈与 AI

巴黎 • 新加坡 • 上海

RAG Formation · 参考资料

可信的 RAG 评估集

在本网站学习和测试 RAG 质量的独立速查表。

$ reference --status
▸ 课程 RAG Formation
▸ 模式 独立参考资料
▸ 状态 已完成
● 学习 → 测试 → 验证

参考资料

可信的 RAG 评估集

RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。

评估五元组

问题 + 类别 + 预期来源 + 必需事实 + 预期行为

对于可回答的问题,系统应给出有证据依据的正确答案;对于不可回答的问题,系统应拒答。

优质评估集测试什么

维度重要性Meridian 演示
事实查找查找精确的数字、名称、日期或要求。35 道题
引用查找查找准确的 SOP 或文档编号。7 道题
多跳汇总来自多个文档的证据。9 道题
跨语言将问题与用另一种语言编写的来源匹配。5 道题
缩略词解析领域术语和缩写。3 道题
不可回答衡量系统是否拒答,而不是奖励幻觉。6 道题

真实标准规则

  1. 每个预期来源都必须存在于语料库中。
  2. 每个必需事实都必须以原文形式出现在预期来源中。
  3. 不可回答的问题既不能有预期来源,也不能有必需事实。
  4. 根据元数据匹配检索来源,而不是根据片段中的任意文本匹配。
  5. 比较系统改动时,保持评估集不变。

不合格的测量

不能仅因为向量结果的片段文本提到了预期文档编号,就把它算作命中。

更好的测量

只有当来源元数据标识出预期文档时,才能将其算作命中。

信任边界

评估工具即使存在错误,也可能输出看起来很有把握的百分比。因此要用重音符号、多来源问题、正文交叉引用、缺失引用和拒答来测试评分器本身。

继续学习: 打开对应的独立课程 · 课程路线图