沈毅全栈与 AI

巴黎 • 新加坡 • 上海

RAG Formation · 参考资料

RAG QA 质量速查表

在本网站学习和测试 RAG 质量的独立速查表。

$ reference --status
▸ 课程 RAG Formation
▸ 模式 独立参考资料
▸ 状态 已完成
● 学习 → 测试 → 验证

参考资料

RAG QA 质量速查表

RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。

处理流程

提出问题 → 检索证据 → 组装上下文 → 生成答案 → 引用来源 → 评估。

答案出错时,首先要问:证据缺失了,还是证据存在但没有被正确使用?

两个质量层次

层次问题演示信号
检索系统是否返回了每个预期来源?检索并集 / 各索引命中率
生成答案是否在不自相矛盾的情况下陈述了所请求的事实?严格和宽松的评审准确率
依据系统是否引用了支持答案的文档?来源命中率
安全系统是否拒绝了语料库中不存在答案的问题?拒答准确率和幻觉率
运维用户能否快速且稳定地获得答案?p50 / p95 延迟和 API 错误

如何阅读当前演示系统

  • 严格准确率:只统计评审结果为 correct 的答案,并将其作为主要指标。
  • 宽松准确率:统计 correct + partial。它有助于诊断,但不能替代严格准确率。
  • 来源命中率:检查最终答案是否引用了每个预期来源文档。
  • 拒答准确率:检查系统是否正确拒绝了无法回答的问题。
  • 幻觉率:统计系统仍然回答不可回答问题的频率。

检索失败

正确的文档始终没有进入答案提示词。检查分块、元数据、查询处理、混合检索、过滤器和排序。

生成失败

正确的证据已经存在,但答案遗漏、混淆或违背了证据。检查上下文组装、指令、答案结构和模型选择。

课程规则

不要因为一个令人印象深刻的答案,就声称提示词改进有效。应该运行评估工具、检查失败案例,并把相同指标与上一次运行进行比较。

继续学习: 打开对应的独立课程 · 课程路线图