参考资料
RAG QA 质量速查表
RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。
处理流程
提出问题 → 检索证据 → 组装上下文 → 生成答案 → 引用来源 → 评估。
答案出错时,首先要问:证据缺失了,还是证据存在但没有被正确使用?
两个质量层次
| 层次 | 问题 | 演示信号 |
|---|---|---|
| 检索 | 系统是否返回了每个预期来源? | 检索并集 / 各索引命中率 |
| 生成 | 答案是否在不自相矛盾的情况下陈述了所请求的事实? | 严格和宽松的评审准确率 |
| 依据 | 系统是否引用了支持答案的文档? | 来源命中率 |
| 安全 | 系统是否拒绝了语料库中不存在答案的问题? | 拒答准确率和幻觉率 |
| 运维 | 用户能否快速且稳定地获得答案? | p50 / p95 延迟和 API 错误 |
如何阅读当前演示系统
- 严格准确率:只统计评审结果为
correct的答案,并将其作为主要指标。 - 宽松准确率:统计
correct + partial。它有助于诊断,但不能替代严格准确率。 - 来源命中率:检查最终答案是否引用了每个预期来源文档。
- 拒答准确率:检查系统是否正确拒绝了无法回答的问题。
- 幻觉率:统计系统仍然回答不可回答问题的频率。
检索失败
正确的文档始终没有进入答案提示词。检查分块、元数据、查询处理、混合检索、过滤器和排序。
生成失败
正确的证据已经存在,但答案遗漏、混淆或违背了证据。检查上下文组装、指令、答案结构和模型选择。
课程规则
不要因为一个令人印象深刻的答案,就声称提示词改进有效。应该运行评估工具、检查失败案例,并把相同指标与上一次运行进行比较。