参考资料
运行并阅读 RAG 基线
RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。
基线流程
验证 → 启动隔离环境 → 索引 → 运行检索 → 运行答案评估 → 检查失败 → 保存配置。
记录哪些内容
| 项目 | 原因 |
|---|---|
| 标签 | 标识本次运行,例如 `lesson-4-baseline`。 |
| 语料库与评估集版本 | 避免把不同的测试数据当作同一份数据进行比较。 |
| 工作区与索引名称 | 确认本次运行使用的是隔离的演示数据。 |
| topk 与阈值 | 这些检索设置会影响结果。 |
| 模型与评审模型 | 任一模型发生变化,都可能改变答案或评审判定。 |
| 并发数与超时 | 这些运行设置会影响错误和延迟。 |
分别阅读这些指标
- 检索并集:组合索引是否返回了每个预期文档?
- 严格准确率:经评审的答案中有多少完全正确?
- 来源命中率:最终答案是否引用了每个预期来源?
- 拒答准确率:系统是否拒绝了所有不可回答的问题?
- 幻觉率:对于证据无法支持的问题,系统仍然作答的频率是多少?
- p50 / p95 延迟:典型响应时间与慢尾延迟。
良好的基线表述
“在这份语料库、评估集、模型和配置下,系统达到 X。”
不合格的基线表述
“这个聊天机器人的准确率是 90%。”
失败分析规则
对于每个失败,记录三件事:预期来源、实际来源和评审原因。这样才能把百分比转化为工程假设。