沈毅全栈与 AI

巴黎 • 新加坡 • 上海

RAG Formation · 参考资料

运行并阅读 RAG 基线

在本网站学习和测试 RAG 质量的独立速查表。

$ reference --status
▸ 课程 RAG Formation
▸ 模式 独立参考资料
▸ 状态 已完成
● 学习 → 测试 → 验证

参考资料

运行并阅读 RAG 基线

RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。

基线流程

验证 → 启动隔离环境 → 索引 → 运行检索 → 运行答案评估 → 检查失败 → 保存配置。

记录哪些内容

项目原因
标签标识本次运行,例如 `lesson-4-baseline`。
语料库与评估集版本避免把不同的测试数据当作同一份数据进行比较。
工作区与索引名称确认本次运行使用的是隔离的演示数据。
topk 与阈值这些检索设置会影响结果。
模型与评审模型任一模型发生变化,都可能改变答案或评审判定。
并发数与超时这些运行设置会影响错误和延迟。

分别阅读这些指标

  • 检索并集:组合索引是否返回了每个预期文档?
  • 严格准确率:经评审的答案中有多少完全正确?
  • 来源命中率:最终答案是否引用了每个预期来源?
  • 拒答准确率:系统是否拒绝了所有不可回答的问题?
  • 幻觉率:对于证据无法支持的问题,系统仍然作答的频率是多少?
  • p50 / p95 延迟:典型响应时间与慢尾延迟。

良好的基线表述

“在这份语料库、评估集、模型和配置下,系统达到 X。”

不合格的基线表述

“这个聊天机器人的准确率是 90%。”

失败分析规则

对于每个失败,记录三件事:预期来源、实际来源和评审原因。这样才能把百分比转化为工程假设。

继续学习: 打开对应的独立课程 · 课程路线图