参考资料
延迟、成本与可观测性
RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。
一句话规则
平均延迟可能掩盖慢尾延迟,而慢尾延迟会让系统在试点中不可用。
核心术语
| 术语 | 含义 |
|---|---|
| p50 和 p95 | 中位数和慢尾延迟。两者都很重要,因为较快的平均值可能掩盖令人难以接受的离群值。p95 只有在跑 answer 模式时才会计算——纯 retrieval 模式只会报告 p50。 |
| 成本驱动因素(Cost drivers) | 嵌入调用、图 LLM 调用、答案生成、评审调用和上下文大小。 |
| 唯一真正能调的杠杆 | --graph-topk(默认 20)——调低它是用 LightRAG 图遍历的深度换延迟。这套代码里没有办法在一次线上请求中把 LightRAG 整个关掉。 |
| 可观测性(Observability) | 展示系统发生了什么的结构化追踪、指标和日志,同时不暴露密钥或文档文本。 |
证据卡
| 事项 | 记录 | 不要声称 |
|---|---|---|
| 基线 | 命令、配置和观测结果——跟第 4 课同一份 eval_set.yaml 基线。 | 基线就是目标。 |
| 改动 | 一个假设或决策 | 多个因素同时变化时,仍能确定是什么导致了结果。 |
| 指标 | summary.answer.latency_p50_s/.latency_p95_s、summary.retrieval.latency_p50_s、answer.stats.total_context_chars/.graph_context_chars;绝不要记录密钥或原始敏感内容。 | 一个指标就能说明质量的全部。 |
| 安全 | 一个失败案例和一个回归案例 | 流畅的回答就能证明系统可靠。 |
本地命令
cd demo
python3 eval.py run --mode both --workspace meridian_demo --tag lesson-14-latency一定要用 --mode both,别只用 --mode retrieval——纯检索汇总永远不会有 p95。
产物: 一份 MVP 性能预算和遥测检查表,并标明每一项是已测量还是假设。