沈毅全栈与 AI

巴黎 • 新加坡 • 上海

RAG Formation · 参考资料

延迟、成本与可观测性

在本网站学习和测试 RAG 质量的独立速查表。

$ reference --status
▸ 课程 RAG Formation
▸ 模式 独立参考资料
▸ 状态 已完成
● 学习 → 测试 → 验证

参考资料

延迟、成本与可观测性

RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。

一句话规则

平均延迟可能掩盖慢尾延迟,而慢尾延迟会让系统在试点中不可用。

核心术语

术语含义
p50 和 p95中位数和慢尾延迟。两者都很重要,因为较快的平均值可能掩盖令人难以接受的离群值。p95 只有在跑 answer 模式时才会计算——纯 retrieval 模式只会报告 p50。
成本驱动因素(Cost drivers)嵌入调用、图 LLM 调用、答案生成、评审调用和上下文大小。
唯一真正能调的杠杆--graph-topk(默认 20)——调低它是用 LightRAG 图遍历的深度换延迟。这套代码里没有办法在一次线上请求中把 LightRAG 整个关掉。
可观测性(Observability)展示系统发生了什么的结构化追踪、指标和日志,同时不暴露密钥或文档文本。

证据卡

事项记录不要声称
基线命令、配置和观测结果——跟第 4 课同一份 eval_set.yaml 基线。基线就是目标。
改动一个假设或决策多个因素同时变化时,仍能确定是什么导致了结果。
指标summary.answer.latency_p50_s/.latency_p95_ssummary.retrieval.latency_p50_sanswer.stats.total_context_chars/.graph_context_chars;绝不要记录密钥或原始敏感内容。一个指标就能说明质量的全部。
安全一个失败案例和一个回归案例流畅的回答就能证明系统可靠。

本地命令

cd demo
python3 eval.py run --mode both --workspace meridian_demo --tag lesson-14-latency

一定要用 --mode both,别只用 --mode retrieval——纯检索汇总永远不会有 p95。

产物: 一份 MVP 性能预算和遥测检查表,并标明每一项是已测量还是假设。

继续学习: 打开对应的独立课程 · 课程路线图