参考资料
文本分块与文档结构
RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。
一句话规则
一次只改一个窗口设置,测量事实与来源身份是否保持在一起,再用独立的线上检索评估来验证假设。
术语表
| 术语 | 含义 |
|---|---|
| 源窗口(Source window) | 离线实验中使用的、可重复且有边界的合成 Markdown 片段。 |
| 分块大小(Chunk size) | 单个源窗口允许的最大字符数。 |
| 分块尺寸档位(Chunk-size profile) | 不是统一规格——Qdrant/Meilisearch 以约 500 token 建立索引,LightRAG 为了更好的实体抽取,有意采用约 1200 token。--profile chunk/graph 分别用字符数近似这两个值。 |
| 重叠(Overlap) | 从一个窗口末尾复制到下一个窗口的字符。 |
| 同位(Co-location) | 预期引用和所有必需事实词出现在同一个窗口中。 |
| 代理指标(Proxy metric) | 一种方向性信号,不是线上检索或答案质量结果。graph 档位的比例天然会更好看,因为足够大的窗口本来就能装下整篇文档。 |
受控实验卡片
| 步骤 | 执行 | 不要声称 |
|---|---|---|
| 基线 | 用 --profile chunk(约 500 token,Qdrant/Meilisearch 的尺寸)运行 q24。 | 这就是最佳生产设置。 |
| 单项改动 | 其余保持不变,改用 --profile graph(约 1200 token,LightRAG 的尺寸)重新运行 q24。 | 多个改动共同造成了这个结果。 |
| 测量 | 比较同位数量/比例以及可读的窗口文本。 | 线上索引已经改进,或者窗口越大就一定越好。 |
| 验证 | 重新索引隔离的演示环境,然后再次运行检索评估。 | 源窗口代理指标可以替代评估。 |
问题地图
| 问题 | 用途 | 来源 |
|---|---|---|
| q24 | 检查修订后的截止期限是否仍与当前程序身份关联。 | PR-QA-MRD-009 |
| q30 | 说明需要两个来源的答案可能仍无法在一个窗口中获得足够信息。 | PR-QA-MRD-001 + PR-QA-MRD-009 |
| q52 | 根据连续性计划身份检查简短事实答案。 | PR-EXM-MRD-014 |
命令与结论模板
cd demo
python3 chunk_lab.py --question q24 --profile chunk --output-dir reports/lesson-06-chunk-profile
python3 chunk_lab.py --question q24 --profile graph --output-dir reports/lesson-06-graph-profile
结论模板:“用 ___ 档位(___ 个字符、重叠 ___ 个字符)时,___ / ___ 个窗口同时保留了必需事实和来源身份。这支持 ___ 的假设;它不能证明线上检索质量,也不代表窗口越大越好。下一步是权衡 LightRAG 真实的抽取成本,再在隔离环境中重新索引并再次运行检索评估。”
本地入口
demo/chunk_lab.pydemo/eval_set.yamldemo/corpus/md/