沈毅全栈与 AI

巴黎 • 新加坡 • 上海

RAG Formation · 参考资料

文本分块与文档结构

在本网站学习和测试 RAG 质量的独立速查表。

$ reference --status
▸ 课程 RAG Formation
▸ 模式 独立参考资料
▸ 状态 已完成
● 学习 → 测试 → 验证

参考资料

文本分块与文档结构

RAG Formation 的课程内容已完成;这份资料可用于自主学习和练习。

一句话规则

一次只改一个窗口设置,测量事实与来源身份是否保持在一起,再用独立的线上检索评估来验证假设。

术语表

术语含义
源窗口(Source window)离线实验中使用的、可重复且有边界的合成 Markdown 片段。
分块大小(Chunk size)单个源窗口允许的最大字符数。
分块尺寸档位(Chunk-size profile)不是统一规格——Qdrant/Meilisearch 以约 500 token 建立索引,LightRAG 为了更好的实体抽取,有意采用约 1200 token。--profile chunk/graph 分别用字符数近似这两个值。
重叠(Overlap)从一个窗口末尾复制到下一个窗口的字符。
同位(Co-location)预期引用和所有必需事实词出现在同一个窗口中。
代理指标(Proxy metric)一种方向性信号,不是线上检索或答案质量结果。graph 档位的比例天然会更好看,因为足够大的窗口本来就能装下整篇文档。

受控实验卡片

步骤执行不要声称
基线--profile chunk(约 500 token,Qdrant/Meilisearch 的尺寸)运行 q24。这就是最佳生产设置。
单项改动其余保持不变,改用 --profile graph(约 1200 token,LightRAG 的尺寸)重新运行 q24。多个改动共同造成了这个结果。
测量比较同位数量/比例以及可读的窗口文本。线上索引已经改进,或者窗口越大就一定越好。
验证重新索引隔离的演示环境,然后再次运行检索评估。源窗口代理指标可以替代评估。

问题地图

问题用途来源
q24检查修订后的截止期限是否仍与当前程序身份关联。PR-QA-MRD-009
q30说明需要两个来源的答案可能仍无法在一个窗口中获得足够信息。PR-QA-MRD-001 + PR-QA-MRD-009
q52根据连续性计划身份检查简短事实答案。PR-EXM-MRD-014

命令与结论模板

cd demo
python3 chunk_lab.py --question q24 --profile chunk --output-dir reports/lesson-06-chunk-profile
python3 chunk_lab.py --question q24 --profile graph --output-dir reports/lesson-06-graph-profile

结论模板:“用 ___ 档位(___ 个字符、重叠 ___ 个字符)时,___ / ___ 个窗口同时保留了必需事实和来源身份。这支持 ___ 的假设;它不能证明线上检索质量,也不代表窗口越大越好。下一步是权衡 LightRAG 真实的抽取成本,再在隔离环境中重新索引并再次运行检索评估。”

本地入口

  • demo/chunk_lab.py
  • demo/eval_set.yaml
  • demo/corpus/md/

继续学习: 打开对应的独立课程 · 课程路线图