沈毅全栈与 AI

巴黎 • 新加坡 • 上海

RAG Formation · 第 12 课 · 有据的回答生成

拒答、不确定性与幻觉控制

当语料库没有答案时,为 QA、监管和审计场景定义安全行为。

$ lesson --status
▸ course RAG Formation
▸ lesson 12 / 16
▸ phase 有据的回答生成
▸ status 已完成
● build → measure → learn

独立课程

在这里学习完整课程并检验你的理解。

RAG Formation 的 16 节课程内容已完成。本页包含完整课程内容、本地参考资料和可直接在浏览器中完成的即时练习。

本课的具体收获

你会制定一份拒答策略,并用测试用例覆盖没有证据、证据不完整、证据冲突和问题含义模糊等情况。

观看讲解视频

1 · 核心技能

拿六道不可回答的评估题,把每个响应分到三个类别之一:安全拒答、不安全的含糊回应,或直接幻觉。

  • 拒答:明确说明已索引的证据无法证明被询问的事实。
  • 不确定性:谨慎说明证据支持什么,以及哪些问题仍未解决。
  • 幻觉:提出了一个实质性主张,但允许使用的证据并不支持它。

主要阅读:OpenAI《评估最佳实践》

2 · 运行证据闭环

cd demo
python3 eval.py run --mode answer --workspace meridian_demo --category unanswerable --tag lesson-12-refusal

把拒答准确率和幻觉率作为两个独立数字跟踪,并找出一个越过安全边界的答案作为例子。

注意:一段流畅的部分答案仍然可能是幻觉——只要其中混入了一条重要但没有证据支持的主张。

3 · 决策工作表

基线证据一个假设/改动指标回归检查有边界的结论
_________________________

4 · 检索练习

问题:你的证据只覆盖了问题的一部分。安全的做法是什么?

企业场景连接

在 QA、审计和法规工作中,直接说“我无法从已索引的文档确认这一点”,比给出一个听起来自信却是编造的答案更可靠。

5 · 交付物与下一步

  1. 保存命令输出或报告。
  2. 填写决策工作表。
  3. 写下一个失败案例,以及下一步要验证的一件事。

交付物是一份拒答策略,并配有覆盖无证据、部分证据、冲突证据和模糊问题的测试用例。

下一步:第 13 课将讲故障隔离和优雅降级。

对证据、指标、失败案例或下一步尝试有疑问,尽管继续问我。 这门课我就是你的老师。