在自己的文档里检索是怎么回事

拖动滑块,看一条检索流水线如何决定模型能看到什么——以及塞给它错误段落时会发生什么。

分块大小 8
重叠 0%
相关度阈值 0.70

点击图中任意一段,可打开该步骤。

完整的流水线

文档 → 带重叠的分块 → 数字 → 按字段过滤 → 按距离取最近 → 按阈值截断 → 剩下的送进模型。这类系统的错误答案,几乎都在调用模型之前就已经定下了。

内容一览

  1. 1 把文档切开 — 注意红色标记:那是把句子拦腰切断的边界。
  2. 2 按意思找最近的 — score 是距离,不是事实核查。
  3. 3 先过滤再检索 — 把过滤关掉,看成人那一行怎么爬回结果里。
  4. 4 阈值与空答案 — 「没找到」是正当结果。手上没有段落的模型应当拒绝,而不是即兴发挥。
  5. 5 送到模型面前的东西 — 光看回答,看不出它出自哪一段。这是上游流水线决定的。

可交互的讲解

分块大小 8
重叠 0%
相关度阈值 0.70
1 / 5