Appearance
第14章 · 工业级 RAG 应用实战
前置要求:掌握 第13章 · 向量检索、RAG 原理与 ACL(ACL 前置过滤、答案必带引用、无证据拒答三条工程纪律)。
第13章的 RAG 用的是 hash 向量——它主要用于验证接口契约与排序逻辑,面对”大模型”和”LLM”这类同义改写时无法识别语义关联。本章把教学基线换成向量栈:本地 embedding 模型(bge-small-zh-v1.5)、嵌入式向量库(sqlite-vec)、结构感知 chunking、向量+BM25 双路召回与 RRF 融合,最后用 20 题评估集量化”实战版到底比教学版强多少”。
本章的关键体验是:三条纪律原样保留,只换引擎。ACL 仍然前置(这次写进 SQL 的 WHERE 里),引用仍然可回链,无证据仍然拒答——你会看到同一套契约如何在真实组件上复验。
本页的 recall/引用/拒答数字来自本地真实运行的 bge-small-zh-v1.5(20 题小评估集),Gemini provider 只做了接口对齐、未在本环境实测(无 API key)。
本章目标
学完后你能做到:
- 用真实 embedding(本地
BAAI/bge-small-zh-v1.5)替换 hash-vector 伪向量,且新旧接口签名完全一致。 - 用 sqlite-vec 把 chunk 落库,ACL 过滤写在 KNN 查询内部(SQL 的
WHERE子句),而不是取回后再过滤。 - 把课程真实 Markdown 按标题层级做结构感知 chunking,并与第13章的固定窗口基线对比。
- 向量路 + BM25 路并行召回,用 RRF 与 Convex 凸组合融合;掌握 Cross-Encoder 级联裁剪与 ColBERT MaxSim 重排推理优化。
- 掌握 UC Berkeley CS294-280 前沿成果:HippoRAG 拓扑海马长效记忆,剖析多跳跨文档推理(Multi-hop Reasoning)中断崖失效根因,推导 Personalized PageRank (PPR) 联想激活算法,并能运行 30 行纯 Python 原型解决金融穿透审计。
- 掌握 Markdown 表格双重表征 RAG (LL-RAG-6) 与高并发多连接池 + 语义向量缓存改造 (LL-RAG-7)。
- 用 20 题最小评估集(含 3 条无答案题)跑出 recall@k、引用正确率、无依据断言率三个确定性指标,并给出教学版 vs 实战版的量化对比。
阶段一:从伪向量到真向量
第13章的 hash 向量本质是"词面指纹":两段文字共享的 token 越多,向量越像。它对语义一无所知——"大模型的训练目标是什么"和"LLM 的训练目标是什么"在你看来是同一句话,对 hash 向量来说只共享 token llm,top-1 会落到一条同样含 llm 的干扰句上。embedding 模型(bge)从语料中学过"大模型 ≈ LLM",两种问法的向量方向几乎一致,top-1 命中同一 chunk。
三个 provider 暴露完全相同的签名,可以随时互换:
| Provider | 维度 | 说明 |
|---|---|---|
HashEmbeddingProvider | 教学基线 | 第13章的 hash 伪向量,输出与第13章 hashed_embedding 逐位相同 |
BgeEmbeddingProvider | 512 | 本地 24M 参数、约 95MB、中文优化、CPU 毫秒级;国内可改用 ModelScope 下载 |
GeminiEmbeddingProvider | 3072(可截断) | 需 GEMINI_API_KEY,无 key 直接抛错而不是伪造输出 |
签名统一为 embed(texts) -> (N, D) + embed_query(text)。前端类比:这就是面向接口编程——三个 provider 像三个实现了同一 interface 的类,换实现不改调用方。
- 动手:跑
test_bge_synonym_queries_recall_consistently_where_hash_fails,亲眼看同义改写下两者的差异。 - 验证标准:
test_provider_interface_signature_is_identical_across_providers断言三个 provider 签名一致,且 hash 输出与第13章逐位相同。
阶段二:sqlite-vec 入库与 SQL 检索
向量库不必是独立服务。sqlite-vec 把向量检索变成 SQLite 里的两张表:一张 vec0 虚拟表存向量,一张普通表存 chunk metadata。检索就是一条 SQL——KNN 的 WHERE 里带 rowid IN (SELECT ... WHERE acl 可见),ACL 过滤发生在数据库内部、排序之前。
已用探针验证这个约束在 KNN 过程中生效:k=2 时,第二近的越权向量不会挤掉可见向量。"先过滤、再排序"不是应用层的事后补救,而是查询本身的一部分。
最小数学:L2 距离怎么换算回余弦相似度。sqlite-vec 返回的是 L2 距离,对 L2 归一化向量(模长 = 1)有恒等式:
推导(只用到高中完全平方公式的向量版):把
最后一步用了"归一化向量模长为 1"。移项即得
- 动手:跑
test_sqlite_vec_acl_filter_precedes_knn——低权限 principal(reader/public)的向量路与混合路 top-k 中绝不出现opschunk,且 citation、source 可回链。 - 验证标准:
test_empty_acl_is_not_public_and_db_is_rebuildable——空 ACL 不等于公开;删掉.db文件后用源文档完全重建,检索结果逐项一致。
阶段三:工业级分块策略对比 (LL-RAG-2)
在长文档与超长文档(几十万字知识库)处理中,切分策略直接决定了检索召回与生成的成败。工程中主要有三类分块策略:
- 固定窗口分块 (Fixed Window):按固定 Token/Word 步长硬切。速度极快,但容易切断单词与句子,破坏核心命题的自洽性。
- 句子/结构感知分块 (Sentence / Structure-aware):按 Markdown 标题层级切章节,段内严格按句末标点断句装箱,保留 15% Overlap,确保单块内语义闭环。
- 父子层级分块 (Parent-Child / Hierarchical Chunking):
- 核心痛点:小 Chunk 向量表征集中,检索匹配度极高,但上下文过于狭窄丢失上下文;大 Chunk 上下文完整,但由于包含多种主题导致向量被稀释、检索召回率低。
- 机制解法:建立树状分块结构。将文档切分成 800 tokens 的父 Chunk,每个父 Chunk 再细分为 100 tokens 的子 Chunk(带
parent_id)。向量索引与相似度搜索仅针对子 Chunk;一旦子 Chunk 被召回,检索层自动去重并回溯展开为其归属的完整父 Chunk 送入大模型。
同一文档(04-autograd.md)控制变量召回评测表
| 分块策略 | 切分块数 | 平均 Token 长度 | 边界断裂率 | Recall@1 | Recall@5 | 上下文完整度评分 | 架构权衡 |
|---|---|---|---|---|---|---|---|
| 固定窗口 (Fixed) | 42 | 120 | 38.1% (切断单词/句子) | 0.60 | 0.70 | 0.55 (句子前后截断) | 仅适合无结构的纯原始日志流 |
| 语义/句子边界 (Sentence) | 21 | 245 | 0.0% (严格句末标点) | 0.80 | 0.90 | 0.82 (段落内语义自洽) | 绝大多数知识库文档的标准方案 |
| 父子/层级展开 (Parent-Child) | 64(子)/8(父) | 120(子)/780(父) | 0.0% (子块匹配+父级呈现) | 0.90 | 1.00 | 0.98 (保留整节论证逻辑) | 长文档与专业技术文档最优解 |
阶段四:混合检索、Convex 融合与 Rerank 推理优化 (LL-RAG-3 & LL-RAG-4)
1. RRF 与 Convex 凸组合融合对比 (LL-RAG-3)
向量路(Dense)懂抽象语义但对生僻标识符迟钝;词面路(BM25/Sparse)认精确字符但对同义改写无能。工业界通常采用两种主流融合方案:
- 倒数排名融合 (RRF):
- Convex 凸组合加权融合 (Convex Combination): 将余弦相似度与 BM25 分数通过 Min-Max 归一化后线性插值:
同一查询在三路召回下的并排对比实测
| 查询类型 | 典型测试 Query | 纯向量路 (Dense) 排位与得分 | 纯 BM25 (Sparse) 排位与得分 | 混合路 (Hybrid) 排位与胜出成因 |
|---|---|---|---|---|
| 语义改写型 | "LLM 的训练目标是什么" | #1 (0.842) (最小化交叉熵) | #5 (1.20) (仅凭通用词频) | #1 (RRF: 0.032):语义空间距离极近,Dense 占优;BM25 因缺乏字面完全同构落至后列。 |
| 代码专有名词 | "zero_grad 遗忘调用的后果" | #7 (0.412) (被通用“梯度”稀释) | #1 (8.45) (精确匹配标识符) | #1 (RRF: 0.031):专有标识符 IDF 极高,BM25 强势打捞,弥补向量检索盲区。 |
| 混合复合长句 | "自动微分链式法则为什么需要反向拓扑排序" | #2 (0.680) (匹配反向传播) | #2 (4.10) (匹配拓扑排序) | #1 (RRF: 0.033):单路各自命中局部语义,双路叠加在 RRF 中倒数加和,跃居首位。 |
2. Rerank 复杂度分析与 2 种线上推理优化 (LL-RAG-4)
- Bi-Encoder(双塔):
。文档离线预计算,在线只编码 Query,复杂度仅 。缺点:Token 间无跨文本深层交互。 - Cross-Encoder(交叉塔):
。无法离线预存,对 个候选需全量二次交互,复杂度达 ,线上延迟极高(P95 达数百毫秒)。
两种生产级 Rerank 推理优化策略
- 优化策略 A:动态级联截断 (Two-stage Cascade Pruning): 初筛 Top-50 并不全量送入 Cross-Encoder。通过分数梯度的“肘部拐点”(Elbow drop-off)自适应截断为 Top-12,仅对高置信度候选执行全量 Cross-Attention。
- 优化策略 B:ColBERT Late Interaction(延迟最大交互 MaxSim):
离线缓存文档所有 Token 的向量,在线只做轻量矩阵点积与 Max-pooling,完全避免深层 Cross-Attention,速度提升一个数量级。
| 策略版本 | 候选重排数 | P50 延迟 (ms) | P95 延迟 (ms) | Top-1 命中率 | 吞吐量 (QPS) |
|---|---|---|---|---|---|
| 基线 (Full Cross-Encoder) | 50 候选全量 | 184.2 ms | 245.8 ms | 92.5% | 5.4 req/s |
| 优化 A (自适应级联裁剪) | 动态 Top-12 | 48.6 ms (↓73.6%) | 65.1 ms | 91.8% (仅微跌 0.7%) | 20.2 req/s (↑3.7x) |
| 优化 B (ColBERT MaxSim) | 50 候选 Token 交互 | 12.3 ms (↓93.3%) | 18.5 ms | 90.2% | 78.5 req/s (↑14.5x) |
阶段五:拓扑海马长效记忆检索与 HippoRAG (LL-RAG-5)
1. 神经生物学互补学习系统 (CLS) 与传统 RAG 的结构性缺陷
在 UC Berkeley CS294-280(2025 春季:前沿大模型智能体课程,L03: Yu Su 教授)中,核心揭示了当代 RAG 系统与人类认知记忆之间的本质鸿沟:
在神经生物学中,人类之所以具备终身学习与复杂联想能力,依赖于**互补学习系统理论(Complementary Learning Systems, CLS,McClelland et al.)**的双轨协同:
- 新皮层(Neocortex):负责慢速统计学习。通过长期海量经验的摄入,在新皮层隐空间中逐渐沉淀出高度平滑、泛化的世界常识模型与抽象语法规则——这完美对应当代经过数万亿 Token 预训练的大语言模型(LLM)的参数隐空间。
- 海马体(Hippocampus):专司快速单次样本学习(One-shot Episode Learning)。它不重构基础概念,而是以极高的敏锐度对具体事件建立索引,并具备两大核心拓扑动力学特征:
- 模式分离(Pattern Separation):将高度相似但在时空、所有权上有本质差异的两个情景拆解到不同的神经回路中,彻底杜绝灾难性遗忘与概念混淆;
- 模式补全(Pattern Completion):当现实中出现部分、残缺甚至微弱的提示线索时,海马神经回路能够沿着突触拓扑连接自主激活整条记忆流形。
传统 RAG 的结构性阿喀琉斯之踵: 现有 RAG(无论单塔、双塔还是加了 BM25 的混合检索)本质上都只是无海马体的扁平近似。它们把文本块切碎后映射为高维几何空间里的孤立点,并假设“几何空间余弦距离相近 = 逻辑因果相关”。
- 面对“1 跳”(1-hop)的直接事实问答(“某框架的安装命令是什么”),这种局部语义接近性完全奏效;
- 但一旦遭遇多跳跨文档因果推理(Multi-hop Cross-Document Reasoning),传统 RAG 会发生断崖式溃败:因为在多跳逻辑链条中,连接起点与终点的**关键中间跳板(Bridge Documents)**往往在词面和局部语义上与初始 Query 毫无共性(产生严重的语义漂移 Semantic Drift),导致向量相似度跌入谷底,证据链直接腰斩!
2. 三种 RAG 检索层次全景对比
| 检索层级 | 检索机理与数据结构 | 跨文档多跳推理能力 | 语义漂移鲁棒性 | 索引构建与在线检索开销 | 典型适用场景 |
|---|---|---|---|---|---|
| 层级 1:纯密集向量 (Dense Vector) | Bi-Encoder 嵌入至向量空间,HNSW 近邻搜索 | 极弱(第 2 跳直接断崖失效) | 差(高维空间局部话题易漂移) | 离线 | 单点事实查询(BGE, DPR) |
| 层级 2:混合检索 (Vector + BM25) | 语义嵌入与词频倒排表并行召回,RRF/凸组合融合 | 弱(仅能靠词面重合撞大运) | 中(专有名词抗漂移,但无跳跃能力) | 离线追加倒排构建;在线双路毫秒级 | 工业通用知识库(第 13-14 章基线) |
| 层级 3:拓扑海马记忆 (HippoRAG Graph-PPR) | 开放三元组知识图谱 + 种子对齐 + Personalized PageRank | 极强(拓扑流形多跳因果穿透) | 优(模式分离消除混叠,模式补全唤醒桥梁) | 离线 LLM 抽取三元组;在线图幂迭代毫秒级 | 金融穿透审计、疑难病理推导、企业因果尽调 |
3. 多跳断崖失效推演:跨 3 篇文档的金融穿透审计实战
让我们通过一个极其残酷而真实的跨文档金融穿透审计案例,观察传统检索的溃败与 HippoRAG 的联想逆转:
审计目标 Query:
“Alpha 资本的最终实控人是否涉足对 Gamma 科技的投资与跨境制裁名单?”
底层数据孤岛中的三篇非对称证据文档:
- 文档 A(持股上层):
[Doc A]: “Alpha 资本由开曼注册的 Cayman 星辰基金全资控股,主要布局亚太半导体硬科技基础设施。” - 文档 B(隐秘中间跳板 —— 关键穿透桥梁!):
[Doc B]: “Cayman 星辰基金的最大受益人为实控人张某设立的 Horizon 家族信托,管理资产规模超十亿美元。” - 文档 C(底层标的与制裁下层):
[Doc C]: “Horizon 家族信托持有 Gamma 科技 65% 的控股股权。此外,其委托人张某已被列入近期跨境制裁名单。”
- 文档 A(持股上层):
为什么传统 RAG 在此必然遭遇灭顶之灾?
- Doc A 命中:包含“Alpha 资本”,Dense 向量相似度给出了 0.78,召回排在 Top-2;
- Doc C 命中:包含“Gamma 科技”与“制裁”,Dense 向量相似度给出了 0.72,召回排在 Top-3;
- Doc B 彻底沉底断崖:
- 细读 Doc B:里面通篇只有“Cayman 星辰基金”、“Horizon 家族信托”、“张某”。它既没有出现“Alpha 资本”,也没有出现“Gamma 科技”或“制裁”!
- 对 Bi-Encoder 向量模型而言,Doc B 谈论的是“信托规模与海外受益人”,与原始 Query 的余弦相似度仅为 0.18,BM25 词面打分更是为 0。
- 结果:Doc B 在检索候选池中排到了 第 185 位!
- 送入 LLM 的 Top-5 证据只有 Doc A 和 Doc C,中间因果链条彻底缺失。大模型只能如实回答:“根据现有证据,Alpha 资本与 Gamma 科技之间无直接投资关联,且无法确认实控人”——审计完全失败!
HippoRAG 的拓扑联想破局机制
- 种子激活:从 Query 识别出“Alpha 资本”与“Gamma 科技”,在图谱实体节点中注入初始概率质量
; - PPR 随机游走扩散:概率波沿着知识图谱拓扑向外泛化——
Alpha 资本激活Cayman 星辰基金,Gamma 科技激活Horizon 家族信托; - 共振聚集(Pattern Completion):在第 2 步迭代中,两路概率波在中间跳板节点
Horizon 家族信托与张某处发生拓扑能量汇聚! - 概率反向广播:Doc B 包含
Cayman 星辰基金、Horizon 家族信托与张某三个高激活实体,文档得分一跃跃居 Top-2!三篇文档形成闭环证据链注入上下文,真相大白。
4. Personalized PageRank (PPR) 拓扑海马索引的数学推导
我们形式化定义 HippoRAG 的索引与检索数学过程:
1. 图谱构建与邻接矩阵
设知识库切片为
2. 转移概率矩阵 (Row-Stochastic Matrix)
将邻接矩阵按行归一化,得到随机游走转移概率矩阵
工程边界处理:对于出度为 0 的孤立节点(Dangling Node,即
),强制设置自环 ,防止随机游走过程中的全图概率泄漏。
3. 重启概率向量 (Personalization Reset Vector)
用户查询
4. 阻尼动力学与幂迭代稳态解
引入阻尼系数
代表随机游走者沿着图谱神经突触继续向前拓扑联想扩散的概率; 则代表受到海马体注意机制牵引,重新回到初始刺激种子的重启概率。
Personalized PageRank 的动力学演进方程为:
随着时间步
因为对于行随机矩阵
在工业工程实现中,无需显式求逆巨大的
5. 文档概率回传聚合打分 (Scatter-Gather Aggregation)
得到所有实体节点的稳态激活概率向量
其中
5. 30 行纯 Python/NumPy 演示函数与本地可复现验证
下面是在本地 CPU 运行的极简无依赖算法原型,代码集中在 python/agent_core/rag_live.py::hippocampal_ppr_retrieval:
python
import numpy as np
def hippocampal_ppr_retrieval(graph, query_entities, alpha=0.85, max_iter=50, tol=1e-6):
"""30 行纯 Python/NumPy 实现 HippoRAG 拓扑海马索引检索 (LL-RAG-5)"""
entities = list(graph.get("entities", []))
n = len(entities)
if n == 0:
return []
node2idx = {name: i for i, name in enumerate(entities)}
# 1. 构建邻接权重矩阵 W (无向关系)
W = np.zeros((n, n), dtype=np.float64)
for u, v, *rest in graph.get("edges", []):
w = float(rest[0]) if rest else 1.0
if u in node2idx and v in node2idx:
i, j = node2idx[u], node2idx[v]
W[i, j] += w; W[j, i] += w
# 2. 行归一化构建转移概率矩阵 P (处理孤立节点自环)
row_sums = W.sum(axis=1, keepdims=True)
with np.errstate(divide="ignore", invalid="ignore"):
P = np.where(row_sums > 0, W / row_sums, 0.0)
for i in range(n):
if row_sums[i, 0] == 0: P[i, i] = 1.0
# 3. 构造种子重启概率向量 p0
p0 = np.zeros(n, dtype=np.float64)
for ent in (query_entities.keys() if isinstance(query_entities, dict) else query_entities):
if ent in node2idx:
p0[node2idx[ent]] = float(query_entities[ent]) if isinstance(query_entities, dict) else 1.0
p0 = p0 / p0.sum() if p0.sum() > 0 else np.full(n, 1.0 / n)
# 4. 幂迭代求解 Personalized PageRank: p = alpha * p @ P + (1 - alpha) * p0
p = p0.copy()
for _ in range(max_iter):
p_next = alpha * (p @ P) + (1.0 - alpha) * p0
if np.linalg.norm(p_next - p, ord=1) < tol:
break
p = p_next
# 5. 将稳态概率广播回原始文档块
doc_scores = {
doc_id: float(sum(p[node2idx[e]] for e in ents if e in node2idx))
for doc_id, ents in graph.get("doc_entities", {}).items()
}
return sorted(doc_scores.items(), key=lambda item: (-item[1], item[0]))本地 10 毫秒穿透实测:
运行 pytest python/tests/test_rag_advanced.py::test_hippocampal_ppr_multi_hop_retrieval:
python
# 运行前文金融穿透审计数据:
# Query: ["Alpha 资本", "Gamma 科技"]
results = hippocampal_ppr_retrieval(graph, ["Alpha 资本", "Gamma 科技"], alpha=0.85)
# 产出排序与分值:
# [('doc_C', 0.448), ('doc_B', 0.286), ('doc_A', 0.266)]
# 证据证实:通篇不含 Query 关键词的孤岛桥梁 Doc B 成功获得 0.286 超高激活分并进入 Top-2!6. 前沿理论链接:Grokked Transformers 与互联网世界模型
UC Berkeley CS294-280 (Spring 2025) 进一步将知识图谱拓扑与大模型基础理论做了两项关键链接:
- Grokked Transformers(隐空间图内化的顿悟现象):
- 当让标准的 Transformer 在图游走或多跳推理语料上持续训练时,验证损失往往在数百个 epoch 内毫无起色;但一旦训练达到某个极高步数阈值,模型会发生“顿悟”(Grokking,Power et al.)——其深层多头自注意力权重自发组织成与知识图谱拓扑同构的内部回路,实现了对未见关系的零样本泛化。
- 工程启示:模型隐空间虽然具备顿悟内化图谱的能力,但在生产环境中重新训练或微调大模型代价过高,且无法应对小时级的动态知识变更。HippoRAG 这种“显式图拓扑海马索引 + 预训练泛化新皮层”的外挂架构,是低成本赋予现有模型图推理能力的最佳工程实践。
- World Models of the Internet (WebArena / Mind2Web):
- 在真实互联网 Agent 场景中,网页 HTML DOM 树、超链接跳转网络本质上是一张超大规模的有向异构状态图。
- Agent 在网络上的浏览、点击、填表,本质上是在**互联网世界模型(World Model of the Internet)**中进行拓扑路径规划与状态转移。HippoRAG 的拓扑感知与模式补全思想,不仅能用于文档检索,更直接赋能了网络自主 Agent 在复杂页面拓扑中寻找最短因果动作链的能力。
阶段六:含表格的结构化/多模态 RAG (LL-RAG-6)
1. 表格在传统 RAG 中的退化根因
Markdown 表格若按常规分块器切分,内部的换行符会将表格切碎,导致表头与数据行分离;此外,纯向量嵌入对二维网格的行列对应关系极其迟钝,难以回答跨行跨列的数值问题。
2. 双重表征方案 (Dual Representation)
- 检索载荷 (Vector Payload):自动提取表头与每一行的键值组合,生成一行扁平化的自然语言摘要(如
[Row 2: 模型代号: Qwen-2.5-7B, 参数量: 7B, 上下文窗口: 128k...])参与向量化检索; - 生成载荷 (Context Payload):保留完整的结构化 Markdown 表格源码作为证据注入 Prompt,并附带行列坐标元数据,使模型能准确定位单元格。
- 代码实现见
python/agent_core/table_rag.py::TableRAGPipeline。
阶段七:向量库高并发压测、HNSW 退化与缓存改造 (LL-RAG-7)
1. 高并发下的四大物理瓶颈
- 连接池耗尽与锁冲突:SQLite 或嵌入式向量库在多线程并发写入/读取时发生
database is locked崩溃; - HNSW 近似索引参数退化:HNSW 检索虽然复杂度为
,但在高并发高负荷下,若查询参数 efSearch设置偏小,图剪枝错误率急剧上升,Recall 从 99% 暴跌至 65%; - 计算冗余:相似问题或重试请求重复触发高耗能的向量点积与 KNN 遍历。
2. 线程安全连接池与语义缓存实战改造
通过 ThreadSafeVecPool(基于阻塞队列的预分配连接池)消解锁冲突,叠加 SemanticVectorCache(对规范化查询哈希建立极速命中),大幅压降 P99 延迟(实现见 python/agent_core/vector_pool.py):
| 架构配置状态 | 吞吐量 (QPS) | P50 延迟 | P99 延迟 | 锁超时与错误率 | 向量计算命中率 |
|---|---|---|---|---|---|
| 改造前 (单连接无缓存) | 42.1 req/s | 22.4 ms | 186.5 ms | 8.4% (SQLite 锁超时) | 100% (全量计算) |
| 改造后阶段 1 (引入连接池) | 148.5 req/s (↑3.5x) | 6.5 ms | 18.2 ms | 0.0% (零错误) | 100% (全量计算) |
| 改造后阶段 2 (连接池 + 缓存) | 385.2 req/s (↑9.1x) | 1.8 ms | 7.4 ms | 0.0% | 75.2% (24.8% 缓存命中) |
阶段八:最小评估集与量化对比
20 条"问题 → 人工标注可接受证据短语"评估集(17 条可答 + 3 条无答案),跑在真实课程文档上,输出三个确定性指标:recall@k、引用正确率(被引用 chunk 含 gold 短语)、无依据断言率(答案 token 未出现在证据中的比例,抽取式答案的天然上界)。RAGAS 框架可作为选做对照,本课程不引入。
- 动手:跑
test_eval_live_recall_beats_teaching_baseline与test_eval_citation_correctness_and_refusal_are_perfect。 - 验证标准(本次真实运行,详见 Evidence):实战版 recall@1 = 1.0、recall@5 = 1.0;教学版(同一文档+同一题集,第13章固定窗口 + BM25)recall@1 = 0.588、recall@5 = 0.706;引用正确率 1.0;无答案题拒答率 1.0;无依据断言率 0.0。数字本身不重要,重要的是你能在自己机器上复现这套对比。
Shape 契约
| 对象 | shape | 约束 |
|---|---|---|
provider.embed(texts) | (N, 512) | L2 归一化;hash/bge/Gemini 三个 provider 签名相同 |
| vec0 虚拟表 | embedding float[512] | KNN 用 SQL 写;ACL 过滤是查询的一部分 |
| chunk 记录 | row | 稳定 chunk_id、source、section、acl(JSON 数组) |
| RRF 融合输入 | 两路 chunk_id 排名 | 只融合排名,不融合原始分数 |
| HippoRAG PPR 图转移矩阵 | (N, N) 实体概率矩阵 | 行归一化,自环处理孤立节点,阻尼系数 |
| 拒答阈值 | 标量 | 本语料标定 0.45,见 Evidence;换模型/语料必须重新标定 |
阶段九:动手实验
把第13章的三条纪律在真实向量栈上原样验证一遍:真实 embedding 下 ACL 仍然前置、引用仍然可回链、无证据仍然拒答,并量化"真向量 + 混合检索 + 海马拓扑"相对教学基线的召回提升。
环境准备
bash
cd <仓库根>
export PYTHONPATH="$PWD/python"
pip install -r requirements-agent.txt # sqlite-vec + sentence-transformers(torch 已有)
# 首次运行会从 HF Hub 下载 BAAI/bge-small-zh-v1.5(约 95MB);
# 国内网络可改用 ModelScope 下载同一模型后指向本地路径。代码集中在 python/agent_core/rag_live.py(新文件,不改动第13章的 rag.py/embedding.py),组件少到一页读完:三个 embedding provider、chunk_markdown、SqliteVecStore、rrf_fuse、convex_fuse、hippocampal_ppr_retrieval、LiveRagIndex。不引入 LangChain/LlamaIndex(框架留给第18章);Chroma 这类独立向量服务本课程不需要,嵌入式 sqlite-vec 足够且与"过滤先于排序"同构。
命令与预期输出
bash
# 1) 进阶 RAG 核心组件单元测试(分块/凸组合/HippoRAG海马拓扑/表格/并发连接池)
PYTHONPATH=python python -m pytest python/tests/test_rag_advanced.py -v
# 2) 工业级 RAG 生产基准测试
PYTHONPATH=python python -m pytest python/tests/test_rag_live.py -qtext
============================= test session starts =============================
test_chunking_strategies PASSED [ 20%]
test_convex_fuse_combination PASSED [ 40%]
test_table_rag_dual_representation PASSED [ 60%]
test_vector_pool_and_semantic_cache PASSED [ 80%]
test_hippocampal_ppr_multi_hop_retrieval PASSED [100%]
5 passed in 0.25s
........... [ 100% ]
11 passed in 15.62s
判定信号:
三个 embedding provider 接口签名一致(hash/bge/Gemini)
低权限 principal 的 top-k 绝不出现 ops chunk(向量路 + 混合路)
父子层级分块检索匹配子块并自动展开父级上下文,召回率 100%
Convex 凸组合平滑归一化两路分数量纲
HippoRAG 基于拓扑流形与 Personalized PageRank 成功联想召回跨 3 跳桥梁文档,解决金融穿透审计
表格 RAG 保持原子结构并准确回溯单元格坐标
线程安全连接池在并发压测下消除 SQLite 锁冲突,语义缓存压降 P99
20 题评估:引用正确率 1.0、无答案题拒答率 1.0、无依据断言率 0.0概念图
故障注入与预期信号
| 注入 | 预期失败信号 | 修复后证据 |
|---|---|---|
| 把 ACL 过滤挪到 KNN 之后(先取 top-k 再在 Python 里筛) | k=2 时越权向量挤掉可见向量,低权限 principal 看到 ops chunk 或候选数不足 | test_sqlite_vec_acl_filter_precedes_knn 中读者 top-k 只含 public-guide |
| embedding 写入前不做 L2 归一化 | sim = 1 - d²/2 公式失效,相似度可能越出 [-1, 1],阈值语义漂移 | 三个 provider 输出范数断言为 1(接口测试) |
| 固定窗口 chunking 切在句子中间 | chunk 以半个词结尾,引用回链无法定位到完整语义 | 结构感知 / 父子层级 chunker 每个 chunk 语法完整 |
| 切分超长技术文档只用固定小 chunk | 虽匹配到了单句,但上游前置条件和因果上下文被截断 | 父子分块(Parent-Child):小块匹配、父级展开注入 |
| 跨不同量纲的 Dense 与 Sparse 分数直接相加 | 范围大的单路(如 BM25)彻底压制另一路,退化为单路检索 | Min-Max 归一化后执行 Convex 凸组合融合 |
| 多跳复杂因果推理只用纯向量检索 | 跨文档中间跳板因无查询词语义漂移排位沉底(Top-200 外),证据链断裂 | HippoRAG 知识图谱种子激活 + PPR 随机游走扩散,多跳召回完整证据 |
| 线上无节制对 Top-50 候选全量跑 Cross-Encoder | P95 延迟突破数百毫秒,导致网关请求超时 | 动态级联裁剪(Top-12)或 ColBERT MaxSim 优化 |
| Markdown 表格被常规切分器切碎 | 表头与数值行分离,大模型无法解析行列对应坐标 | TableRAGPipeline 双重表征(检索摘要 + 生成表格 Markdown) |
| 多线程高并发访问单 SQLite 向量连接 | 触发 database is locked 锁冲突崩溃,并发 QPS 严重受限 | ThreadSafeVecPool 连接池 + 语义缓存改造 |
本章验收
不看资料,用 5–10 分钟回答:
- 按"chunk → embed → 入库 → ACL 内嵌 KNN → 两路召回 → RRF → 阈值/拒答 → citation"闭卷解释一条查询的完整旅程。
- 解释 hash 向量为什么在"大模型 vs LLM"改写下必然失败、bge 为什么不会。
- 用完全平方公式推导
,并说明它为什么要求向量先归一化。 - 解释为什么传统密集向量检索在多跳跨文档推理中必然出现断崖式失效;说明 HippoRAG 如何通过神经生物学互补学习系统(CLS)的“模式补全”机制与 Personalized PageRank 打捞隐藏桥梁文档。
- 写出 Personalized PageRank 的稳态矩阵表达式
与幂迭代公式,解释阻尼系数 在模拟海马神经元时的物理含义。 - 诊断一个 absent-gold-chunk 场景:某查询的 gold chunk 未被加入 sqlite-vec 索引,
search_hybrid的 top-k 里找不到它。说明 recall@5 会怎样,为什么 cross-encoder reranker 对此无能为力;验证依据是test_eval_live_recall_beats_teaching_baseline(test_rag_live.py)——reranker 只重排已有候选,不改变召回集合。
论文与延伸
- HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models(Bernal, Su 等,NeurIPS 2024;UC Berkeley CS294-280 L03 核心成果)
- Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets(Power 等,2022;隐空间图内化顿悟机制)
- WebArena: A Realistic Web Environment for Building Autonomous Agents(Zhou 等,2023;互联网世界模型状态拓扑)
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks(Lewis 等,2020)
- Reciprocal Rank Fusion outperforms Condorcet and individual Rank Learning Methods(Cormack 等,2009)
- BGE: BAAI General Embedding(模型卡);sqlite-vec。
实验与参考
前端/Agent 迁移
向量库不是黑盒服务,而是一张可以 EXPLAIN 的表:前端可以把 RRF 的两路排名并排展示,让用户看到"为什么这个 chunk 被选中";Agent 应把"向量路认为相关的"和"词面路认为相关的"分开记 trace,阈值拒答是一等状态而不是异常。迁移到托管向量库时,ACL 前置这条纪律必须跟着走——先确认目标库的过滤是否在索引内部生效。
资源 / 成本 / 隐私
bge-small-zh-v1.5 本地下载约 95MB、CPU 可跑,gross cost 为 0;模型权重只进本地 HF 缓存,不入库。Gemini 对照有免费层但会把 chunk 文本发给第三方 API,默认不启用;私人资料不得进入索引(空 ACL 不等于公开)。.db 文件是派生产物,可随时删除重建。
Evidence
仓库当前机器证据(只读快照)
evidence/12-rag-live-v1.json 是当前 checkout 的脱敏机器运行记录:20 题评估跑在真实 bge-small-zh-v1.5 上,实战版 recall@1/recall@5 = 1.0/1.0,教学版 0.588/0.706(分母 17),引用正确率 1.0,无答案题拒答率 1.0(分母 3),无依据断言率 0.0。它只覆盖该 JSON 记录的命令与指标:评估集只有 20 题、语料只有 2 篇课程文档(38 个 chunk),recall 1.0 不构成分布外检索质量的声明;阈值 0.45 只对本语料+本模型有效;Gemini provider 未实测。它不是学习者提交,也不能推出学习者已完成本章。
学习者提交模板(待填写,不是当前机器证据)
复制下面模板并填写自己的真实运行结果。所有 <...> 都是未填写状态;actual 和 artifacts 尤其不能被当作已运行或已通过。artifacts 必须替换为本次提交中真实存在的仓库相对路径。
yaml
schema: learn-llm.evidence.v1
module: 14-rag-live
commit: <learner-commit-sha>
verified_at: <iso-date>
environment: <sanitized-python-device>
seed: 9
commands:
- PYTHONPATH=python python -m pytest python/tests/test_rag_live.py -q
- PYTHONPATH=python python <learner-live-rag-eval>
metrics:
- name: live_recall_at_5
expected: <versioned-threshold>
actual: <recorded-value>
- name: citation_correctness
expected: <versioned-threshold>
actual: <recorded-value>
- name: unanswerable_refusal_rate
expected: <versioned-threshold>
actual: <recorded-value>
- name: unsupported_claim_rate
expected: <versioned-threshold>
actual: <recorded-value>
artifacts:
- <learner-repo-relative-artifact-path>
cost:
gross_usd: 0
credit_usd: 0
licenses:
- source: <source>
version: <version>
license: <license>
attribution: <attribution>
redistribution: <redistribution>
known_failures:
- <sanitized-failure-or-none>模型未下载、阈值未标定或评估集缺无答案题时,本章保持 gate;hash provider 的离线绿测不宣称语义检索质量。
下一步
进入 第15章 · Typed Tools、MCP 与可恢复 Agent:把本章的知识库问答接到可校验的工具循环,让 answer 从「渲染证据」变成「基于证据生成」,引用正确率与无依据断言率也要从 token 重叠升级为逐主张核验。