直接回答:生产级 RAG 的完整链路是:文档解析与清洗 → 分块(chunking)→ 向量化入库 → 查询改写/扩展 → 检索(向量+关键词混合)→ 重排序(rerank)→ 拼接上下文 → LLM 生成 → 引用标注与答案校验。每一步都有质量损耗,整体效果是各环节准确率的乘积,所以要逐环节建立评测。

实践要点:解析环节常见坑是 PDF 表格和双栏排版被切碎,需要版式感知解析;分块不宜定长硬切,按语义/标题层级切并保持 10%~20% 重叠;检索用向量加 BM25 混合(RRF 融合)能同时覆盖语义与专有名词;rerank 用交叉编码器对 top-50 精排到 top-5,是性价比最高的单点优化;生成环节要在 prompt 中要求"仅依据给定资料作答,不知道就说不知道"并输出引用编号。工程上还要考虑:增量索引、元数据过滤(按租户/时间)、检索失败的兜底话术、以及端到端评测集(问题-标准答案对)驱动迭代,而不是凭感觉调参。

追问方向:HyDE 和查询改写分别解决什么?如何评估检索召回率?多租户下如何做向量库隔离?

(约 430 字)