按数据流向排查:第一层检索不到——分块不合理(语义被切断)、嵌入模型与领域不匹配、用户查询与文档措辞差异大(用查询改写、HyDE 桥接)、top-k 太小;第二层检索到但没排前——加混合检索和 rerank,检查元数据过滤是否误伤;第三层检到了但模型没用好——上下文过长导致'中间遗忘'(精简到最相关的 3-5 块并排序)、提示模板没要求基于资料回答和引用来源、模型能力不足或 temperature 过高;第四层问题本身不适合 RAG——需要全库聚合的统计类问题('一共多少条')检索式架构天生不行,应路由到 SQL/工具。
方法论:建评测集量化各环节指标,先修最短板;保留 badcase 库做回归。
易错点:一上来就换更大模型,但多数 RAG 质量问题出在检索侧;盲目增大 top-k 会引入噪声降低忠实度。追问方向:GraphRAG(知识图谱增强)解决什么传统 RAG 做不了的问题(多跳关系推理、全局总结)?Agentic RAG 的按需多轮检索适合什么场景?