RAG 是检索加生成的串联系统,评估必须分环节拆解,否则无法定位问题。检索环节:上下文召回率(答案所需信息是否被检索到)、上下文精确率(检索结果中有多少真正相关)、MRR/命中率。生成环节:忠实度(回答是否完全由检索内容支撑、有无编造)、答案相关性(是否回应了问题)、答案正确性(与标准答案比对)。
落地方法:构建带标准答案的评测集(几十到几百条真实用户问题,覆盖常见与长尾),用 RAGAS、DeepEval 等框架以 LLM-as-Judge 自动打分,辅以人工抽检校准裁判偏差;线上通过用户反馈(点赞点踩、引用点击率)持续监控。评估驱动迭代:召回低就调分块、嵌入模型、加混合检索;忠实度低就改提示、换更强模型、加引用约束。
易错点:LLM-as-Judge 有位置偏好和宽松倾向,需用标注样本验证裁判一致性;只看端到端正确率会掩盖检索层的退化。追问方向:如何构建不漏关键场景的评测集?回归测试如何接入 CI?