直接回答:RAGAS 把 RAG 质量拆成两维四类指标:检索侧看 context precision(召回的块有多少真的相关)与 context recall(标准答案所需信息被召回的比例);生成侧看 faithfulness(答案是否忠于检索内容、有无编造)与 answer relevancy(答案是否切题)。评测不需要人工标注,用 LLM 拆解答案逐条比对上下文即可自动跑分,适合接入 CI。
展开解析:流水线搭法:先沉淀评测集——从真实用户 query 里挑 100~500 条,每条配标准答案或关键事实点,这是最重要的资产,比选哪个框架重要得多。然后固化评测脚本:跑全链路输出答案与召回上下文,逐条算四类指标,记录版本号(分块策略、embedding 模型、prompt 版本)与分数。每次改动(换模型、调块大小、改 prompt)必须跑回归,指标下降就拦截。注意指标的坑:LLM 评分有噪声,单条不可信,要看整体分布与显著差异;context recall 依赖标准答案完整性,答案不全时该指标失真;线上还要补用户侧信号(点赞点踩、改写率)做闭环,离线高分不等于线上好用。
追问方向:没有标准答案时如何评测召回?评测集如何防过拟合?A/B 实验与离线评测如何配合?
(约 450 字)