直接回答:完整评测体系分四层:能力基准(通用榜单,选型参考)、任务评测集(业务场景的真实 query + 标准答案或评分 rubric,回归守门)、在线指标(采纳率、改写率、点赞点踩、会话完成率)、人工抽检(定期抽样标注校准前两者)。离线评测负责“改动能不能发”,在线评测负责“发了效果好不好”,两者必须闭环。
展开解析:落地顺序:先建任务评测集——从线上日志挑 200~500 条覆盖核心场景与长尾 badcase,每条配期望行为,这是最高优先级资产;然后定指标——事实型任务用精确匹配或程序化校验,开放型任务用 LLM judge 加 rubric,再配 5%~10% 人工标注算 judge 一致性;接入 CI,每次改 prompt、换模型、调检索都跑回归,核心指标下降即拦截。在线侧:埋点采集用户行为信号,A/B 实验验证离线结论——离线高分不等于线上好用,已知反例是答案更详细得分更高但用户嫌啰嗦。最后建 badcase 回流机制:线上差评样本每周进评测集,评测集随业务滚动更新防止过拟合。常见坑:只测平均分不看尾部(5% 的严重错误可能致命)、评测集长期不变被迭代“刷穿”、judge 与线上用户偏好漂移不校准。
追问方向:评测集规模多少合适?如何处理评测集与训练数据的隔离?
(约 470 字)