面
ohmyinterview
搜索
首页
博客
工具箱
文档
书房
影院
游戏
成语
参数
菜谱
汉字
热榜
#评测
人工智能
困难
大模型基准测试的“数据污染”问题是什么?如何识别与规避?
2026-08-15
人工智能
困难
如何为一个 LLM 应用设计完整的评测体系?离线评测与在线评测如何配合?
2026-08-15
人工智能
困难
代码生成评测中的 pass@k 指标是什么?如何无偏估计?
2026-08-15
人工智能
困难
Agent 系统的端到端评测怎么做?为什么比单模型评测难得多?
2026-08-15
人工智能
困难
LLM-as-a-Judge 自动评测有哪些已知偏差?如何提高评判的可靠性?
2026-08-15
人工智能
困难
RAGAS 等 RAG 评测框架的核心指标有哪些?如何搭建 RAG 的持续评测流水线?
2026-08-15
人工智能
中等
如何评测一个大模型应用的效果?离线评测和线上监控分别怎么做?
2026-08-14