直接回答:难点在 Agent 是“模型 × 多步 × 环境”的组合:同一任务多条正确路径(步骤级标注失效)、环境有状态且不确定(网页会变、API 会挂)、错误会级联(第一步错后面全错但也可能自我修正)。端到端评测因此以结果为主:任务成功率(终态是否达标)加过程指标(步数、成本、耗时),辅以轨迹抽查。

展开解析:评测集构建:选 50~200 个代表性任务,每个定义可程序化判定的成功终态(文件生成了吗、数据库状态对吗、答案包含关键事实吗)——判定器尽量代码化,判不了的用 LLM judge 加 rubric 再加人工抽检。环境要可复现:固定外部依赖(录制的网页快照、mock API),否则分数波动分不清是模型变了还是世界变了。指标体系三层:效果(成功率,按任务难度分层报)、效率(平均步数、token 成本、墙钟时间——成功率相同成本差三倍是质的差别)、安全(危险操作次数、越权尝试拦截率)。过程评估补充因果:轨迹回放统计常见失败模式(规划错误、工具误用、环境理解错),指导迭代方向。统计纪律:单次运行方差大,每配置至少跑 3 次取分布;排行榜式单数字误导性强,按任务类别拆开看。SWE-bench、WebArena 是公开参考,但业务 Agent 必须自建私有集。

追问方向:如何评测 Agent 的“自主性”(人工介入次数)?评测环境与生产漂移怎么办?

(约 480 字)