Agent Eval · 起点

Agent Eval:把 agent 的"好不好"变成可测量的数字

面向工程实践的 AI agent 评测系统教程。覆盖:评什么、怎么评、凭什么相信判分、怎么建数据集与回归流程、用什么工具、领域走向。

·适合谁

这份教程假设读者具备三项能力。三项都对得上,阅读体验最顺:

  • 能用 Python 调一次 LLM API,读得懂 dataclass 和装饰器。
  • 搭过或正在搭一个会调用工具 / 检索的 agent——哪怕只是个 demo。本教程多处以一个真实的"个人情报员 Agent"为落地对象。
  • 知道 RAG / embedding / 检索大致是什么。评测组件层会用到 faithfulness、context recall 这些检索质量指标。

·不适合谁

  • 完全没碰过 LLM 应用:先读 llm-api 与 prompt-engineering,再回来。
  • 只想钻 Reflexion / Self-RAG 的推理机制本身(不关心怎么评测):第 5 章给了运行期 Evaluator 的 eval 视角,机制细节在 agent-reasoning-patterns。
  • 想要传统 ML 模型评估(AUC、混淆矩阵那一套):本教程讲的是 LLM / agent 这类生成式、非确定系统的评测,方法论不同。

·读完之后你能做到什么

读完,agent eval 在脑子里会变成一套工程纪律——先读 trace 做错误分析、由真实错误反推 rubric、建有代表性的回归集、用校准过的 judge 把每次改动变成可比的分数;并且知道判分器本身需要被验证(judge 不可能超过人类标注之间的一致性天花板),以及 2026 年这个领域正在从"比能力"转向"比可靠性"。具体可验证的能力:

  • 判断一段 eval 讨论说的是"评测体系(A)"还是"运行期 Evaluator(B)",不再混为一谈。
  • 给一个任务选对打分方法(reference-based / pointwise / pairwise / G-Eval),并说得出为什么。
  • 设计一个 LLM-as-a-judge 的 rubric,并用 golden set + Cohen's κ 校准它。
  • 为自己的 agent 建一个分四层、含边界 / 对抗 / 敏感样本的回归数据集。
  • 在 8 个主流 eval 工具里按场景选型,并避开已被取代的做法(BLEU/ROUGE 评开放式生成、单次 pass@1)。

一句话本质

Agent eval 的本质,是把"感觉变好了"变成一个可重复、可回归的测量量。

传统软件测试断言「输出 == 期望」;agent 输出非确定、多步、常常没有唯一正解,断言不了——于是 agent eval 改为断言「这一版的分数 ≥ 上一版」。没有它,换模型、改 prompt 都是盲赌:可能修好了一个问题,同时悄悄弄坏了三个,而你不知道。

·现状速览(截至 2026-06)

什么稳 / 什么在变 / 什么过时

已稳定(放心学):评什么的四层模型、LLM-as-a-judge 作为开放式打分的主力、离线回归数据集;SWE-bench Verified、GAIA 这类基准。

正在快速变化(2025–2026,带日期学):判分器本身成了研究对象(judge 偏差校准、LLM-as-jury、"谁来验证验证者");轨迹 eval 升为一等公民(LangSmith 2025–26 上 Trajectory 模式);pass^k 可靠性指标取代单次 pass@1——Holistic Agent Leaderboard 在 ICLR 2026 甚至暂停能力排名、转做可靠性;eval 与可观测性工具合并(2026 初 OpenAI 收购 Promptfoo、ClickHouse 收购 Langfuse)。

已被取代(别当成现状学):BLEU / ROUGE 评开放式生成、单次 pass@1、凭 demo 感觉评判。第 4 章逐条说明替代方案。

读之前 · 关于"读懂了"的错觉

这份教程会刻意在每章末尾设置自测与判别题。原因是:流畅地读完一段,和真正建立起判断力,是两回事。读的时候如果冒出这三句心里话,它们多半是错觉信号,不是掌握信号——

「我读得很顺」(熟悉,不等于学会);「我做题很快」(多半是题型眼熟);「我没卡壳」(多半没真正碰到难点)。碰到自测题,先合上教程动笔,再对答案。

·概念地图

这张图是后面所有细节的挂钩。中心是本教程的主体——评测体系(A);六个方向是它的六个子问题;右侧虚线那一格是另一回事、但常被混为一谈的运行期 Evaluator(B)——第 5 章专门展开 B,并讲清它和 A 怎么接上。

Agent Eval 评测体系 · A eval 数据集 拿什么评 代表性样本 离线 + 在线 + regression 何时评 每次改动跑一遍 评什么 · 四层 结果·轨迹·组件·安全 怎么评 · 方法 reference · LLM-judge 信不信 · 校准 golden set + κ 用什么 · 工具层 8 个评测框架 运行期 Evaluator · B Reflexion / Self-RAG ≠
图 0.1评测体系(A)的六个子问题,外加一条容易踩错的边界。注意:右侧虚线框的 B(运行期 Evaluator)和中心 A 都会"用模型打分",但 A 在开发期对固定数据集跑、B 在每次任务推理时跑——技术相通,目的与时机完全不同。

·学习路径建议

按目的挑一条线,不必从头读到尾:

  • 只想厘清概念、不被两个 eval 搞混:第 1 章 → 第 5 章自测的"概念层"。
  • 要给自己的 agent 落地一套 eval:第 1 章 → 第 2 章 → 第 3 章(重点 §3.5 落地)→ 第 4 章选型。
  • 做工具选型 / 带读他人的 eval 代码:第 1 章(四层)→ 第 2 章(方法)→ 第 4 章(工具横评)。
  • 准备面试("你怎么评估你的 agent"是高频题):全程通读 + 第 5 章应用判别题。

·目录

·学完之后

这份教程之后,几个自然的下一步,以及它们在已有结构上加了什么:

  • 运行期 Evaluator(B)的推理机制:第 5 章给了 B 的 eval 视角;要钻 Reflexion / Self-RAG / ToT 的推理机制本身,去 agent-reasoning-patterns。
  • RAG 专项评测:把组件层的 faithfulness / context recall 落到检索实现(rag · 质量章)。
  • prompt 工程与 eval 的闭环:eval 给出的信号怎么回流到 prompt 迭代(prompt-engineering)。
  • 多 agent 系统评测:角色分工与协作轨迹怎么评——比单 agent 多一层"谁该负责"的归因问题。