Agent Eval · 起点
Agent Eval:把 agent 的"好不好"变成可测量的数字
面向工程实践的 AI agent 评测系统教程。覆盖:评什么、怎么评、凭什么相信判分、怎么建数据集与回归流程、用什么工具、领域走向。
·适合谁
这份教程假设读者具备三项能力。三项都对得上,阅读体验最顺:
- 能用 Python 调一次 LLM API,读得懂
dataclass和装饰器。 - 搭过或正在搭一个会调用工具 / 检索的 agent——哪怕只是个 demo。本教程多处以一个真实的"个人情报员 Agent"为落地对象。
- 知道 RAG / embedding / 检索大致是什么。评测组件层会用到 faithfulness、context recall 这些检索质量指标。
·不适合谁
- 完全没碰过 LLM 应用:先读 llm-api 与 prompt-engineering,再回来。
- 只想钻 Reflexion / Self-RAG 的推理机制本身(不关心怎么评测):第 5 章给了运行期 Evaluator 的 eval 视角,机制细节在 agent-reasoning-patterns。
- 想要传统 ML 模型评估(AUC、混淆矩阵那一套):本教程讲的是 LLM / agent 这类生成式、非确定系统的评测,方法论不同。
·读完之后你能做到什么
读完,agent eval 在脑子里会变成一套工程纪律——先读 trace 做错误分析、由真实错误反推 rubric、建有代表性的回归集、用校准过的 judge 把每次改动变成可比的分数;并且知道判分器本身需要被验证(judge 不可能超过人类标注之间的一致性天花板),以及 2026 年这个领域正在从"比能力"转向"比可靠性"。具体可验证的能力:
- 判断一段 eval 讨论说的是"评测体系(A)"还是"运行期 Evaluator(B)",不再混为一谈。
- 给一个任务选对打分方法(reference-based / pointwise / pairwise / G-Eval),并说得出为什么。
- 设计一个 LLM-as-a-judge 的 rubric,并用 golden set + Cohen's κ 校准它。
- 为自己的 agent 建一个分四层、含边界 / 对抗 / 敏感样本的回归数据集。
- 在 8 个主流 eval 工具里按场景选型,并避开已被取代的做法(BLEU/ROUGE 评开放式生成、单次 pass@1)。
一句话本质
Agent eval 的本质,是把"感觉变好了"变成一个可重复、可回归的测量量。
传统软件测试断言「输出 == 期望」;agent 输出非确定、多步、常常没有唯一正解,断言不了——于是 agent eval 改为断言「这一版的分数 ≥ 上一版」。没有它,换模型、改 prompt 都是盲赌:可能修好了一个问题,同时悄悄弄坏了三个,而你不知道。
·现状速览(截至 2026-06)
已稳定(放心学):评什么的四层模型、LLM-as-a-judge 作为开放式打分的主力、离线回归数据集;SWE-bench Verified、GAIA 这类基准。
正在快速变化(2025–2026,带日期学):判分器本身成了研究对象(judge 偏差校准、LLM-as-jury、"谁来验证验证者");轨迹 eval 升为一等公民(LangSmith 2025–26 上 Trajectory 模式);pass^k 可靠性指标取代单次 pass@1——Holistic Agent Leaderboard 在 ICLR 2026 甚至暂停能力排名、转做可靠性;eval 与可观测性工具合并(2026 初 OpenAI 收购 Promptfoo、ClickHouse 收购 Langfuse)。
已被取代(别当成现状学):BLEU / ROUGE 评开放式生成、单次 pass@1、凭 demo 感觉评判。第 4 章逐条说明替代方案。
这份教程会刻意在每章末尾设置自测与判别题。原因是:流畅地读完一段,和真正建立起判断力,是两回事。读的时候如果冒出这三句心里话,它们多半是错觉信号,不是掌握信号——
「我读得很顺」(熟悉,不等于学会);「我做题很快」(多半是题型眼熟);「我没卡壳」(多半没真正碰到难点)。碰到自测题,先合上教程动笔,再对答案。
·概念地图
这张图是后面所有细节的挂钩。中心是本教程的主体——评测体系(A);六个方向是它的六个子问题;右侧虚线那一格是另一回事、但常被混为一谈的运行期 Evaluator(B)——第 5 章专门展开 B,并讲清它和 A 怎么接上。
·学习路径建议
按目的挑一条线,不必从头读到尾:
- 只想厘清概念、不被两个 eval 搞混:第 1 章 → 第 5 章自测的"概念层"。
- 要给自己的 agent 落地一套 eval:第 1 章 → 第 2 章 → 第 3 章(重点 §3.5 落地)→ 第 4 章选型。
- 做工具选型 / 带读他人的 eval 代码:第 1 章(四层)→ 第 2 章(方法)→ 第 4 章(工具横评)。
- 准备面试("你怎么评估你的 agent"是高频题):全程通读 + 第 5 章应用判别题。
·目录
·学完之后
这份教程之后,几个自然的下一步,以及它们在已有结构上加了什么:
- 运行期 Evaluator(B)的推理机制:第 5 章给了 B 的 eval 视角;要钻 Reflexion / Self-RAG / ToT 的推理机制本身,去 agent-reasoning-patterns。
- RAG 专项评测:把组件层的 faithfulness / context recall 落到检索实现(rag · 质量章)。
- prompt 工程与 eval 的闭环:eval 给出的信号怎么回流到 prompt 迭代(prompt-engineering)。
- 多 agent 系统评测:角色分工与协作轨迹怎么评——比单 agent 多一层"谁该负责"的归因问题。