如何评估 AI Agent?当问题没有唯一正确答案时
摘要:AI Agent 具备非确定性、开放式和多步骤三大特性,导致传统软件测试方法失效。本文介绍一种可重复的评估循环——定义、测量、测试、信任,帮助开发者用证据取代猜测,持续验证 Agent 的真实能力。
为什么传统测试方法不适用于 Agent
传统软件测试有一个隐含前提:答案已知。给定一个输入,断言某个输出是否与预期一致。但 AI Agent(能自主规划、调用工具完成任务的人工智能程序)在三个层面击穿了这一前提:
- 非确定性:同一输入可能产生不同输出,无法断言结果必然相等。
- 开放式:大多数真实任务没有唯一正确答案,只有更好与更差的区别。
- 多步骤:Agent 的规划、工具调用、多轮推理链条很长,任何一环出错都可能被最终结果掩盖。
用一个演示版、几次手动尝试,再加一点运气来维护一个 Agent,本质上是在猜。而评估(Evaluation)提供了一条替代路径:用一套可重复的方法,回答"这个 Agent 在我们关心的各类场景下,能否达到我们的要求",并得到一个可执行的结论。
评估是什么
评估是一套可重复的循环,核心目标是把"看起来能跑"变成"我们实测过"。
Demo 只能测到你想过的情况,而生产环境里遇到的,往往都是你没想到的情况。评估的意义在于,让每一次改动都有据可依,而不是靠直觉判断。
评估循环
所有评估系统本质上都是同一套循环的变体,包含四个环节:
① 定义(DEFINE):明确任务中"好"的标准是什么。
② 测量(MEASURE):按照标准给 Agent 打分,获得可量化的结果。
③ 测试(TEST):每次改动后运行评估,捕捉行为退化(回归问题)。
④ 信任(TRUST):确认运行稳定后上线,并持续跟踪。
该测量什么
没有任何单一数值能衡量一个 Agent 的优劣。需要挑选对任务最重要的几个维度,并接受它们之间有此消彼长的权衡。
值得优先关注的四个维度:
- 任务成功率:Agent 是否完成了用户想要的事?
- 忠实度:答案是依据事实得出的,还是凭空编造的?
- 安全性:是否规避了有害或超出权限范围的动作?
- 成本与延迟:运行速度是否够快、花费是否够低,支撑得起实际使用?
只盯着一个维度会掩盖取舍。比如一个回答准确但速度极慢的 Agent,在真实场景中未必比速度更快、准确率略低的方案更实用。
先评估,再优化
无法衡量,就无法改进。没有基线数据,你甚至无法判断一次"优化"是真实改进还是另一种方向的退化。对任何严肃的 Agent 项目而言,第一步是建立一套能反映"好"的质量标准。在此之后,优化才有意义——否则你只是在凭感觉调整,恰恰落回了评估想消除的猜测陷阱。
从哪里开始
从小处着手:挑两三个关键维度,写十个真实的测试用例,打分,然后逐步扩展。几个精心设计、覆盖真实风险的场景,比一千个泛泛而谈的用例更有价值。
评估是一项会持续增值的资产。每发现一个 bug,测试集就扩充一次,Agent 的质量基线就抬高一截。它是你有目的地改进 Agent、而不是依赖运气的核心工具。