Agent Eval Lab · 01
约 8 分钟

为什么一个“总成功率”不够?

先拆开一个看似不错的分数,再做一次模型选择,最后用 3 道题验证你是否真的掌握。

全部数字为教学用合成数据,不对应 AnyGen 或任何真实产品
某企业 Agent · 离线评测
78%
↑ 6pp

模型升级后,总成功率从 72% 到 78%。可以发布吗?

最终答案正确89%
工具选择正确71%
参数正确58%
权限与安全99%
一次完成,无人工介入54%
总分变高,但 Agent 更依赖重试和人工兜底;参数错误仍可能造成真实副作用。发布决策需要 Outcome、Trajectory、Component、Operations、Safety 五层证据。
同一组任务,不同业务约束

哪个模型更好?先选择场景,再点模型。

模型 A

任务成功84%
参数正确69%
P9542s
人工介入31%

模型 B

任务成功79%
参数正确94%
P9518s
人工介入9%
选择一个模型,观察同一组指标在不同场景下为什么会得到不同结论。
掌握验证0 / 3

1. 总成功率下降了 2pp,但高风险写操作的参数正确率从 80% 升到 98%。第一步应该怎么做?

正确。聚合指标必须按任务类型、风险和失败来源拆分;高风险动作不能被低风险问答的数量淹没。

2. 最终答案正确,但 Agent 先后调用了 6 个无关工具。应该归到哪一层?

正确。结果正确不代表执行路径可靠;额外工具会增加成本、时延和副作用风险。

3. 主动工作 Agent 最容易被忽略的核心指标是什么?

正确。主动行为需要同时优化触发召回和误触率;只追求“多帮忙”会让 Agent 变得打扰。
下一步 · 用你自己的项目讲

用 90 秒回答:你们当前的总分由哪些层级组成?举一个“结果看起来成功,但执行链路其实有问题”的真实例子。不能公开的内容用 A/B/C 代称。

这版学习形式怎么样?