7 天 Agent 评估与可观测:让「感觉还行」变成可复现的数字
第 1 周 · 从「感觉还行」到一套能拦住退化的评估系统
为什么 Agent 不能靠「试几次感觉还行」
先说清楚 Agent 比单轮对话多出的三个评估难点,再建立全课通用的五个术语与评估分层,最后用一次跑五遍的实验把非确定性变成两个能写进报告的数字:至少成一次的概率,和五次全成的概率。
基准集:把线上翻过的车变成可复现的任务
评估的上限由任务质量决定,而不是由指标公式决定。这一天从工单与失败日志里反向出题,定下好任务的两个判据,补齐最容易被漏掉的反向用例,并用参考解把每一条任务本身验证一遍。
让模型当裁判,再把裁判本身考一遍
能用代码判的绝不该交给模型,但开放式质量确实只能让模型来判。这一天写出评分量表与成对比较,用位置交换实测出裁判的三种系统性偏好,再用一致性系数而不是准确率来决定这个裁判能不能用。
轨迹评估:它到了终点,但一路上撞了几次
只看结果态会放过一整类故障:答案对了,可是它多花了十倍的钱、绕了七步、还调了一个本不该碰的工具。这一天给轨迹本身写评分器,做工具序列判定、循环检测与步数预算,并用模拟用户把单轮评估扩展到多轮。
可观测:给每一次运行装上行车记录仪
离线评估只覆盖你想得到的任务,线上才有真实用户。这一天按公开的生成式 AI 语义约定给靶子埋点,把一次运行变成一棵可查的链路树,聚合出成本与延迟面板,并把前四天的评估分数本身也当成遥测数据上报。
回归门禁:让退化在合并之前就被拦住
评估只有进了流水线才会真正拦住事故。这一天把基线固化成快照,在一个每次跑分都会抖动的系统上定出既不漏报也不天天误报的阈值,再解决流水线里最现实的两个问题:跑一次要多少钱,以及红了之后谁来判断真假。
体检套件本身:饱和、坏任务与判分缺陷
最后一天把矛头转向评估系统自己。一个逼近满分的套件已经不再提供信息,一条判分写错的任务会让一个好模型看起来差五十个百分点。这一天给套件做体检、建立读轨迹的纪律,并把七天的产物收成一个能放进简历的项目。