FDE01前线交付
资料更新 02

评估智能体:确认任务真的完成了

不要只看“已完成”回答,也查业务系统里的结果。

本页内容这份资料与你的项目有什么关系在项目里怎么用参考资料

这份资料与你的项目有什么关系

智能体可能在多轮任务中调用工具、修改记录,再根据中间结果继续操作。最终回答正确时,仍可能出现重复申请、漏掉步骤或未经授权访问。

做评估记录时,分别写清任务、运行环境、每次测试、执行过程和最终业务状态。请熟悉业务的人检查结果和错误后果,保留不同意见。模型评分可以帮助筛查,但不能代替专业判断。

同一任务多试几次,可能走出不同的执行过程。记录模型、提示、工具、权限、资料版本和测试条件;重要条件改变后,重新检查相关任务。一次成功还不能说明系统稳定。

决定开放给用户之前,分组检查不同任务和场景,列出必须解决的问题、支持安排、停止负责人和重测条件。这些建议来自工程资料的归纳;要测试多少样例、设置什么标准,仍应根据任务后果决定。

在项目里怎么用

选一个你正在做的任务,看看这篇介绍的方法是否适用。写下要补查什么、可能改变哪一步、由谁处理,以及什么时候再检查;没有真实项目时,也可以用案例练习。

参考资料

Anthropic / Demystifying evals for AI agents Google SRE / Canarying releases