FDE01前线交付
课程 08

评估系统,决定能否试用

怎样判断系统已经可以交给用户试用?

本页内容学完这一课,你可以开始之前先说清什么算完成,再决定怎样评分读具体样例,建立自己的错误分类五类检查分别过关,不能互相抵消分组看任务,避免平均数掩盖少数失败示例:把“94%”改成具体试用建议理解实验通过,和真实试用之间的距离把决定写给需要照着工作的人动手练习检查你的理解本课记录与下一步参考资料

学完这一课,你可以

  • 从实际任务与错误后果建立样例和判定标准,而不是先抄一个默认指标。
  • 分别检查任务结果、系统行为、用户体验、风险与运行支持,并按任务分组看数量。
  • 提出有证据支持的暂停、补证、影子模式或受限试用建议。

开始之前

  • 带上第 4 课成功标准、第 5 课工作流、第 6 课测试记录和第 7 课风险与负责人清单。
  • 使用北辰公开事件里的评估摘要与实验环境证据;二者是不同材料,不能合并成同一份真实评估报告。

查看北辰案例与入门数据

试用前分别检查五件事
试用前分别检查五件事逐项检查,不能用总体好成绩抵消重大问题。按任务和用户分组查看结果,让有权限的负责人决定能否试用。任务结果系统行为用户体验风险运行支持继续试点 / 限制范围 / 停止
逐项检查,不能用总体好成绩抵消重大问题。按任务和用户分组查看结果,让有权限的负责人决定能否试用。左右滑动查看完整图表。

先说清什么算完成,再决定怎样评分

评估是为了决定下一步可以做什么。以备件草稿为例,成功不是模型说“已处理”,而是草稿包含正确、可追溯的信息,缺失项得到说明,工程师知道还未提交,任务保持在授权范围内。若以后验证工具提交,还要查询正式业务记录,不能只看最后一段回答。

为每条样例写输入、设备与资料条件、用户角色、允许动作、预期结果和不可接受的后果。要求应彼此一致:如果任务只允许生成草稿,评分器不能因为“没有提交申请”判失败;如果资料不足,合理升级也不应因为没有给出完整建议而扣成错误。

Anthropic 的智能体评估文章区分任务、每次试验、轨迹、评分和最终状态。你可以据此保留能解释结果的记录。对北辰还需要实际业务判断:一段合规的工具调用轨迹不能证明手册适用,一条正确回答也不能证明夜班有人支持。

读具体样例,建立自己的错误分类

先逐条查看请求、资料、建议、用户动作与最终记录,用日常语言写清哪里出了问题。先记录最早发生、能够解释后续结果的错误;后续后果也保留,但不要把同一条上游故障拆成很多独立失败,造成数量失真。然后把相似情况归类,选择哪些能自动检查、哪些需要人判断。

北辰可以出现版本不适用、应升级却未升级、把状态未知说成完成、越权动作、信息正确却不能执行、修改负担过大等类型。每类记录影响谁、能否及时发现、能否补救、需要哪种资格判断,以及是否阻止试用。通用清单用于补漏,不能替代你实际观察到的任务。

确定性检查适合明确字段、权限与状态;模型评分可辅助开放式表达,但需要与合格人员的判断校准。保留“不足以判断”选项。如果两人争论是因为缺设备状态,就补信息;因为权限冲突,就交给负责人;只有尺度不同才通过具体样例校准,不能靠投票消除真实争议。

五类检查分别过关,不能互相抵消

把证据整理成五类:任务结果、系统行为、用户体验、风险、运行支持。每类都写来源、样例数量、适用条件、尚缺证据和负责人。它们分别回答不同的问题,不能用“总分很高”抵消未满足的试用条件。

风险这一类接上课:数据用途是否获准,访问与资料撤回控制是否测试,哪些后果不能接受、谁能作相应判断。运行支持则检查是否真的有人接手、怎样暂停、排队任务怎样处理、何时恢复。有人签字但控制未经验证,或计划上有人而实际无可用时间,都不能写成已满足。

业务价值到第 11 课再结合采用、成本与因果证据分析。本课可以记录处理耗时、复核负担与支持成本作为后续输入,但不由分数或省下几分钟推导年度收益。任务能试用,与值得扩大投入,是相连但不同的决定。

检查类别北辰具体检查不能拿什么替代
任务结果草稿正确完整、知道尚未提交回答流畅或用户点击接受
系统行为版本、权限、工具状态与正式记录一致只看最后一段回答
用户体验用户能理解、修改、拒绝并找到帮助培训完成或满意度
风险具体高后果情景有经验证控制与有权判断平均分或笼统签字
运行支持实际容量、人工接手、暂停与恢复可用值班表上的名字

分组看任务,避免平均数掩盖少数失败

按影响结果的条件分组,例如白班和夜班、旧型号和新型号、资料完整和资料缺失。这些分组在评估中也叫“切片”。分组不只是多画几张图:当一个组存在严重失败,你需要改变允许的任务范围、补证或停止,而不能用其他组的成功抵消。

报告同时写通过数和总数,这个总数就是分母。“旧型号 4 条里失败 2 条”比只写“总体 94%”更有用,因为读者能看见该组很少、问题很大。分组样例可以重叠,例如同一条既是夜班又是旧型号;汇总时不能把各组数量相加当独立任务总量。

保留常见任务,也选拒绝、缺失信息、权限变化、撤回资料和重要少数组。开发中反复看过的样例用来防止回归,另留未参与调试的任务观察新情况。多个试验要记录每次结果、清理前次状态,不要只保留最好的回答或把共享缓存带来的便利当能力。

示例:把“94%”改成具体试用建议

北辰公开事件给出总体通过率 94%,比上一轮提高 6 个百分点;旧型号 4 条中失败 2 条;夜班高温任务出现不适用型号的危险建议;复核容量只有计划的一半。这是合成情景的新资料,不是 20 条入门 JSON 的统计结果。总体分母没有提供,不能反推一个精确任务总数。

其中还有“旧型号失败被稀释成 1.5 个百分点”的描述,但没有足够材料核对其分母与舍入方法。学习时保留这个限制,直接使用可核对的 2/4,以及具体危险建议与容量缺口。94% 对比上一轮提高 6 个百分点,按给定摘要上一轮是 88%;这不同于“提高 6%”。

这组事实不能直接推出“所有白班任务都安全”。如果白班、现行型号、低后果任务有独立且充分的支持证据,才可讨论受限试用;目前没有这组完整证据,就建议补证或用合成数据演示。排除旧型号也不能自动修复资料过滤,须验证限定确实执行。

  • 重写摘要:把总体数字放在背景,先列危险建议、旧型号 2/4 失败和复核容量减半,以及各项尚缺资料。
  • 追查任务:核对输入的设备型号、引用版本、系统检查与用户能看到的信息,定位最早的不符合要求之处。
  • 分别检查五类:哪些已有记录,哪些只有计划,哪些仍待具备资格的人判断;不要把未知涂成通过。
  • 比较选择:暂停真实试用并补证;保留合成演示;或在取得额外证据后讨论受限范围,说明不同代价。
  • 写建议:明确人、任务、资料、时段与动作范围,列排除项、停止条件、实际接手、观察窗口和复核依据。
  • 应对提前期限:缩小演示内容、保持原流程或延后真实试用;不把期限变成降低风险要求的理由。

理解实验通过,和真实试用之间的距离

实验环境证据显示 28/28 通过,分组包括权限、时效、检索、工具、故障恢复等。它使用确定性后端,不发起网络请求,样例在开发中反复运行。它能说明这些已知情景没有出现已检查的回归,不证明真实模型表现、真实用户行为或外部接口故障都被覆盖。

报告中时效组只有 2 条;这不是不重要,而是覆盖有限。你可以增加撤回传播中间状态、调岗后旧会话、权限变化与资料版本交叉情景。样例数取决于需要回答的风险问题与证据强度,不能从 28/28 推导一个统一上线阈值,也不能把新增合成测试说成真实用户验证。

给每次结果留下版本:模型、提示、检索资料、工具、权限规则、运行环境与时间。改动后按影响范围重跑相关测试,同时检查可能的连带影响。评估是持续工具:用户发现的新错误应加入回归样例,新的任务范围则需要新的判断,不能一直沿用初次通过报告。

把决定写给需要照着工作的人

试用决定不是只有上线或不上线。可以停止、补证、仅用纸面或影子模式、限定范围,或在证据充分时进入小范围试点。影子模式也要有获准数据与明确隔离,生成的建议不能悄悄进入真实处置;不要把没有外部动作当成没有任何风险。

一份读者能执行的决定会说明允许谁用、做什么、不做什么、何时找谁接手、什么信号停止、下次凭什么复核。例如“华东白班低后果草稿”只是范围描述,还须提供该范围的证据和执行检查;没有证据时它是一项待验证建议,不是已批准状态。

扩大时尽量一次改变一个边界,例如先增加一种任务,其他角色、区域、时段与动作维持原范围,便于理解新问题来自哪里。若必须同时改变多个条件,就明确交叉验证与监测需要,不声称一定能够归因。最后请使用者复述下一步;自学则分别读给工程师与运行负责人,检查他们是否还需要猜。

动手练习

练习 08

整理一份北辰试用建议,不运行真实设备。选 8–12 条合成任务作为本次学习样例;这个数量便于练习,不是正式验收要求。

  1. 01

    逐条写输入、允许动作、预期结果、引用条件与不可接受错误,解释为什么选择这些样例。

  2. 02

    先自己检查,用自己的话记录问题,再归并分类;能邀请同伴时独立判断一部分,保留分歧及原因。

  3. 03

    按至少两个相关条件分组,写通过数/总数与具体失败;说明重叠样例和未覆盖任务。

  4. 04

    分别填写任务结果、系统行为、用户体验、风险、运行支持;没有证据的格子写缺什么、谁能确认。

  5. 05

    加入 94% 事件与容量冲击,更新暂停、合成演示、补证或受限试用的建议,不反推缺失分母。

  6. 06

    写范围、排除项、停止与恢复、观察窗口、负责人和下次复核依据;将真实设备适用性等专业判断标为待确认。

从逐条结果检查试用条件

计算 52 条独立合成样例的总体与分组结果,再分别检查任务结果、系统行为、用户体验、风险和运行支持。

这批新样例不能反推原 94% 摘要的分母,也不能替代实际用户、专业判断和接手验证。

先读字段说明,完成计算或走查,再核对指南中的自检要点。文件可下载后用表格软件或文本编辑器阅读,无需运行代码。

检查你的理解

先写下自己的回答,再展开解析,看看还需要补充什么。

总体 94%,旧型号 4 条失败 2 条,能直接允许旧型号试用吗?

不能用总体抵消这个分组。需要看具体后果与控制,并补该组证据;危险建议未被控制时阻止相关任务试用。也不能自动认定其他组已经通过。

模型说“完成”,轨迹也有工具调用,为什么还要查正式记录?

调用可能失败或结果未知,界面也可能误读状态。正式记录用于核对真实结果;本课初期任务只能准备草稿,不能把调用当成已提交。

28/28 的实验结果是否足够覆盖五类检查?

不够。它只检查已知合成情景中的部分系统行为;用户理解、专业风险判断、真实支持容量与外部依赖仍需要相应证据。

本课记录与下一步

一份错误分类与分组结果,附上评价分歧、五方面检查结果和试用建议。

每项试用条件都有测试或记录支持;不能接受的错误没有被平均分或上线期限压过去。

把有证据支持的范围、停止条件和观察任务交给第 9 课。下一课检查用户是否在真实工作机会中采用、为什么绕回原流程,以及支持怎样随之调整。

参考资料

Anthropic / Demystifying evals for AI agents NIST / AI Risk Management Framework NIST / Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile Microsoft Research / Guidelines for Human-AI Interaction