学完这一课,你可以
- 从实际任务与错误后果建立样例和判定标准,而不是先抄一个默认指标。
- 分别检查任务结果、系统行为、用户体验、风险与运行支持,并按任务分组看数量。
- 提出有证据支持的暂停、补证、影子模式或受限试用建议。
开始之前
- 带上第 4 课成功标准、第 5 课工作流、第 6 课测试记录和第 7 课风险与负责人清单。
- 使用北辰公开事件里的评估摘要与实验环境证据;二者是不同材料,不能合并成同一份真实评估报告。
先说清什么算完成,再决定怎样评分
评估是为了决定下一步可以做什么。以备件草稿为例,成功不是模型说“已处理”,而是草稿包含正确、可追溯的信息,缺失项得到说明,工程师知道还未提交,任务保持在授权范围内。若以后验证工具提交,还要查询正式业务记录,不能只看最后一段回答。
为每条样例写输入、设备与资料条件、用户角色、允许动作、预期结果和不可接受的后果。要求应彼此一致:如果任务只允许生成草稿,评分器不能因为“没有提交申请”判失败;如果资料不足,合理升级也不应因为没有给出完整建议而扣成错误。
Anthropic 的智能体评估文章区分任务、每次试验、轨迹、评分和最终状态。你可以据此保留能解释结果的记录。对北辰还需要实际业务判断:一段合规的工具调用轨迹不能证明手册适用,一条正确回答也不能证明夜班有人支持。
读具体样例,建立自己的错误分类
先逐条查看请求、资料、建议、用户动作与最终记录,用日常语言写清哪里出了问题。先记录最早发生、能够解释后续结果的错误;后续后果也保留,但不要把同一条上游故障拆成很多独立失败,造成数量失真。然后把相似情况归类,选择哪些能自动检查、哪些需要人判断。
北辰可以出现版本不适用、应升级却未升级、把状态未知说成完成、越权动作、信息正确却不能执行、修改负担过大等类型。每类记录影响谁、能否及时发现、能否补救、需要哪种资格判断,以及是否阻止试用。通用清单用于补漏,不能替代你实际观察到的任务。
确定性检查适合明确字段、权限与状态;模型评分可辅助开放式表达,但需要与合格人员的判断校准。保留“不足以判断”选项。如果两人争论是因为缺设备状态,就补信息;因为权限冲突,就交给负责人;只有尺度不同才通过具体样例校准,不能靠投票消除真实争议。
五类检查分别过关,不能互相抵消
把证据整理成五类:任务结果、系统行为、用户体验、风险、运行支持。每类都写来源、样例数量、适用条件、尚缺证据和负责人。它们分别回答不同的问题,不能用“总分很高”抵消未满足的试用条件。
风险这一类接上课:数据用途是否获准,访问与资料撤回控制是否测试,哪些后果不能接受、谁能作相应判断。运行支持则检查是否真的有人接手、怎样暂停、排队任务怎样处理、何时恢复。有人签字但控制未经验证,或计划上有人而实际无可用时间,都不能写成已满足。
业务价值到第 11 课再结合采用、成本与因果证据分析。本课可以记录处理耗时、复核负担与支持成本作为后续输入,但不由分数或省下几分钟推导年度收益。任务能试用,与值得扩大投入,是相连但不同的决定。
| 检查类别 | 北辰具体检查 | 不能拿什么替代 |
|---|---|---|
| 任务结果 | 草稿正确完整、知道尚未提交 | 回答流畅或用户点击接受 |
| 系统行为 | 版本、权限、工具状态与正式记录一致 | 只看最后一段回答 |
| 用户体验 | 用户能理解、修改、拒绝并找到帮助 | 培训完成或满意度 |
| 风险 | 具体高后果情景有经验证控制与有权判断 | 平均分或笼统签字 |
| 运行支持 | 实际容量、人工接手、暂停与恢复可用 | 值班表上的名字 |
分组看任务,避免平均数掩盖少数失败
按影响结果的条件分组,例如白班和夜班、旧型号和新型号、资料完整和资料缺失。这些分组在评估中也叫“切片”。分组不只是多画几张图:当一个组存在严重失败,你需要改变允许的任务范围、补证或停止,而不能用其他组的成功抵消。
报告同时写通过数和总数,这个总数就是分母。“旧型号 4 条里失败 2 条”比只写“总体 94%”更有用,因为读者能看见该组很少、问题很大。分组样例可以重叠,例如同一条既是夜班又是旧型号;汇总时不能把各组数量相加当独立任务总量。
保留常见任务,也选拒绝、缺失信息、权限变化、撤回资料和重要少数组。开发中反复看过的样例用来防止回归,另留未参与调试的任务观察新情况。多个试验要记录每次结果、清理前次状态,不要只保留最好的回答或把共享缓存带来的便利当能力。
示例:把“94%”改成具体试用建议
北辰公开事件给出总体通过率 94%,比上一轮提高 6 个百分点;旧型号 4 条中失败 2 条;夜班高温任务出现不适用型号的危险建议;复核容量只有计划的一半。这是合成情景的新资料,不是 20 条入门 JSON 的统计结果。总体分母没有提供,不能反推一个精确任务总数。
其中还有“旧型号失败被稀释成 1.5 个百分点”的描述,但没有足够材料核对其分母与舍入方法。学习时保留这个限制,直接使用可核对的 2/4,以及具体危险建议与容量缺口。94% 对比上一轮提高 6 个百分点,按给定摘要上一轮是 88%;这不同于“提高 6%”。
这组事实不能直接推出“所有白班任务都安全”。如果白班、现行型号、低后果任务有独立且充分的支持证据,才可讨论受限试用;目前没有这组完整证据,就建议补证或用合成数据演示。排除旧型号也不能自动修复资料过滤,须验证限定确实执行。
- 重写摘要:把总体数字放在背景,先列危险建议、旧型号 2/4 失败和复核容量减半,以及各项尚缺资料。
- 追查任务:核对输入的设备型号、引用版本、系统检查与用户能看到的信息,定位最早的不符合要求之处。
- 分别检查五类:哪些已有记录,哪些只有计划,哪些仍待具备资格的人判断;不要把未知涂成通过。
- 比较选择:暂停真实试用并补证;保留合成演示;或在取得额外证据后讨论受限范围,说明不同代价。
- 写建议:明确人、任务、资料、时段与动作范围,列排除项、停止条件、实际接手、观察窗口和复核依据。
- 应对提前期限:缩小演示内容、保持原流程或延后真实试用;不把期限变成降低风险要求的理由。
理解实验通过,和真实试用之间的距离
实验环境证据显示 28/28 通过,分组包括权限、时效、检索、工具、故障恢复等。它使用确定性后端,不发起网络请求,样例在开发中反复运行。它能说明这些已知情景没有出现已检查的回归,不证明真实模型表现、真实用户行为或外部接口故障都被覆盖。
报告中时效组只有 2 条;这不是不重要,而是覆盖有限。你可以增加撤回传播中间状态、调岗后旧会话、权限变化与资料版本交叉情景。样例数取决于需要回答的风险问题与证据强度,不能从 28/28 推导一个统一上线阈值,也不能把新增合成测试说成真实用户验证。
给每次结果留下版本:模型、提示、检索资料、工具、权限规则、运行环境与时间。改动后按影响范围重跑相关测试,同时检查可能的连带影响。评估是持续工具:用户发现的新错误应加入回归样例,新的任务范围则需要新的判断,不能一直沿用初次通过报告。
把决定写给需要照着工作的人
试用决定不是只有上线或不上线。可以停止、补证、仅用纸面或影子模式、限定范围,或在证据充分时进入小范围试点。影子模式也要有获准数据与明确隔离,生成的建议不能悄悄进入真实处置;不要把没有外部动作当成没有任何风险。
一份读者能执行的决定会说明允许谁用、做什么、不做什么、何时找谁接手、什么信号停止、下次凭什么复核。例如“华东白班低后果草稿”只是范围描述,还须提供该范围的证据和执行检查;没有证据时它是一项待验证建议,不是已批准状态。
扩大时尽量一次改变一个边界,例如先增加一种任务,其他角色、区域、时段与动作维持原范围,便于理解新问题来自哪里。若必须同时改变多个条件,就明确交叉验证与监测需要,不声称一定能够归因。最后请使用者复述下一步;自学则分别读给工程师与运行负责人,检查他们是否还需要猜。
动手练习
整理一份北辰试用建议,不运行真实设备。选 8–12 条合成任务作为本次学习样例;这个数量便于练习,不是正式验收要求。
- 01
逐条写输入、允许动作、预期结果、引用条件与不可接受错误,解释为什么选择这些样例。
- 02
先自己检查,用自己的话记录问题,再归并分类;能邀请同伴时独立判断一部分,保留分歧及原因。
- 03
按至少两个相关条件分组,写通过数/总数与具体失败;说明重叠样例和未覆盖任务。
- 04
分别填写任务结果、系统行为、用户体验、风险、运行支持;没有证据的格子写缺什么、谁能确认。
- 05
加入 94% 事件与容量冲击,更新暂停、合成演示、补证或受限试用的建议,不反推缺失分母。
- 06
写范围、排除项、停止与恢复、观察窗口、负责人和下次复核依据;将真实设备适用性等专业判断标为待确认。
从逐条结果检查试用条件
计算 52 条独立合成样例的总体与分组结果,再分别检查任务结果、系统行为、用户体验、风险和运行支持。
这批新样例不能反推原 94% 摘要的分母,也不能替代实际用户、专业判断和接手验证。
先读字段说明,完成计算或走查,再核对指南中的自检要点。文件可下载后用表格软件或文本编辑器阅读,无需运行代码。
检查你的理解
先写下自己的回答,再展开解析,看看还需要补充什么。
总体 94%,旧型号 4 条失败 2 条,能直接允许旧型号试用吗?
不能用总体抵消这个分组。需要看具体后果与控制,并补该组证据;危险建议未被控制时阻止相关任务试用。也不能自动认定其他组已经通过。
模型说“完成”,轨迹也有工具调用,为什么还要查正式记录?
调用可能失败或结果未知,界面也可能误读状态。正式记录用于核对真实结果;本课初期任务只能准备草稿,不能把调用当成已提交。
28/28 的实验结果是否足够覆盖五类检查?
不够。它只检查已知合成情景中的部分系统行为;用户理解、专业风险判断、真实支持容量与外部依赖仍需要相应证据。
本课记录与下一步
一份错误分类与分组结果,附上评价分歧、五方面检查结果和试用建议。
每项试用条件都有测试或记录支持;不能接受的错误没有被平均分或上线期限压过去。
把有证据支持的范围、停止条件和观察任务交给第 9 课。下一课检查用户是否在真实工作机会中采用、为什么绕回原流程,以及支持怎样随之调整。