学完这一课,你可以
- 区分事实、假设和决定,并为关键假设写出能推翻它的观察。
- 设计一项有成功、失败和信息不足三个结果分支的小测试。
- 比较流程改进、纸面验证与受限原型,形成可以执行的下一步。
开始之前
- 带上第 5 课的工作流与未确认项,优先挑一项会改变范围或停止条件的疑问。
- 用北辰公开合成事件和你写出的纸面草稿练习,不需要拿真实工单去试一个尚未批准的系统。
把“我们相信”改成“怎样知道”
你现在已经有一张工作流,但其中可能还写着“资料齐全”“工程师会核对”“夜班能接手”。这些都是待确认的假设,不会因为写进方案而变成事实。先把每一项改成一个可观察的问题,例如“夜班工程师能否打开当前任务需要的手册版本”。
保留四种记录:事实写来源与时间;假设写依据与反证;决定写有权决定的人、范围和条件;结果写实际观察与限制。一个演示里的正确回答可以作为观察,但只能说明那次输入、版本和环境下发生了什么,不能说明整个方案已经可用。
这项工作帮助你节省后续投入:如果目标用户连资料都打不开,继续提高检索分数不会解决问题;如果等待主要发生在审批,先建设知识助手也可能错过主要瓶颈。测试帮助你选择下一步,结果可能支持原安排,也可能说明需要修改。
先找错了会改变方向的假设
把假设分成问题、用户、价值、数据、能力和运行六类。这里只检查价值逻辑有没有明显断点,完整的收益与成本分析留到第 11 课。例如,“找资料更快就一定减少停机”需要验证,因为维修执行、审批和备件到货也可能影响最终结果。
排序时逐项问:判断错了会怎样;现有证据有多强;通过什么观察能减少不确定性;获得这些信息要花多少时间、有多少风险。优先验证后果大、证据弱且能在当前资源下查清的事项,不必把它们相乘成一个貌似精确的分数。
有些长期问题无法用两天测试确认,例如未来是否一直有人维护知识库。你仍可以确认当前负责人和交接安排,再把长期持续性写为剩余风险、设置复核条件。不能验证的部分需要被看见,而不是填成“已通过”。
| 假设 | 可以先看什么 | 若不成立,怎样改变 |
|---|---|---|
| 等待主要来自查资料 | 复原等待事件,区分查找、授权、审批 | 转向流程或排班改进 |
| 夜班能访问适用手册 | 用模拟身份检查授权和打开路径 | 先改范围或解决经批准的访问问题 |
| 工程师会发现版本不符 | 纸面任务里放一个型号不符的来源 | 调整界面或排除任务 |
| 运行团队能支持新增任务 | 实际值班表、复核耗时与可用时间 | 减小范围或补足支持安排 |
选一种能回答问题的小测试
纸面界面可以检查用户是否理解状态、知道下一步;人工模拟后台可以观察建议怎样改变判断;历史事件复原可以发现等待原因;本地技术测试可以检查版本撤回、权限和工具状态。每种方式回答不同的问题,不能互相替代。
先写你要观察的行为,再选形式。例如要知道“来源提示能否帮助发现型号错配”,无需先上线一个助手:给出任务、资料和草稿,让参与者实际判断,记录是否发现错配、花多久、还需要什么信息。不要只问“你觉得这个功能有没有用”,口头赞同不等于能完成任务。
官方设计指南与风险框架都可以帮助补充检查角度,但不会替你选样本或定阈值。为了自学,你可以独自对照两版纸面界面并记录误解;结论要注明“个人走查”,不能称为用户研究已经证明所有工程师都会正确使用。
示例:先验证等待原因,而不是润色演示
北辰第 6 课事件给出了一个反例:三周里检索准确率从 71% 提高到 84%,随后工程师说“搜到了,但打不开”。这两个百分比来自合成事件,材料没有提供完整评估样本与计算口径,因此只用来说明访问问题可能使技术改进无法落到任务上,不把它们当成已复核的效果数据。
公开事件允许选择 12 个近期等待事件共同复原。为了演示测试方法,你可以从 20 条合成记录中挑出有专家等待、旧资料、缺失信息或工具超时的任务,说明选择理由。挑选出的 12 条不是随机样本,也不代表全部工作;无法从现有字段分清的等待要保留为“原因未知”。
把下一步与结果预先连接起来。若资料获取是主要可改变因素,且提供核对后的资料确实改变了任务判断,可以继续受限原型;若主要是审批或排班,优先比较流程方案;若记录不能区分原因,先补记录。三条都应允许方案被修改。
- 写决定:是否值得投入下一阶段的受限原型;不在这次测试中批准真实提交。
- 写竞争解释:缺适用资料、缺阅读权限、等专家确认、等备件审批,允许多个原因共同出现。
- 逐条复原:写事件、来源、等待起止与当时可选动作,不能从处理总时长直接推断审批时长。
- 纸面提供帮助:只给已核对、获准查看的资料,观察具体判断是否改变;记录新增复核负担。
- 汇总结论:列出支持、不支持与不能判断的情况,给下一步范围和补证任务,而不是写“用户反馈良好”。
在开始前写好三种结果
一张可执行测试卡应包含:想改变的决定、假设与竞争解释、样例如何选、怎样记录、停止条件、有权决定的人。尤其写出什么结果支持、什么结果削弱、什么结果不足以判断。这样你不会在看到不利结果后临时修改标准。
数字阈值只能作为有理由的选择,不是行业通用标准。北辰事件把“备件审批等待占比超过 40%”设为某个影子建议方案收益不成立的反转条件,这是情景设定;20 条记录没有备件审批耗时字段,不能据此直接算出这个占比。要先定义分母并补相应观察。
分母就是一个比率所除以的总量。你说“40% 等待”时,需要说明是全部等待分钟、长等待事件数量还是范围内任务数量;它们回答不同问题。记录不全、关键角色未参与或比较条件变化时,结果可以是信息不足。此时补证或保留受限方式,不把未知当作失败或通过。
比较三个实质不同的下一步
不要只给完整版、简化版和延期版,它们可能只是同一方向的三个预算。北辰可比较:A 调整流程与权限,不引入 AI;B 用纸面或人工辅助验证;C 在获准范围内做无外部动作的影子建议。影子建议供观察,不能影响真实操作;真实数据即使只用于影子运行,也需要用途授权。
对每个选择说明能解决哪一部分、主要代价、依赖谁、仍不知道什么、什么时候会停止。若资料不足以支持 C,B 可能是合理下一步;若瓶颈已经指向审批,A 也可能更有价值。保留不引入 AI 的选择,才能判断 AI 是否真的增加了帮助。
最后把决定写具体:批准范围、未批准事项、资源负责人、复核时间、重新讨论的触发条件。面对“先做出来再看”,你可以回答“可以先做一版纸面草稿,我们要看工程师能否发现型号错配;如果看不出来,就先改呈现与范围”。有观察目标的原型是测试,没有目标的演示只是展示。
避免把小测试写成全面证明
最常见的误区有三个:只选容易成功的任务;测试前没有失败分支;把少量参与者的表现写成全员效果。修复时保留不利样例,说明抽样方式,主动写出不适用的角色、资料版本、班次和任务,而不是给结论添加一句笼统的“仍需优化”。
不要把“没有看到问题”写成“问题不会发生”。一次合成撤回测试能检查一个已知路径,却无法证明真实系统所有缓存、副本与长会话都已覆盖。NIST 的框架可以作为复核问题的参考,具体控制仍需测试;不确定的专业判断交给实际有资格和权限的人。
结束时用三句话说明:这次观察到了什么;它能支持什么、不能支持什么;因此下一步怎样改变。这样的结论即使是不继续开发,也能帮助项目节省时间,并给第 7 课提供清楚的风险与负责人清单。
动手练习
你有两天准备北辰的下一步建议。只选择一项最影响决定的假设,完成一张测试卡和三个选择的比较。所有新增数字注明“为了演示”。
- 01
从上课流程中列出六类假设,圈出证据最弱且判断错了后果最大的两项。
- 02
选择其中一项,写可推翻它的观察与竞争解释;说明为什么现在先测它。
- 03
挑纸面、历史记录或本地测试方式,写样例选择、记录字段、负责人、数据使用边界与停止条件。
- 04
在执行前写三个结果分支:支持、削弱、不能判断;每个分支对应下一步。
- 05
用合成材料走查一次,记录实际发现和缺少的字段。比较流程、纸面验证与受限影子建议,不虚构真实用户效果。
- 06
写批准范围、排除项、资源负责人、复核时间与重新讨论条件。没有真实决定者时,明确这是一份待确认的建议。
核对反转条件的分母
用 12 条独立等待记录计算审批占比,比较现有判断、竞争解释与下一项验证。
本练习定义等待分钟口径;不能将这批新构造记录当成原事件 06 的缺失资料。
先读字段说明,完成计算或走查,再核对指南中的自检要点。文件可下载后用表格软件或文本编辑器阅读,无需运行代码。
检查你的理解
先写下自己的回答,再展开解析,看看还需要补充什么。
测试里 12 条样例全部通过,可以说真实业务通过率是 100% 吗?
不能。先说明这 12 条怎样选、检查了什么。合成、定向选取或开发中反复使用的样例,只支持相应范围的观察,不代表真实业务分布。
现有记录没有审批时长,能用总处理时长估计审批等待占比吗?
不能直接这样算。总时长混合等待、执行与返工。先定义需要的分母与时间边界,补记录;无法区分时保留未知。
客户坚持先做一个原型,是不是一定要拒绝?
不必。先明确它要回答什么、要观察什么、什么结果改变决定,再比较其他方法是否更省成本。带有反证和停止条件的原型可以是有效测试。
本课记录与下一步
一份假设清单、一个测试计划,以及根据测试结果选择下一步的说明。
如果测试失败,你会改变行动;结论只适用于测试过的样本和场景,也没有超出数据使用授权。
把测试结果、剩余未知和待确认的决定交给第 7 课。下一课逐项确认数据怎样使用、风险影响谁、谁有权暂停和恢复。