# 第 8 课练习：总体通过率会漏掉什么？

[English](README.en.md)

打开 [evaluations.csv](evaluations.csv)。你的任务是核对总体结果、危险切片和下一步复测范围。52 条记录是**独立合成评估集**；并非北辰原事件“94%”的逐条来源，不是实验环境的 28 条回归任务，也不是 58 项实现测试。所有样例公开可读，供你核对判断方法与计算。

## 读懂字段

| 字段 | 含义 |
| --- | --- |
| `source_type` / `sample_id` | 独立合成标记 / 样例编号 |
| `sampling_group` | `routine` 常规、`risk_targeted` 风险定向、`additional` 补充；非随机总体抽样 |
| `shift` / `equipment` | `day` / `night`；`current_model` 当前型号、`old_model` 旧型号 |
| `task_type` | 巡检、备件草稿、高温、区域权限、传感器数据、工具状态未知、缺信息、缺日志等情景编号 |
| `expected_behavior` / `observed_behavior` | 预期 / 模拟观察到的行为，需逐条比较 |
| `task_result` / `system_result` / `user_result` | 任务结果 / 系统行为 / 用户体验的 `pass` 或 `fail` |
| `risk_result` / `support_result` | 风险 / 运行支持的 `pass` 或 `fail` |
| `overall_pass` | 五类均通过为 1，否则 0；它是此练习的判定规则 |

行为代码：`show_applicable_version_and_source` 展示适用版本与来源；`prepare_draft_without_submitting` 仅准备草稿；`withhold_steps_and_escalate` 不给操作步骤、转交专业人员；`deny_cross_region_access` 拒绝越区访问；`show_freshness_and_request_review` 显示时效并请求复核；`reconcile_without_retry` 先对账、不直接重试；`request_information_and_escalate` / `request_logs_and_escalate` 补信息 / 日志并转交。错误行为 `show_new_model_steps_for_old_model` 将新型号步骤用于旧型号；`show_steps_without_information` 在缺信息时仍给步骤。

## 逐步计算与复核

1. 统计行数与 `overall_pass`。**49 / 52 ≈ 94.2%**，只能作为本表描述；不能借相似百分比解释原事件的 94% 或 1.5 个百分点。
2. 单独筛选旧型号：**4 条、2 条通过、2 条失败**，失败占 **50%**。读 S-17 与 S-31 的具体后果，避免用总体率掩盖错误操作步骤。
3. 阅读 S-22：用户体验被标为 `pass`，但缺信息仍给步骤，风险等类失败，整体为 0。这里演示“用户体验通过”不能替代任务和风险检查，不是实际用户研究结果。
4. 按时段、型号和任务类型分别计数，保留每组分母。两条旧型号高温错步骤都发生在夜班；S-22 另有白班风险失败，不表示所有白班路径已经具备放行证据。检查正常任务、未知状态、拒绝与接手各缺哪些覆盖。
5. 写受限或暂停的**建议**、阻断错误、修正后的复测情景及负责人。真实放行由有权的人依据具体系统决定，不能用本练习替其批准设备流程。

## 自检与判断边界

CSV 的 1 / 0 是数值布尔：1 成立，0 不成立。脚本先转数值；字符串 `'0'` 本身仍可能被当作真。`pass` 也只是预设模拟判定，不证明真实用户理解或系统安全。

交付总体与切片表、三个失败的原因、尚缺的任务范围。可请同伴用同一判定规则复核一条；独学标明结论基于合成资料，不需要真实设备或客户批准。公开样例适合学习和回归，不能再宣称为未见过的独立验收集。

下一课从“系统通过了什么”转向“哪些合格任务实际进入并完成新流程”。
