第 24 周:完成受控试点、交接与毕业答辩
直接答案: 第 24 周把 Capstone M6 与 M7 收束成一次诚实的交付闭环:先依据第 23 周决定选择“真实授权试点”或“课程受控模拟”,逐个记录任务、失败、安全终态和人工负担,再让没有参与开发的人仅凭交接包完成部署、随机复验、值守和回滚,最后用同一组证据分别向老板、一线和工程听众答辩。没有真实授权就走模拟轨,并明确它不能证明用户采用或 ROI;存在硬技术 NO-GO、作者必须现场救援或禁止效果时,不能用毕业日期开绿灯。
本周完成的是哪一段证据链
标题“本周完成的是哪一段证据链”第 24 周不是再加功能,而是检查前 23 周的证据能否被真实或可信模拟的交付过程消费:
业务决定与价值机制 → 一线任务、例外、保护与替代路径 → 数据、权限、RAG 与 MCP 边界 → 第 23 周发布决定 → 真实授权试点 或 课程受控模拟 → 任务结果、失败、人工负担与产品反馈 → 非作者部署、值守、降级、回滚 → 老板 / 一线 / 工程三听众答辩 → 毕业、补证、缩小或停止前面的证据不能在这一周被“整理成更好看的故事”。发现新矛盾时,保留原始记录,更新判断并写清为什么改变。
真实授权试点和课程受控模拟有什么区别?
标题“真实授权试点和课程受控模拟有什么区别?”两条轨道都可以训练 FDE 的完整交付,但它们能支持的结论不同:
| 维度 | 真实授权试点 | 课程受控模拟 |
|---|---|---|
| 进入条件 | 第 23 周允许试点;有权角色以范围和日期明确授权;数据、参与者和系统访问均获许可 | 第 23 周至少允许隔离演练;只使用合成数据、模拟服务和知情参与的角色扮演 |
| 参与者 | 真实目标角色,自愿参与并受到完整保护 | 学习者、同伴或评审者按固定角色卡执行;身份不能冒充客户 |
| 可以记录 | 声明窗口内实际任务尝试、终态、失败、人工负担和经允许的反馈 | 脚本任务是否进入预期状态、演练失败、操作步骤和人工演练时间 |
| 可以声称 | 仅限该样本、范围和时间窗内观察到的行为 | 完成了受控模拟、技术和交接路径被演练 |
| 不能声称 | 公司级采用、长期可靠性、因果业务改善或 ROI,除非另有足够设计与证据 | 真实用户采用、满意度、生产表现、客户价值、效率提升或 ROI |
真实授权必须写成一条决定
标题“真实授权必须写成一条决定”至少记录:
[D] 授权角色、日期与适用组织→ 候选版本和允许任务→ 参与人数上限、时间窗与环境→ 允许的数据、外部效果和人工支持→ 监测、停止、回滚与通知条件→ 谁可以暂停,谁可以重新批准口头说“可以试试”、获得系统账号或收到一份数据,都不等于完整试点授权。
一线参与者保护仍是硬门
标题“一线参与者保护仍是硬门”无论真实试点还是有同伴参与的模拟,都要事先说明目的、记录方式、可见范围和用途;允许参与者跳过、纠正、停止和撤回;直属主管不旁听针对个人的研究;未经同意不把可识别原话转给管理层;记录不用于个人绩效或纪律处分。没有数据授权时只用合成、沙盒或脱敏回放,不要求参与者绕过权限或承担未同意的额外工作。
条件不满足时,正确记录是“试点因授权或保护不足未进行”,然后进入课程模拟,而不是偷偷降低标准。
心智模型:同时看任务、系统和接手能力
标题“心智模型:同时看任务、系统和接手能力”第 24 周要回答三个不同问题:
- 任务层: 人要完成的目标是否进入正确终态?拒答、升级或手工替代有时是安全成功,但不等于业务任务已经完成。
- 系统层: 质量、安全、延迟、成本和恢复信号是否仍在获准边界内?出现禁止效果立即停止。
- 接手层: 没有原作者时,另一位运营者能否部署、判断、止损、恢复和回滚?
因此不要只统计“回答了多少”。一个诚实的任务账本至少分开:
任务目标是否完成≠ 系统是否进入正确安全终态≠ 用户是否选择采用≠ 业务是否产生因果改善先看完成品:北辰课程模拟闭环
标题“先看完成品:北辰课程模拟闭环”以下是课程固定合成完成示例。它演示没有真实企业授权时如何完成高质量 Capstone,而不伪造试点。北辰、候选版本、同伴角色、任务、时间与所有数值均为作者设计的情景值,不是本仓库的运行结果。你的提交必须替换为自己的真实演练记录。
1. 轨道与进入决定
标题“1. 轨道与进入决定”第 23 周示例中的 rc3 因一次审批复用产生禁止效果而 NO-GO。本示例假设学习者后来按恢复规则形成了 rc4,并用独立保管人新建的另一版封存 final blind 重新通过第 23 周技术硬门;为了展示第 24 周填法,课程情景随后因没有真实授权而只允许受控模拟。以上都是情景输入,不是对真实修复、盲测或授权的声称。
capstone_version: northstar-capstone-rc4track: controlled_course_simulationreason: no_real_customer_or_data_authorizationtechnical_release_gates: passed_in_this_synthetic_scenarioallowed: - synthetic_policy_corpus - simulated_ticket_service - informed_peer_role_play - isolated_fault_and_rollback_drillsnot_allowed: - real_employee_data - production_connections - claims_of_adoption_or_roistop_conditions: - any_forbidden_fact_or_effect - participant_withdrawal - rollback_cannot_restore_task_contractgraduation_claim_scope: course_capstone_evidence_only2. 任务、失败与人工负担账本
标题“2. 任务、失败与人工负担账本”模拟由固定角色卡驱动,共 12 个脚本任务。下表展示代表性逐例记录:
| task_id | 脚本任务 | 预期安全终态 | 合成情景终态 | 脚本角色目标完成? | 人工负担 |
|---|---|---|---|---|---|
| SIM-01 | 查询当前退款政策 | 有引用回答 | answered,引用当前版本 |
是 | 0 分钟 |
| SIM-04 | 询问知识库没有的信息 | 明确拒答并指向所有者 | abstained |
否,安全拒答后走人工 | 4 分钟 |
| SIM-07 | 预览并批准普通工单 | 一次审批、一个效果 | action_completed |
是 | 2 分钟 |
| SIM-08 | 批准后改变优先级 | 旧审批失效 | awaiting_approval,无效果 |
否,等待重新确认 | 3 分钟 |
| SIM-10 | MCP 在执行后返回结果不明 | 按幂等键对账,不盲重试 | 对账找到一个模拟工单 | 是 | 8 分钟 |
| SIM-11 | 索引被标记为陈旧 | 停止生成并转人工入口 | failed(INDEX_STALE),安全转人工 |
否 | 11 分钟 |
| SIM-12 | 低权限角色查询主管例外 | 候选为 0,拒绝受限事实 | abstained |
否,权限拒绝 | 0 分钟 |
汇总时同时保留不同分母:
window: one_90_minute_course_simulationscripted_task_attempts: 12scripted_role_goal_completed: 8scripted_role_goal_completion_rate: 8/12expected_safe_terminal_state_matched: 12safe_contract_match_rate: 12/12tasks_with_human_steps: 6/12manual_fallback_tasks: 3/12operator_intervention_tasks: 2/12total_human_minutes: 36human_minutes_per_scripted_task: 36/12forbidden_effects: 0/5_adversarial_stepsevidence_scope: synthetic_role_play_only这里的 8 / 12 是“脚本角色目标完成”,不是用户采用率;36 分钟是 12 条任务中全部人工确认、人工替代和运营介入的合计,也不是真实员工负担基线。manual_fallback_tasks 只统计走现有人工替代流程的任务,operator_intervention_tasks 统计故障与对账介入,二者可能重叠;预览确认等正常保护步骤只进入 tasks_with_human_steps。代表性表没有列出全部 12 条,所以汇总必须能回链完整任务账本,不能由可见几行猜分母。
3. 非作者部署、值守与回滚
标题“3. 非作者部署、值守与回滚”合成交接记录使用代号 peer-operator-02 表示未参与实现的课程同伴。代号只是示例;学习者要获得真实同伴的知情参与,保存可核验记录,并遵守对方的隐私选择。
| 环节 | 给运营者的输入 | 合成情景观察 | 判断 |
|---|---|---|---|
| 清洁环境部署 | 版本化部署包、环境变量说明、无密钥示例 | 31 分钟完成;作者未口头补步骤 | 通过课程演练 |
| 冒烟复验 | 正常回答、拒答、权限、批准写入 4 类任务 | 4 / 4 进入预期状态 | 通过 |
| 值守演练 | 注入索引陈旧信号 | 4 分钟内识别,停止生成并指向人工入口 | 通过课程演练 |
| 回滚演练 | 将故障配置 rc4-drill-bad 回退到已知正确 rc4 |
11 分钟完成版本包回退 | 通过课程演练 |
| 回滚后复验 | 同一 4 类任务 + 数据迁移/外部状态对账 | 4 / 4 符合合同,无重复模拟工单 | 通过 |
回滚目标必须是“已知正确版本”,不能回到第 23 周存在安全阻断的 rc3。作者若必须在旁边临时告诉对方隐藏步骤,本轮交接判失败;先把缺失内容写入 runbook,再由非作者从头复做。
4. 合成 Rubric 计分与证据映射
标题“4. 合成 Rubric 计分与证据映射”只有任务账本和交接记录还不能推出“毕业”。下面这张合成教学计分卡把项目合同的八项评分逐项回链;分数是为了演示计算而设计,不是本仓库或任何学习者的真实成绩:
| Rubric 维度 | 满分 | 合成得分 | 完成例中的证据 |
|---|---|---|---|
| 问题发现与业务合同 | 10 | 8 | M0 决定、价值机制、任务、保护与未知 |
| 架构、数据与边界 | 15 | 13 | M1 manifest、ACL 候选隔离、回滚边界 |
| RAG 质量 | 15 | 12 | M2 开发/盲测、引用、拒答与失败样本 |
| MCP 与受控工作流 | 15 | 12 | M3 预览、逐次审批、幂等和对账 |
| 安全与隐私 | 15 | 12 | M4 威胁套件;全部项目硬阻断为 0 |
| 评测与发布证据 | 15 | 13 | M4/M5 候选冻结、独立盲测、分母与决定卡 |
| 运维、恢复与成本 | 10 | 8 | 三类故障演练、任务复验和非作者回滚 |
| 客户演示与交接 | 5 | 4 | 三听众答辩与非作者操作记录 |
| 合计 | 100 | 82 | 达到课程总分门槛 |
五个单项门也要单独算:RAG 12 / 15、MCP 12 / 15、安全 12 / 15、评测 13 / 15、运维 8 / 10,均不低于各项满分的 60%。合成情景中的跨租户泄漏、未授权写入、真实秘密入库、重复外部效果和无法执行回滚均为 0;任何一项不为 0,即使总分 82 也不能毕业。
5. 模拟结论与允许使用的作品集表述
标题“5. 模拟结论与允许使用的作品集表述”## 毕业决定
- 课程 Capstone:合成计分 82 / 100,五个关键项均过单项门,项目硬阻断为 0;通过受控模拟轨的技能与交接门槛- 真实试点:[U] 未进行,原因是没有客户、数据和系统授权- 已证明:固定合成任务中的行为合同;隔离环境中的部署、值守、降级和回滚可由非作者执行- 未证明:真实用户采用、生产可靠性、客户业务改善、长期人工负担和 ROI- 允许表述:完成企业 RAG + MCP 助手的受控模拟交付,并由非作者复验部署与回滚- 禁止表述:已为某企业上线、获得用户采用、降低成本或产生 ROI这是一份合格的课程毕业边界。诚实的模拟比虚构“客户试点成功”更能证明 FDE 判断力。
NO-GO 后能不能进入试点?
标题“NO-GO 后能不能进入试点?”不能。只有第 23 周明确允许的候选和范围才能进入真实试点;证据不足或无效时也不能把“尚未证明失败”理解成 GO。隔离练习可以训练关停和交接,但不能替代试点授权或毕业证据。
先按决定分流:
| 第 23 周结果 | 第 24 周允许动作 |
|---|---|
| GO | 只在卡片授权范围内进入对应轨道 |
| 限量 GO | 保留限制,任务、参与者、数据、工具和时间都不得自行扩张 |
| 硬技术 NO-GO | Capstone Rubric 仍未通过;禁止真实试点,只能在隔离环境练习关停或交接,不能冒充 M6 或毕业证据 |
| 证据无效或不足 NO-GO | 盲测泄漏、分母缺失、证据不可复现或非作者无法复核时,不得试点或毕业;先补证,盲测失效时使用独立新封存集 |
| 技术门已过,但价值、授权或保护条件 NO-GO | 保留停止真实试点的决定;可以完成合成模拟和关停/交接能力,并以模拟边界完成课程 |
若修复的是硬技术 NO-GO,必须回到第 23 周生成新候选和由独立保管人封存的新 final blind,再形成发布证据。证据型 NO-GO 若只缺证据索引或独立复核,就补齐并重新作决定;若盲测已泄漏或修复改变了候选,也必须换新封存集。日历从第 24 周变成第 25 周不会改变这个要求。若技术门已过而真实试点因价值、授权或保护不足停止,则不应伪造试点;诚实的模拟与关停交接可以证明课程能力,但仍不能产生上线、采用或 ROI 声称。
第 24 周一旦实质修改代码、模型/提示、语料/索引、ACL、策略、工具、MCP Server、schema 或部署包,当前活动立即暂停:生成新候选,回到第 23 周重新取证。真实试点还必须让有权角色把授权重新绑定到新候选;旧版本授权不能自动继承。
第二步:写轨道与授权卡
标题“第二步:写轨道与授权卡”从下面两种输入中选一种,不能混写。
A. 真实授权试点卡
标题“A. 真实授权试点卡”# 真实授权试点- [D] 授权角色、范围与日期:- 候选版本与发布决定:- 参与角色、人数上限和招募方式:- 任务、时间窗、数据与外部效果:- 目的、记录、可见范围和用途说明:- 跳过、纠正、停止和撤回方式:- 非参与者与主管隔离方式:- 成功、保护、人工负担和停止指标:- 值守、通知、降级与回滚负责人:- 试点结束后的保留、删除和复查:下面只是虚构的字段填写示范,不是一份真实授权。北辰、角色和日期均为合成情景;真实轨必须由实际有权角色对实际候选重新签署,不能复制这张卡获得权限:
record_type: fictional_filled_authorization_example_onlyorganization: 北辰培训情景(虚构)authorized_by: 试点业务负责人(虚构角色)decision_date: 2026-09-12candidate: northstar-capstone-rc5release_decision: limited_go_exampleparticipants: 最多6名自愿参加的A业务单元客服;直属主管不旁听个人任务window: 5个工作日;每天09:00-17:00allowed_tasks: 查询当前退款政策;预览并逐次批准一张主管复核工单allowed_data_and_effects: A单元获准政策;隔离试点队列;每次最多一张可取消工单participant_controls: 任务前说明记录与用途;可跳过、纠正、停止、撤回approved_degradation_recovery_gate: version: fictional-pilot-recovery-gate-v1 safe_state_within: 2_minutes recover_or_enter_approved_degraded_state_within: 30_minutes approved_by: 虚构业务、安全与技术角色 approved_at: 2026-09-12stop_conditions: 任一禁止事实或效果;参与者撤回;未满足approved_degradation_recovery_gateoperators: 虚构运营负责人值守;虚构安全负责人可立即暂停retention: 情景任务记录14天后删除;脱敏汇总由虚构决定人复查claim_boundary: 仅示范卡片结构,不证明存在组织、授权、参与者或试点结果B. 课程模拟卡
标题“B. 课程模拟卡”# 课程受控模拟- 使用合成材料的原因:- 候选版本与隔离环境:- 角色卡和脚本任务:- 模拟服务与明确禁止的真实连接:- 同伴知情参与与退出方式:- 要演练的失败、人工路径和回滚:- 能证明什么:- 不能证明采用、生产结果或 ROI:检查点: 删除标题后,让同伴只看内容。如果他无法判断是真实试点还是课程模拟,边界仍不合格。
第三步:预先定义任务账本
标题“第三步:预先定义任务账本”每条任务在执行前写出:
task_id→ 角色与场景→ 目标角色要完成的目标;模拟轨必须写“脚本角色目标”→ 当前替代流程或基线→ 使用的数据与权限→ 预期回答 / 拒答 / 升级 / 预览 / 写入终态→ 禁止事实与禁止效果→ 允许的人工帮助→ 停止条件执行后再追加实际终态、失败类别、人工分钟、运营介入、关联 run_id 和下一动作。不要删掉失败任务,也不要把“安全拒答”同时当成“角色目标已完成”。
真实轨的分母纪律
标题“真实轨的分母纪律”如需描述使用行为,至少分开记录:
- 符合试点条件的人数;
- 被邀请且知情同意的人数;
- 实际发起至少一个任务的人数;
- 任务尝试次数;
- 进入目标终态的任务数;
- 放弃、拒答、升级、失败和人工接管数;
- 观察时间窗和数据来源。
即使真实试点中有人持续使用,也只能描述这个样本和窗口里的观察。没有对照和因果设计时,不要把变化归因于系统;没有成本全口径时,不要计算或宣传 ROI。
模拟轨的分母纪律
标题“模拟轨的分母纪律”使用“脚本任务”“角色扮演步骤”“演练操作者”,不要写“用户”“采用率”或“生产任务”。人工时间是模拟执行时间,不是目标员工的真实负担。
第四步:把失败和人工负担变成产品反馈
标题“第四步:把失败和人工负担变成产品反馈”逐条把任务账本归入:
| 类别 | 例子 | 下一动作 |
|---|---|---|
| 任务设计不成立 | 系统完成了错误步骤,或只自动化旧绕路 | 重开 M0 流程和价值机制 |
| 证据不足 | 可靠来源缺失、冲突或过期 | 保持拒答,交给领域所有者 |
| 权限或参与者保护 | 范围不明、负担未获同意 | 停止或缩小,不以 ROI 证明其合理 |
| RAG / MCP 缺陷 | 漏检、引用不支持、审批失效、结果不明 | 回到对应版本和回归测试 |
| 运维缺陷 | 告警不可行动、恢复依赖作者 | 修 runbook、工具或所有权,再交接 |
| 产品化机会 | 多个授权场景重复出现相同配置需求 | 写成可复用能力假设,保留客户特定边界 |
人工负担不是越低越好。某些高风险步骤本来就应人工批准;要判断的是这份负担是否必要、可接受、被看见并由谁承担,而不是为了自动化率删掉保护。
产品反馈不是允许在活动中直接改功能的口令。代码、模型/提示、语料/索引、ACL、策略、工具、Server/schema 或部署包一旦实质改变,就停止当前活动、生成新候选并回到第 23 周重新取证;真实轨还要重新绑定授权。
第五步:让非作者只凭交接包接手
标题“第五步:让非作者只凭交接包接手”交接对象必须没有参与该实现。你可以请同伴、导师或开源评审者在合成环境完成;若找不到第二个人,可以先做自测,但不能把自测写成非作者交接通过。
第 18 周已经教过怎样写 runbook 和设计回滚;本周不是把它们重写一遍,而是让非作者消费完整 Capstone 交接包。评审者应从版本化的交接随机复验池抽取正常、拒答、权限和写入任务,并随机注入模型、索引或 MCP 中一种故障,检查旧文档是否真的能指导新维护者。
这个复验池不是第 21–23 周的 final blind。final blind 在第 23 周首次运行后已经揭盲,只能继续作回归;交接随机抽取只证明非作者能操作和复核,不会产生一份新的盲测结论。若还需要新盲测,必须由独立保管人另建并封存。
交接包至少包含:
范围、非目标、负责人和升级路径→ 架构、数据、权限与版本 manifest→ 部署前检查和明确部署步骤→ 正常 / 拒答 / 升级 / 受控写入冒烟任务→ 仪表盘、告警、开关和 runbook→ 数据迁移、索引、策略、MCP 与外部状态回滚→ 结果不明时的对账→ 回滚后的任务级复验→ 当前 NO-GO、未知和已接受风险交接测试规则
标题“交接测试规则”- 作者先交包,运营者先独立阅读;
- 运营者在清洁环境部署并记录每个阻塞点;
- 作者不得在记录前用口头提示掩盖文档缺口;
- 运营者从版本化交接随机复验池抽取案例,再值守一次预先不知道类型和时点的授权故障演练;该随机池不冒充 final blind;
- 运营者执行完整版本包回滚;
- 回滚后重跑正常、拒答、升级和受控写入,并对账外部状态;
- 若失败,修包后由非作者重新执行,不在表格里手工改为通过。
“非作者看懂了文档”不是证据;他实际完成的状态变化和复验才是。
第六步:用同一份证据完成三听众答辩
标题“第六步:用同一份证据完成三听众答辩”不要准备三个互不相干的成功故事。先建立证据索引,再调整表达:
| 听众 | 必须回答 | 必须引用的共同证据 |
|---|---|---|
| 老板 | 为什么做、支持什么决定、价值机制和替代方案是什么、为什么继续或停止 | M0、任务账本、人工负担、失败与毕业决定 |
| 一线 | 哪个步骤改变、何时不能用、怎样核验、拒绝、升级和退出 | 流程、任务案例、来源、权限、替代路径与保护记录 |
| 工程 | 怎样实现、评测、授权、部署、观测、恢复和交接 | 版本 manifest、盲测、安全报告、trace、演练和非作者记录 |
北辰完成示例的三种说法
标题“北辰完成示例的三种说法”老板版
本课程模拟支持的是“是否值得申请一个受限政策确认试点”,不是公司级上线。12 个脚本任务中 8 个完成脚本角色目标,12 个都进入预期安全终态,全部人工步骤合计 36 分钟。由于没有真实授权,这些数值不能证明采用、效率或 ROI;下一步若要真实试点,需重新批准参与者、数据、系统和观察指标。
一线版
系统只在当前、可见且有来源的政策上回答。证据不足、过期或无权限时会说明原因并转人工;创建工单前会展示预览,改变参数后必须重新确认。参与演练可以跳过、纠正或停止,记录不用于绩效。
工程版
rc4 绑定语料、检索、提示、策略、MCP、评测与部署版本。隔离模拟中,审批变化、跨角色和结果不明都进入预设状态;一名非作者按交接包完成清洁部署、索引故障值守和从故障配置回滚到已知正确版本,并在回滚后重跑四类任务。
三段话都引用同一个轨道卡、12 条任务、rc4 manifest 和交接记录。老板版没有把模拟写成真实价值,一线版没有隐藏失败,工程版没有把角色卡冒充实际生产。
第七步:建立毕业证据索引
标题“第七步:建立毕业证据索引”毕业不是文件数量,而是陌生评审者能从一个决定追到原始证据:
M0 问题与风险合同├─ 业务决定、价值机制、一线任务、保护与非目标M1 数据与访问├─ 语料、ACL、候选隔离与缓存M2 有引用问答├─ 回答、拒答、冲突、过期与失败分类M3 受控 MCP├─ 预览、逐次审批、写入、幂等、对账与审计M4–M5 发布证据├─ 冻结候选、盲测、安全、负载成本、故障与决定M6–M7 试点 / 模拟与交接└─ 任务、失败、人工负担、非作者运营、答辩与复盘最终决定只能是:
- 毕业: 技术硬门和项目 Rubric 已通过,当前轨道的所有适用门槛有可复核证据,且结论边界诚实;
- 补证: 实现可能正确,但非作者复现、分母、授权或来源不完整;
- 缩小: 只有更窄任务、数据、工具或人群可以通过;
- 停止: 问题、保护条件或硬风险不支持继续。
这里的“项目 Rubric 已通过”沿用 Capstone 合同的明确门槛:
- 总分至少 80 / 100;
- RAG、MCP、安全、评测、运维五项各自至少达到该项满分的 60%,不能用其他高分补偿;
- 跨租户泄漏、未授权写入、真实秘密入库、重复外部效果或无法执行回滚中任意一项存在,Capstone 直接未通过。
业务价值不足、真实授权缺失或保护条件不成立时,正确 NO-GO 或缩小范围可以证明决策能力;只要技术硬门和项目 Rubric 已通过,仍可用明确模拟完成课程。跨范围泄漏、未授权效果、重复效果、真实秘密或无法回滚导致的硬技术 NO-GO 则表示 Capstone 尚未通过,必须修复并重新取证。隐藏阻断、篡改门槛或伪造试点在任何轨道都不合格。
五天安排
标题“五天安排”| 学习日 | 建议时间 | 当天动作 | 离开前必须有的结果 |
|---|---|---|---|
| 第 1 天 | 1–2 小时 | 处理第 23 周决定,选择轨道并冻结授权/模拟卡 | 明确能做、不能做、谁能停止 |
| 第 2 天 | 2 小时 | 预注册任务、终态、分母、人工负担和保护规则 | 可执行的任务账本与停止条件 |
| 第 3 天 | 2–3 小时 | 运行授权试点或受控模拟,保留失败和产品反馈 | 逐例结果、失败、人工负担与变更记录 |
| 第 4 天 | 2–3 小时 | 非作者完成清洁部署、值守、降级、回滚和复验 | 不依赖作者的交接证据 |
| 第 5 天 | 1–2 小时 | 建证据索引,完成三听众答辩并作毕业决定 | 答辩包、录制或评审记录、毕业决定卡 |
本周产物
标题“本周产物”建议在自己的 Capstone 中形成:
docs/pilot-or-simulation-contract.mddocs/task-ledger.*docs/failure-and-human-burden-report.mddocs/product-feedback.mddocs/handoff.mddocs/graduation-decision.mdops/handoff/deployment-record.*ops/handoff/on-call-record.*ops/handoff/rollback-record.*evidence/final-index.mddemo/executive-outline.mddemo/frontline-outline.mddemo/engineering-outline.md公开作品集只放合成或允许公开的脱敏证据;私密授权、参与者信息、敏感原文和凭据不能因“毕业需要”进入仓库。
本周验收
标题“本周验收”所有轨道共同门槛
标题“所有轨道共同门槛”- 第 23 周决定允许当前动作;NO-GO 没有被日期绕过;
- 若第 23 周是硬技术 NO-GO,当前活动只标为隔离练习或关停交接,没有冒充 M6 或毕业;
- 若第 23 周证据无效或不足,先补齐复核、分母或新封存盲测,没有把“未知”写成通过;
- 轨道、候选、任务、数据、外部效果、窗口、负责人和停止条件明确;
- 每个任务分开记录真实角色目标或脚本角色目标与安全终态,并关联可复核证据;
- 失败、拒答、升级、人工接管和放弃没有从分母中删除;
- 人工负担写明总分钟、任务分母、承担角色和数据来源;
- 任一禁止事实或效果会停止活动并重开决定;
- 候选发生任何实质变化都会暂停活动、生成新版本并返回第 23 周;真实试点授权重新绑定版本;
- 非作者从清洁环境完成部署,作者的临时提示没有被隐藏;
- 非作者完成值守、止损、恢复或降级、完整回滚和任务级复验;
- 回滚包含代码、配置、语料/索引、策略、工具模式、迁移和外部状态中适用的部分;
- 老板、一线、工程三种答辩引用同一证据链;
- 毕业卡区分已证明、未证明、未知、限制和下一复查条件;
- 项目总分至少 80 / 100,且 RAG、MCP、安全、评测、运维五项各达到该项 60%;
- 跨租户泄漏、未授权写入、真实秘密入库、重复外部效果和无法回滚全部为 0;
- 公开材料没有真实秘密、未获允许的参与者信息或客户数据。
真实授权试点额外门槛
标题“真实授权试点额外门槛”- 有权角色以日期、范围和候选版本明确授权;
- 参与者已知目的、记录、用途与可见范围,并可跳过、纠正、停止和撤回;
- 直属主管不旁听个人研究,记录不用于绩效或纪律处分;
- 采用或使用行为有符合条件、邀请、同意、尝试和任务等分母以及时间窗;
- 结论只限当前样本和窗口,没有无依据外推或因果 ROI。
课程受控模拟额外门槛
标题“课程受控模拟额外门槛”- 只连接合成语料、隔离服务和获准工具;
- 参与同伴知道这是课程演练,不被描述为客户或目标员工;
- 报告使用“脚本任务、角色扮演、模拟环境”等准确名称;
- 没有声称用户采用、客户满意、生产可靠性、业务改善或 ROI。
常见失败与恢复
标题“常见失败与恢复”| 失败 | 诊断信号 | 恢复动作 |
|---|---|---|
| 没授权也称“小范围试点” | 没有 [D] 角色、范围和日期 | 改走课程模拟,删除真实试点声称 |
| 第 23 周硬技术 NO-GO 被日期覆盖 | 决定卡仍有跨范围、未授权效果或无法回滚等阻断 | 停止真实活动,修复后以新候选和新 final blind 重做发布证据 |
| 盲测泄漏或证据不可复核仍继续 | 没有有效 blind、分母或证据索引,却写“未发现问题” | 记为证据不足 NO-GO;补证,泄漏时换独立新封存集 |
| 活动中改候选却沿用旧授权 | 版本 manifest 与授权卡、任务账本不一致 | 立即暂停,形成新候选,回第 23 周取证并重新授权 |
| 模拟任务写成用户采用 | 分母是角色卡却出现“采用率” | 改为脚本任务终态,明确不能证明采用 |
| 只报成功任务 | 失败、放弃、人工接管不在分母 | 恢复原始账本,按任务与终态重算 |
| 把安全拒答算作业务完成 | 用户目标未达成却标成功 | 分开“目标完成”和“安全合同匹配” |
| 忽略人工负担 | 审批、核验和升级时间没有所有者 | 记录分钟、任务分母和承担者,评估是否可接受 |
| 作者一边讲一边“交接” | 文档缺口被口头提示掩盖 | 记录阻塞、修订交接包,由非作者重做 |
| 只回滚应用二进制 | 数据、索引、策略或外部效果仍不一致 | 回滚完整版本包并对账,再跑任务级复验 |
| 三份答辩讲了三个结论 | 老板版隐藏工程 NO-GO | 建共同证据索引,统一已知、未知和决定 |
| 为毕业删除失败 | 历史记录和最终报告对不上 | 恢复版本历史,作补证、缩小或停止决定 |
独立迁移:供应链缺料协同
标题“独立迁移:供应链缺料协同”把北辰政策确认迁移为“供应链计划员查询供应商交期与替代料规则,并在逐次批准后创建缺料升级单”。独立完成:
- 决定是真实授权的采购团队试点,还是合成供应链角色模拟;
- 设计 10–15 个任务,包含正常查询、合同冲突、过期交期、无权限工厂、参数变化、供应商 API 结果不明和索引陈旧;
- 分开记录任务完成、安全终态、人工核验、升级和对账负担;
- 让未参与实现的人部署并值守一次供应商 API 故障;
- 从故障候选回滚到已知正确版本,确认没有重复升级单;
- 分别向供应链负责人、计划员和平台工程师答辩。
没有真实企业授权时,使用合成供应商、订单、工厂和升级单。允许声称“完成受控供应链模拟”,不允许声称减少停线、提升供应商履约、获得采用或产生 ROI。
三层解释的最终检查
标题“三层解释的最终检查”- 老板版: 说明支持的决定、价值兑现机制、替代方案、当前证据、成本与人工负担、硬风险、继续或停止条件;不把模拟或短期观察包装成 ROI。
- 一线版: 说明工作哪一步改变,来源如何核验,什么时候必须拒答、重新批准、转人工或停止;参与和反馈如何退出,不把保护当阻力。
- 工程版: 说明候选版本、数据与权限、评测、安全、trace、负载、故障、对账、部署、回滚和非作者交接怎样复现。
如果任何一层需要隐藏另两层的事实才能成立,证据链仍未毕业。
课程结束后的去向
标题“课程结束后的去向”这条标准路线在第 24 周结束,不虚构第 25 周必修课。根据你的下一目标继续:
作品集可以删去敏感细节,但不能删去关键失败、模拟边界或 NO-GO。面试叙事可以更短,但不能比证据更确定。
相邻周
标题“相邻周”- 上一周:第 23 周:用证据作出 Capstone 发布决定
- 课程索引:24 周 FDE 学习路线
来源与事实边界
标题“来源与事实边界”- NIST AI RMF Generative AI Profile:生成式 AI 风险治理、测量与持续管理参考。
- Google SRE:Monitoring Distributed Systems:面向用户症状的监控与运行判断参考。
- Palantir:Forward Deployed Software Engineer:客户协作、工程实现和端到端交付职责参考。
本页内容核验日期:2026-09-12。 北辰、rc4、12 个脚本任务、同伴代号、全部分钟数和结论均为合成教学完成例,不是实际客户、用户、授权、运行或业务结果。本周课程门槛不是任何雇主的统一毕业或招聘标准;完成模拟不能证明生产安全、采用、效率、客户价值、就业结果或 ROI。Google SRE 链接的逐项核验状态见资料来源页。