跳转到内容

FDE 实战项目

本页所说的 FDE,是 Forward Deployed Engineer(前沿部署工程师 / 前线部署工程师),不是 Full Disk Encryption(全盘加密)。FDE 项目不是功能截图合集;本教程定义的合格项目应当回答:客户为什么需要它、数据从哪里来、什么叫成功、失败时会怎样、谁能执行什么操作,以及上线后由谁运营。

建议按顺序完成前两个项目中的至少一个,再完成 Capstone。完整节奏见FDE 学习路线

三个项目如何选择

标题“三个项目如何选择”
项目 主要能力 建议周期 课程内相对难度 最适合证明
客服工单升级与根因工作台 发现、数据整合、指标、权限、应用交付 3–4 周 2/5 能把模糊运营问题变成可靠软件
供应链异常处置工作流 事件、规则、审批、幂等、恢复、审计 4–5 周 4/5 能安全地把建议变成业务动作
企业 RAG + MCP 助手 检索、Agent 工具、评测、安全、运维、交接 6–8 周 5/5 完整的企业 AI/FDE 交付能力

三个项目都使用合成数据或你有权公开的数据。不要把雇主、客户或个人的真实敏感信息放入公开仓库。

所有项目共用的证据包

标题“所有项目共用的证据包”

无论选择哪个项目,仓库都应包含:

  • Discovery Brief:用户、现状流程、痛点证据、约束、成功指标与非目标;
  • 数据字典与数据来源说明,包含所有者、更新频率、质量规则和保留策略;
  • 架构图、信任边界、关键 ADR 及被否决方案;
  • 可重复部署与回滚步骤;
  • 自动化测试、验收数据和失败样本;
  • 威胁模型、权限矩阵和审计样例;
  • SLO、仪表盘、告警、runbook 和故障演练记录;
  • 5–10 分钟演示、上线建议、复盘与交接清单。

项目一:客服工单升级与根因工作台

标题“项目一:客服工单升级与根因工作台”

一家 B2B 软件团队的工单分散在客服系统、产品缺陷表和客户成功记录中。升级规则依赖个人经验,管理者直到周会才发现高风险客户。你的任务是交付一个统一工作台,让客服主管识别需要升级的工单、查看证据并分派负责人。

  1. 访谈客服代表、主管和产品人员,写出当前升级流程与责任边界;
  2. 将至少三个合成数据源映射到统一工单模型,保留来源与更新时间;
  3. 先用透明规则形成风险分数;可选的模型分类不能覆盖人工规则;
  4. 提供队列、筛选、证据详情、负责人分派和状态历史;
  5. 在服务端实现角色权限,并记录每次状态修改;
  6. 用回放数据比较新流程与原流程,不把界面完成度当作业务成功。
  • 同一批输入重复摄取不会生成重复工单;来源总数与统一模型的可解释差异不超过课程设定的 0.5%;
  • 预先标注的高风险工单召回率达到你在 Discovery Brief 中约定的目标,并同时报告误报;
  • 普通客服不能修改他人负责的受限工单,主管操作留下用户、时间、旧值和新值;
  • 五个核心用户任务都有端到端测试和一次真实用户走查;
  • 能演示数据源延迟或缺失时的提示、重试和人工处理路径。

0.5% 是本课程用于迫使你做对账的项目目标,不是通用行业基准。若业务风险更高,应与利益相关者制定更严格门槛。

项目二:供应链异常处置工作流

标题“项目二:供应链异常处置工作流”

采购团队每天处理延期、库存不足和价格异常。多个系统会重复发送事件,供应商 API 也可能超时。你的任务不是做一块更漂亮的仪表盘,而是把“发现异常—收集证据—建议动作—人工批准—执行—对账”做成可恢复流程。

  1. 定义异常事件、处置案例、审批、外部动作和审计记录的数据契约;
  2. 使用规则引擎产生确定性建议;模型只可解释或补充非结构化信息;
  3. 为每个外部动作提供预览,批准后才执行;
  4. 用幂等键、重试上限和对账任务处理重复或结果不明确的调用;
  5. 设计取消、超时、部分成功和人工接管状态;
  6. 交付运营队列、SLO、告警和供应商依赖故障 runbook。
  • 对同一事件回放 10 次,只生成一个有效案例和最多一个外部业务效果;
  • 审批绑定到明确用户、案例、动作、参数摘要和有效期;参数变化后旧审批失效;
  • 对超时、限流、确定性失败和结果不明确分别采取不同处理,不进行无限重试;
  • 可从持久化状态恢复中断流程,并证明不会重复外部效果;
  • 管理者可以用关联 ID 还原一次动作的请求、决策、批准、执行和对账过程。

项目三:企业 RAG + MCP 助手(Capstone)

标题“项目三:企业 RAG + MCP 助手(Capstone)”

内部员工需要从制度、产品手册和操作流程中得到有引用的答案,并在必要时创建服务请求。系统必须根据租户与角色过滤文档;知识不足时拒答;任何写操作都要先预览、再由用户逐次批准。

这里的目标不是构造“最自主”的 Agent。默认拓扑是一个 Agent 加确定性检索、策略和工具。只有评测证明并行或多 Agent 明显改善质量、隔离或时延时,才允许增加复杂度。

完整项目合同见企业 RAG + MCP 项目 README

如果你的团队正在评估类似的 RAG 或 MCP 落地,但还无法确定场景、范围或验收口径,可以带着现有流程预约一次项目诊断。先判断问题是否值得解决,再决定是否进入原型与生产交付。

必须交付的垂直切片

标题“必须交付的垂直切片”
  1. 发现与范围:三个用户角色、五个高价值任务、基线耗时、保护指标和上线决策人;
  2. 数据与访问:文档所有者、版本、有效期、租户和 ACL 元数据贯穿摄取、索引、检索与缓存;
  3. RAG:可复现的关键词或混合检索基线、引用、冲突处理和拒答;
  4. MCP 工具:至少一个只读工具、一个预览工具和一个经批准的写工具;
  5. 策略与审批:模型只提出动作,外部策略组件授权,执行器产生效果;
  6. 评测与验证:版本化数据集、确定性检查、人工评分校准和发布门槛;
  7. 生产运营:追踪、日志、指标、成本、SLO、告警、降级、回滚与交接。

Capstone 验收数据集

标题“Capstone 验收数据集”

建立至少 100 条脱敏或合成样本,并固定版本:

类型 最少数量 要验证的问题
可回答问题 50 检索、事实、引用、时效和多文档综合
不可回答问题 20 系统是否明确拒答,而非补造答案
权限与跨租户问题 15 过滤是否在数据层生效,缓存是否隔离
提示注入与工具滥用 15 恶意内容能否改变策略或触发未授权效果

每条样本至少记录:case_id、用户/租户、问题、期望来源、允许结果、期望工具行为、风险标签和评审依据。切分训练、调试与最终验收样本,避免对测试题手工调参。

下表是首版课程门槛,不是行业统一基准。交付时必须同时报告样本数、置信区间或误差范围、失败分布、模型/提示/索引/工具/策略版本以及单任务成本。

维度 首版门槛 证据
检索 在可回答集上 Recall@5 ≥ 0.85 固定语料与检索结果快照
回答 端到端任务成功率 ≥ 0.80 确定性规则加经校准的人工评分
引用 关键事实有引用,引用支持率 ≥ 0.90 主张—来源对照表
拒答 不可回答集正确拒答率 ≥ 0.90 20 条以上独立样本
权限 跨租户或越权泄漏 0 至少 15 条负向用例;任一失败即阻断
工具安全 未批准写入、参数变更后复用审批、重复外部效果均为 0 对抗与重放测试;任一失败即阻断
延迟 10 个并发用户的问答 p95 ≤ 8 秒 记录负载、硬件、模型与网络条件
可观测性 100% 验收运行可用 run_id 关联模型、检索、策略和工具步骤 Trace 抽样与字段检查
恢复 模型、索引或 MCP 单点故障时进入已定义降级路径 三类故障演练记录
成本 每个被接受任务不超过 Discovery Brief 中的预算 含模型、检索、工具、重试和人工复核

达到平均分不代表可以上线。跨租户泄漏、未授权写入、秘密暴露或无法回滚属于硬阻断项。

里程碑 输出 退出条件
M0 问题合同 Discovery Brief、现状流程、数据分类、成功指标 客户代表与技术评审者认可范围
M1 检索基线 数据管道、ACL 过滤、固定评测集、基线报告 结果可复现,失败可分类
M2 安全问答 引用、拒答、冲突/过期处理 回答与安全门槛达到基线要求
M3 MCP 动作 工具契约、策略、预览、审批、幂等和审计 未授权路径无法产生效果
M4 生产门槛 负载、成本、追踪、告警、故障与恢复演练 发布清单无硬阻断项
M5 试点交接 用户走查、指标对比、演示、runbook 和复盘 新维护者能部署、值守和回滚

如何评审项目,而不是评审演示

标题“如何评审项目,而不是评审演示”

评审者应从仓库随机选择评测样本,复现一次成功路径和一次失败路径;更换用户角色尝试越权;重放一个写请求;关闭一个依赖;再根据文档从新环境部署。只观看作者准备好的“黄金路径”视频,不能证明项目完成。

项目说明中的数值只是初始课程门槛。真实客户项目必须先测量现状,再由业务所有者、安全负责人和技术负责人共同确定发布阈值。

项目通过验收后,继续阅读FDE 作品集,把 Discovery Brief、架构决策、评测报告、安全门槛和运维证据整理成招聘方可以复核的案例。

权威来源与核验记录

标题“权威来源与核验记录”

以下页面均于 2026-08-19 核验:

这些来源提供职责、协议、风险与方法依据;本页的项目场景、周数、样本分配和数值门槛均为原创课程设计。