FDE 实战项目
本页所说的 FDE,是 Forward Deployed Engineer(前沿部署工程师 / 前线部署工程师),不是 Full Disk Encryption(全盘加密)。FDE 项目不是功能截图合集;本教程定义的合格项目应当回答:客户为什么需要它、数据从哪里来、什么叫成功、失败时会怎样、谁能执行什么操作,以及上线后由谁运营。
建议按顺序完成前两个项目中的至少一个,再完成 Capstone。完整节奏见FDE 学习路线。
三个项目如何选择
标题“三个项目如何选择”| 项目 | 主要能力 | 建议周期 | 课程内相对难度 | 最适合证明 |
|---|---|---|---|---|
| 客服工单升级与根因工作台 | 发现、数据整合、指标、权限、应用交付 | 3–4 周 | 2/5 | 能把模糊运营问题变成可靠软件 |
| 供应链异常处置工作流 | 事件、规则、审批、幂等、恢复、审计 | 4–5 周 | 4/5 | 能安全地把建议变成业务动作 |
| 企业 RAG + MCP 助手 | 检索、Agent 工具、评测、安全、运维、交接 | 6–8 周 | 5/5 | 完整的企业 AI/FDE 交付能力 |
三个项目都使用合成数据或你有权公开的数据。不要把雇主、客户或个人的真实敏感信息放入公开仓库。
所有项目共用的证据包
标题“所有项目共用的证据包”无论选择哪个项目,仓库都应包含:
Discovery Brief:用户、现状流程、痛点证据、约束、成功指标与非目标;- 数据字典与数据来源说明,包含所有者、更新频率、质量规则和保留策略;
- 架构图、信任边界、关键 ADR 及被否决方案;
- 可重复部署与回滚步骤;
- 自动化测试、验收数据和失败样本;
- 威胁模型、权限矩阵和审计样例;
- SLO、仪表盘、告警、runbook 和故障演练记录;
- 5–10 分钟演示、上线建议、复盘与交接清单。
项目一:客服工单升级与根因工作台
标题“项目一:客服工单升级与根因工作台”场景
标题“场景”一家 B2B 软件团队的工单分散在客服系统、产品缺陷表和客户成功记录中。升级规则依赖个人经验,管理者直到周会才发现高风险客户。你的任务是交付一个统一工作台,让客服主管识别需要升级的工单、查看证据并分派负责人。
必须完成
标题“必须完成”- 访谈客服代表、主管和产品人员,写出当前升级流程与责任边界;
- 将至少三个合成数据源映射到统一工单模型,保留来源与更新时间;
- 先用透明规则形成风险分数;可选的模型分类不能覆盖人工规则;
- 提供队列、筛选、证据详情、负责人分派和状态历史;
- 在服务端实现角色权限,并记录每次状态修改;
- 用回放数据比较新流程与原流程,不把界面完成度当作业务成功。
验收标准
标题“验收标准”- 同一批输入重复摄取不会生成重复工单;来源总数与统一模型的可解释差异不超过课程设定的 0.5%;
- 预先标注的高风险工单召回率达到你在 Discovery Brief 中约定的目标,并同时报告误报;
- 普通客服不能修改他人负责的受限工单,主管操作留下用户、时间、旧值和新值;
- 五个核心用户任务都有端到端测试和一次真实用户走查;
- 能演示数据源延迟或缺失时的提示、重试和人工处理路径。
0.5% 是本课程用于迫使你做对账的项目目标,不是通用行业基准。若业务风险更高,应与利益相关者制定更严格门槛。
项目二:供应链异常处置工作流
标题“项目二:供应链异常处置工作流”场景
标题“场景”采购团队每天处理延期、库存不足和价格异常。多个系统会重复发送事件,供应商 API 也可能超时。你的任务不是做一块更漂亮的仪表盘,而是把“发现异常—收集证据—建议动作—人工批准—执行—对账”做成可恢复流程。
必须完成
标题“必须完成”- 定义异常事件、处置案例、审批、外部动作和审计记录的数据契约;
- 使用规则引擎产生确定性建议;模型只可解释或补充非结构化信息;
- 为每个外部动作提供预览,批准后才执行;
- 用幂等键、重试上限和对账任务处理重复或结果不明确的调用;
- 设计取消、超时、部分成功和人工接管状态;
- 交付运营队列、SLO、告警和供应商依赖故障 runbook。
验收标准
标题“验收标准”- 对同一事件回放 10 次,只生成一个有效案例和最多一个外部业务效果;
- 审批绑定到明确用户、案例、动作、参数摘要和有效期;参数变化后旧审批失效;
- 对超时、限流、确定性失败和结果不明确分别采取不同处理,不进行无限重试;
- 可从持久化状态恢复中断流程,并证明不会重复外部效果;
- 管理者可以用关联 ID 还原一次动作的请求、决策、批准、执行和对账过程。
项目三:企业 RAG + MCP 助手(Capstone)
标题“项目三:企业 RAG + MCP 助手(Capstone)”场景与边界
标题“场景与边界”内部员工需要从制度、产品手册和操作流程中得到有引用的答案,并在必要时创建服务请求。系统必须根据租户与角色过滤文档;知识不足时拒答;任何写操作都要先预览、再由用户逐次批准。
这里的目标不是构造“最自主”的 Agent。默认拓扑是一个 Agent 加确定性检索、策略和工具。只有评测证明并行或多 Agent 明显改善质量、隔离或时延时,才允许增加复杂度。
完整项目合同见企业 RAG + MCP 项目 README。
如果你的团队正在评估类似的 RAG 或 MCP 落地,但还无法确定场景、范围或验收口径,可以带着现有流程预约一次项目诊断。先判断问题是否值得解决,再决定是否进入原型与生产交付。
必须交付的垂直切片
标题“必须交付的垂直切片”- 发现与范围:三个用户角色、五个高价值任务、基线耗时、保护指标和上线决策人;
- 数据与访问:文档所有者、版本、有效期、租户和 ACL 元数据贯穿摄取、索引、检索与缓存;
- RAG:可复现的关键词或混合检索基线、引用、冲突处理和拒答;
- MCP 工具:至少一个只读工具、一个预览工具和一个经批准的写工具;
- 策略与审批:模型只提出动作,外部策略组件授权,执行器产生效果;
- 评测与验证:版本化数据集、确定性检查、人工评分校准和发布门槛;
- 生产运营:追踪、日志、指标、成本、SLO、告警、降级、回滚与交接。
Capstone 验收数据集
标题“Capstone 验收数据集”建立至少 100 条脱敏或合成样本,并固定版本:
| 类型 | 最少数量 | 要验证的问题 |
|---|---|---|
| 可回答问题 | 50 | 检索、事实、引用、时效和多文档综合 |
| 不可回答问题 | 20 | 系统是否明确拒答,而非补造答案 |
| 权限与跨租户问题 | 15 | 过滤是否在数据层生效,缓存是否隔离 |
| 提示注入与工具滥用 | 15 | 恶意内容能否改变策略或触发未授权效果 |
每条样本至少记录:case_id、用户/租户、问题、期望来源、允许结果、期望工具行为、风险标签和评审依据。切分训练、调试与最终验收样本,避免对测试题手工调参。
Capstone 发布门槛
标题“Capstone 发布门槛”下表是首版课程门槛,不是行业统一基准。交付时必须同时报告样本数、置信区间或误差范围、失败分布、模型/提示/索引/工具/策略版本以及单任务成本。
| 维度 | 首版门槛 | 证据 |
|---|---|---|
| 检索 | 在可回答集上 Recall@5 ≥ 0.85 |
固定语料与检索结果快照 |
| 回答 | 端到端任务成功率 ≥ 0.80 |
确定性规则加经校准的人工评分 |
| 引用 | 关键事实有引用,引用支持率 ≥ 0.90 |
主张—来源对照表 |
| 拒答 | 不可回答集正确拒答率 ≥ 0.90 |
20 条以上独立样本 |
| 权限 | 跨租户或越权泄漏 0 |
至少 15 条负向用例;任一失败即阻断 |
| 工具安全 | 未批准写入、参数变更后复用审批、重复外部效果均为 0 |
对抗与重放测试;任一失败即阻断 |
| 延迟 | 10 个并发用户的问答 p95 ≤ 8 秒 |
记录负载、硬件、模型与网络条件 |
| 可观测性 | 100% 验收运行可用 run_id 关联模型、检索、策略和工具步骤 |
Trace 抽样与字段检查 |
| 恢复 | 模型、索引或 MCP 单点故障时进入已定义降级路径 | 三类故障演练记录 |
| 成本 | 每个被接受任务不超过 Discovery Brief 中的预算 | 含模型、检索、工具、重试和人工复核 |
达到平均分不代表可以上线。跨租户泄漏、未授权写入、秘密暴露或无法回滚属于硬阻断项。
里程碑
标题“里程碑”| 里程碑 | 输出 | 退出条件 |
|---|---|---|
| M0 问题合同 | Discovery Brief、现状流程、数据分类、成功指标 | 客户代表与技术评审者认可范围 |
| M1 检索基线 | 数据管道、ACL 过滤、固定评测集、基线报告 | 结果可复现,失败可分类 |
| M2 安全问答 | 引用、拒答、冲突/过期处理 | 回答与安全门槛达到基线要求 |
| M3 MCP 动作 | 工具契约、策略、预览、审批、幂等和审计 | 未授权路径无法产生效果 |
| M4 生产门槛 | 负载、成本、追踪、告警、故障与恢复演练 | 发布清单无硬阻断项 |
| M5 试点交接 | 用户走查、指标对比、演示、runbook 和复盘 | 新维护者能部署、值守和回滚 |
如何评审项目,而不是评审演示
标题“如何评审项目,而不是评审演示”评审者应从仓库随机选择评测样本,复现一次成功路径和一次失败路径;更换用户角色尝试越权;重放一个写请求;关闭一个依赖;再根据文档从新环境部署。只观看作者准备好的“黄金路径”视频,不能证明项目完成。
项目说明中的数值只是初始课程门槛。真实客户项目必须先测量现状,再由业务所有者、安全负责人和技术负责人共同确定发布阈值。
项目通过验收后,继续阅读FDE 作品集,把 Discovery Brief、架构决策、评测报告、安全门槛和运维证据整理成招聘方可以复核的案例。
权威来源与核验记录
标题“权威来源与核验记录”以下页面均于 2026-08-19 核验:
- Model Context Protocol:Specification——核验时
latest解析到 2026-07-28 版;用于 MCP 角色、能力和协议边界。 - Model Context Protocol:Security Best Practices——授权、令牌、会话与远程服务器风险参考。
- Palantir:Forward Deployed Software Engineer——用于校验项目必须覆盖客户协作、架构、数据、应用构建和端到端部署,而不只是模型演示。
- Anthropic:Forward Deployed Engineer——用于校验生产 LLM 应用、MCP、评测、企业部署、客户发现和长期交付等岗位证据。
- NIST:AI RMF Generative AI Profile——生成式 AI 风险治理参考。
- OWASP:Top 10 for LLM Applications——提示注入、敏感信息、供应链、权限和过度代理等威胁类别。
- OpenTelemetry:Generative AI Semantic Conventions——生成式 AI 调用与 Agent 观测字段参考;采用前需核对各字段稳定性。
- Google SRE:Monitoring Distributed Systems——面向延迟、流量、错误和饱和度的监控方法。
- RAGAS(EACL 2024 Demo)——RAG 评测维度的研究参考;课程门槛由本项目另行设定。
这些来源提供职责、协议、风险与方法依据;本页的项目场景、周数、样本分配和数值门槛均为原创课程设计。