KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA

FDE Customer Delivery — keel 龙骨

用户说“我们想用 AI 自动处理故障”时,模型和框架都还不是第一个问题。FDE 首先要确认谁在什么时候做什么、数据和权限在哪里、错误会造成什么损失,以及什么结果才值得上线。随后才是架构、实现、评估、部署、采用和交接。

用户说“我们想用 AI 自动处理故障”时,模型和框架都还不是第一个问题。FDE 首先要确认谁在什么时候做什么、数据和权限在哪里、错误会造成什么损失,以及什么结果才值得上线。随后才是架构、实现、评估、部署、采用和交接。

章节目录

  1. 01. 客户要的真是一个 Agent 吗? — 客户提出:“给值班团队做一个自动诊断 Agent。”如果直接讨论模型、RAG 和多 Agent,你很可能在优化一个未经验证的解法。FDE 的第一步是找到真实决策和瓶颈。
  2. 02. 怎样把工作流变成可验收结果? — Discovery 确认了“初步诊断耗时长”,还不能直接进入实现。你需要把当前流程和目标流程画出来,并把“更快、更准”变成可以在发布会上做决定的指标。
  3. 03. 客户系统怎样接进来而不失控? — 事件助手需要 ticket、metrics、change 和 runbook。真实客户环境里,这些数据来自不同身份系统、网络区域和 schema 版本;接口超时与重复 webhook 比 prompt 更早决定项目能否上线。
  4. 04. 第一条全栈垂直切片应该包含什么? — 一个 notebook 能证明模型可能有用,不能证明用户能完成工作。第一条 vertical slice 要从真实身份进入,到一个有证据、有状态、可恢复的用户结果结束。
  5. 05. 怎样装配 Agent,而不是堆框架? — 全栈路径已经能传递真实事件,此时才决定模型、Harness、检索和工具怎样组合。FDE 的架构能力体现在责任和替换边界,而不是框架数量。
  6. 06. 怎样证明它已经达到上线标准? — 三条演示回答正确,只说明你挑了三个成功样本。上线评估必须覆盖真实分布、关键失败、安全边界和业务结果,并能阻止不合格版本发布。
  7. 07. 怎样从 staging 走到可回滚生产? — 通过离线评估仍不等于生产安全。身份、网络、真实分布、并发和用户行为只会在线出现;因此发布是逐步扩大风险敞口的状态机。
  8. 08. 安全、隐私和治理怎样进入交付? — 安全审查若在发布前一周才开始,通常只能要求延期或接受未知风险。FDE 应从 Discovery 的数据和决策开始 threat modeling,并让每项控制进入架构、测试和 owner。
  9. 09. 客户会用、运维会接、产品会复用吗? — 技术上线但用户仍复制粘贴旧流程,项目没有完成;只有原 FDE 知道如何恢复,项目也没有完成。Adoption 和 handoff 是工程结果的一部分。
  10. 10. 完成一次端到端 FDE 部署 — 结课不是展示一段回答,而是完成一次 Production Readiness Review。你要证明问题值得解决、系统达到接受标准、风险有人负责、发布可回滚、用户愿意采用、运维能够接手。

进入 keel 阅读