KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA
06. 怎样证明它已经达到上线标准? — keel 龙骨
三条演示回答正确,只说明你挑了三个成功样本。上线评估必须覆盖真实分布、关键失败、安全边界和业务结果,并能阻止不合格版本发布。
三条演示回答正确,只说明你挑了三个成功样本。上线评估必须覆盖真实分布、关键失败、安全边界和业务结果,并能阻止不合格版本发布。
Golden Set 的分层
- 常见路径:正常 incident、充足证据;
- 长尾路径:字段缺失、语言混合、旧 schema;
- 对抗路径:prompt injection、越权引用、伪造 tool result;
- 运行路径:超时、重复 webhook、worker 重启;
- 业务路径:应自动、应升级人工、应明确拒绝。
每个 case 保存输入、允许数据、期望 disposition、必要证据、禁止行为和版本。自由文本不要求字面一致,但关键事实和动作边界必须确定。
从模型指标到发布决定
质量、citation、安全、重复副作用、成本、p95 延迟和业务时间共同进入 gate。硬安全条件失败直接阻止;质量/成本条件是否允许降级由 Acceptance Plan 预先规定。
python courses/advanced/fde-customer-delivery/course/project/examples/03_evaluation_gate.py
示例会展示高平均分仍因一次 tenant leakage 被拒绝。平均指标不能抵消安全硬失败。
Error Analysis
按最早失败边界分类:数据缺失、检索、context selection、模型判断、tool、policy、UI 或人工流程。只调 prompt 会把系统错误错误归因给模型。
本章交付物
- 30 条以上分层 golden set;
- 基线、候选版本和消融对照;
- 失败分类和 top error clusters;
- 可机器执行的 Launch Gate 及例外审批机制。
自测
- Recall 上升但人工纠正率不变,是否值得发布?
- citation precision 为 1 但关键证据都没召回,说明什么?
- 谁有权临时豁免哪类门禁?豁免何时失效?