KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA
调研与课程设计依据 — keel 龙骨
Safety Controls 的参考信息:调研与课程设计依据
这份报告说明安全控制课程的资料基础、覆盖范围和章节顺序。它用于核查可靠性,不是正文的前置阅读。
调研范围
调研于 2026-08-22 完成。安全定义与威胁分类优先采用 OWASP、NIST、MITRE、协议规范和平台官方安全文档;公开课程只用于比较讲解顺序。
| 资料 | 提供的视角 | 本课程如何使用 |
|---|---|---|
| OWASP Top 10 for Agentic Applications 2026 | Agent Goal Hijack、Tool Misuse、Identity & Privilege Abuse、Agentic Supply Chain、Unexpected Code Execution、Memory & Context Poisoning、Insecure Inter-Agent Communication、Cascading Failures、Human-Agent Trust Exploitation、Rogue Agents | 作为威胁覆盖清单,而不是按十个名称机械排章 |
| OWASP GenAI / LLM Top 10 | prompt injection、敏感信息、供应链、输出处理、过度代理等 | 补充模型输入输出和应用集成风险 |
| NIST AI Risk Management Framework | Govern、Map、Measure、Manage 风险管理功能与可信性考虑 | 把安全从一次过滤扩展为设计、测量、运营和改进闭环 |
| NIST AI 600-1: Generative AI Profile | 生成式 AI 特有风险和建议行动 | 支撑风险登记、评估和组织治理部分 |
| MITRE ATLAS | 对抗性 AI 的战术、技术和现实案例知识库 | 用攻击路径和检测点检查威胁模型,不把安全只看成输入分类 |
| MCP Security Best Practices | confused deputy、token passthrough、SSRF、session hijacking、本地 server compromise、scope minimization | 进入身份、OAuth、网络和本地工具边界章节 |
| Docker Seccomp | 默认系统调用 profile 与容器执行限制 | 说明进程隔离是纵深防御的一层,不是 prompt 规则 |
| Anthropic: Building Effective Agents | 简单组合模式、工具接口、环境反馈和 agent autonomy | 安全控制随自主性与工具能力增加,不追求无边界自治 |
| Ollama Structured Outputs | 本地模型 JSON Schema 输出 | 用真实模型生成受限 Proposal;身份和授权仍由程序提供 |
公开课程样本
| 样本 | 值得借鉴的部分 | 必须补足的部分 |
|---|---|---|
| Safe and Reliable AI via Guardrails | 连续业务案例;从失败模式进入 input/output guards、PII、主题限制和幻觉检查 | Guard 不能替代身份、授权、执行隔离、幂等和审计 |
| Quality and Safety for LLM Applications | 幻觉、jailbreak、数据泄露与持续监控;代码练习紧跟概念 | Agent 的多步工具调用和现实副作用需要独立威胁模型 |
| Hugging Face Agents Course | 从 Agent 基础、工具到框架和观测逐步推进 | 安全需要在工具能力出现时同步进入,而不是结尾提醒 |
调研后确定的六条主线
1. 从威胁模型开始,不从产品名开始
“接入一个 guardrail 框架”不是安全目标。先确定资产、攻击者、入口、信任边界、可接受影响和责任人,才能选择控制措施。
2. Prompt 规则不构成授权边界
模型会受注入、上下文污染和概率输出影响。身份、资源 scope、审批和工具权限必须由模型无法修改的程序与外部系统强制实施。
3. 来源比文本表面更重要
同一句“执行部署”来自认证用户、网页、长期记忆或另一个 Agent,信任级别完全不同。课程因此在策略之前先建立 provenance。
4. Agent 安全是控制平面与数据平面的共同问题
只过滤模型输入会漏掉 token passthrough、SSRF、命令执行、浏览器会话、日志泄密和供应链。安全控制必须覆盖完整执行链。
5. 人在回路中不是万能开关
审批必须展示真实 diff、绑定不可变动作、限制有效期并执行职责分离。含糊、频繁的确认只会形成审批疲劳。
6. 安全需要可测量和可运营
测试不仅看“是否识别恶意 prompt”,还要验证危险动作是否被执行点阻止、秘密是否离开边界、审计是否足够调查、策略更新是否引入回归。
OWASP 威胁如何落入章节
| Agentic 风险 | 主要章节 |
|---|---|
| Goal Hijack | 03、06 |
| Tool Misuse / Unexpected Code Execution | 04、07 |
| Identity & Privilege Abuse | 02、05、09 |
| Memory & Context Poisoning | 03、10 |
| Insecure Inter-Agent Communication | 02、10 |
| Agentic Supply Chain | 10 |
| Cascading Failures / Rogue Agents | 05、10、11 |
| Human-Agent Trust Exploitation | 09、11 |
为什么按这个顺序学习
威胁模型
-> 身份与授权
-> 来源与指令边界
-> 策略决定与强制点
-> 最小权限
-> Prompt Injection
-> 工具/代码/网络隔离
-> 数据外泄
-> 人工审批
-> 记忆/多 Agent/供应链
-> 审计与评估
读者先获得判断“谁、对什么、想做什么”的语言,再处理模型特有攻击。这样 Prompt Injection 不会被误学成关键词检测问题,Guardrail 也不会被误当作完整安全架构。