KEEL · 龙骨 · A CURRICULUM FOR THE AI ERA

调研与课程设计依据 — keel 龙骨

Safety Controls 的参考信息:调研与课程设计依据

这份报告说明安全控制课程的资料基础、覆盖范围和章节顺序。它用于核查可靠性,不是正文的前置阅读。

调研范围

调研于 2026-08-22 完成。安全定义与威胁分类优先采用 OWASP、NIST、MITRE、协议规范和平台官方安全文档;公开课程只用于比较讲解顺序。

资料 提供的视角 本课程如何使用
OWASP Top 10 for Agentic Applications 2026 Agent Goal Hijack、Tool Misuse、Identity & Privilege Abuse、Agentic Supply Chain、Unexpected Code Execution、Memory & Context Poisoning、Insecure Inter-Agent Communication、Cascading Failures、Human-Agent Trust Exploitation、Rogue Agents 作为威胁覆盖清单,而不是按十个名称机械排章
OWASP GenAI / LLM Top 10 prompt injection、敏感信息、供应链、输出处理、过度代理等 补充模型输入输出和应用集成风险
NIST AI Risk Management Framework Govern、Map、Measure、Manage 风险管理功能与可信性考虑 把安全从一次过滤扩展为设计、测量、运营和改进闭环
NIST AI 600-1: Generative AI Profile 生成式 AI 特有风险和建议行动 支撑风险登记、评估和组织治理部分
MITRE ATLAS 对抗性 AI 的战术、技术和现实案例知识库 用攻击路径和检测点检查威胁模型,不把安全只看成输入分类
MCP Security Best Practices confused deputy、token passthrough、SSRF、session hijacking、本地 server compromise、scope minimization 进入身份、OAuth、网络和本地工具边界章节
Docker Seccomp 默认系统调用 profile 与容器执行限制 说明进程隔离是纵深防御的一层,不是 prompt 规则
Anthropic: Building Effective Agents 简单组合模式、工具接口、环境反馈和 agent autonomy 安全控制随自主性与工具能力增加,不追求无边界自治
Ollama Structured Outputs 本地模型 JSON Schema 输出 用真实模型生成受限 Proposal;身份和授权仍由程序提供

公开课程样本

样本 值得借鉴的部分 必须补足的部分
Safe and Reliable AI via Guardrails 连续业务案例;从失败模式进入 input/output guards、PII、主题限制和幻觉检查 Guard 不能替代身份、授权、执行隔离、幂等和审计
Quality and Safety for LLM Applications 幻觉、jailbreak、数据泄露与持续监控;代码练习紧跟概念 Agent 的多步工具调用和现实副作用需要独立威胁模型
Hugging Face Agents Course 从 Agent 基础、工具到框架和观测逐步推进 安全需要在工具能力出现时同步进入,而不是结尾提醒

调研后确定的六条主线

1. 从威胁模型开始,不从产品名开始

“接入一个 guardrail 框架”不是安全目标。先确定资产、攻击者、入口、信任边界、可接受影响和责任人,才能选择控制措施。

2. Prompt 规则不构成授权边界

模型会受注入、上下文污染和概率输出影响。身份、资源 scope、审批和工具权限必须由模型无法修改的程序与外部系统强制实施。

3. 来源比文本表面更重要

同一句“执行部署”来自认证用户、网页、长期记忆或另一个 Agent,信任级别完全不同。课程因此在策略之前先建立 provenance。

4. Agent 安全是控制平面与数据平面的共同问题

只过滤模型输入会漏掉 token passthrough、SSRF、命令执行、浏览器会话、日志泄密和供应链。安全控制必须覆盖完整执行链。

5. 人在回路中不是万能开关

审批必须展示真实 diff、绑定不可变动作、限制有效期并执行职责分离。含糊、频繁的确认只会形成审批疲劳。

6. 安全需要可测量和可运营

测试不仅看“是否识别恶意 prompt”,还要验证危险动作是否被执行点阻止、秘密是否离开边界、审计是否足够调查、策略更新是否引入回归。

OWASP 威胁如何落入章节

Agentic 风险 主要章节
Goal Hijack 03、06
Tool Misuse / Unexpected Code Execution 04、07
Identity & Privilege Abuse 02、05、09
Memory & Context Poisoning 03、10
Insecure Inter-Agent Communication 02、10
Agentic Supply Chain 10
Cascading Failures / Rogue Agents 05、10、11
Human-Agent Trust Exploitation 09、11

为什么按这个顺序学习

威胁模型
  -> 身份与授权
  -> 来源与指令边界
  -> 策略决定与强制点
  -> 最小权限
  -> Prompt Injection
  -> 工具/代码/网络隔离
  -> 数据外泄
  -> 人工审批
  -> 记忆/多 Agent/供应链
  -> 审计与评估

读者先获得判断“谁、对什么、想做什么”的语言,再处理模型特有攻击。这样 Prompt Injection 不会被误学成关键词检测问题,Guardrail 也不会被误当作完整安全架构。

进入 keel 阅读