模块 9Agent 安全与治理

Agent 威胁建模

先描述真实系统而非抽象“AI”

  • 用户、管理员、开发者和第三方主体
  • 模型、Gateway、Runtime、Tool、MCP、RAG、Memory、Artifact
  • 身份、数据、代码、业务对象和外部系统
  • 同步、异步、审批、恢复和多 Agent 数据流

按业务影响识别保护资产

  • 身份、Token、私有数据和知识产权
  • Tool 权限、资金、消息、生产环境和外部承诺
  • Prompt、模型、Skill、评测与供应链完整性
  • 可用性、成本和组织声誉

Agent 特有的信任边界

  • 用户输入与间接外部内容
  • 模型输出到确定性执行器
  • Host 与 Tool/MCP/远程 Agent
  • 租户、子 Agent 和共享 Memory
  • 开发/评测/生产与第三方 Provider

从攻击者目标构造完整路径

影响模型决策

即时上下文

  • 直接/间接 Prompt Injection
  • 检索、附件和网页中的隐藏指令

持久影响

  • Memory/索引投毒
  • 恶意 Tool 描述与 Skill 供应链

扩大权限

  • 过宽 Scope
  • Confused Deputy
  • 审批绕过

外传

显式通道

  • 模型回答、消息和导出 Artifact
  • Tool 参数与远程 Agent 消息

隐蔽通道

  • 编码、分片和 URL 参数
  • Trace、错误与外部资源请求

破坏

  • 循环、资源耗尽、重试风暴和状态污染

加入“合法用户滥用”与业务逻辑风险

  • 在授权范围内批量做高影响操作
  • 组合多个低风险 Tool 形成高风险结果
  • 绕开频率、审批或职责分离
  • 利用模型不确定性制造责任争议

控制映射到具体执行点

  • 身份/权限、输入隔离、Schema、策略、Sandbox、审批
  • 幂等/补偿、Trace、SLO、评测和事件响应
  • 预防、检测、响应和恢复不能只做预防
  • 每个控制标记 Owner 与可验证证据

形成可追踪的风险决策

  • 可能性、影响、可检测性和暴露面
  • 缓解、规避、转移或有期限接受
  • 残余风险、例外 Owner 和到期时间
  • 架构、Tool、数据或威胁变化时重新建模