模块 9Agent 安全与治理
Agent 威胁建模
先描述真实系统而非抽象“AI”
- 用户、管理员、开发者和第三方主体
- 模型、Gateway、Runtime、Tool、MCP、RAG、Memory、Artifact
- 身份、数据、代码、业务对象和外部系统
- 同步、异步、审批、恢复和多 Agent 数据流
按业务影响识别保护资产
- 身份、Token、私有数据和知识产权
- Tool 权限、资金、消息、生产环境和外部承诺
- Prompt、模型、Skill、评测与供应链完整性
- 可用性、成本和组织声誉
Agent 特有的信任边界
- 用户输入与间接外部内容
- 模型输出到确定性执行器
- Host 与 Tool/MCP/远程 Agent
- 租户、子 Agent 和共享 Memory
- 开发/评测/生产与第三方 Provider
从攻击者目标构造完整路径
影响模型决策
即时上下文
- 直接/间接 Prompt Injection
- 检索、附件和网页中的隐藏指令
持久影响
- Memory/索引投毒
- 恶意 Tool 描述与 Skill 供应链
扩大权限
- 过宽 Scope
- Confused Deputy
- 审批绕过
外传
显式通道
- 模型回答、消息和导出 Artifact
- Tool 参数与远程 Agent 消息
隐蔽通道
- 编码、分片和 URL 参数
- Trace、错误与外部资源请求
破坏
- 循环、资源耗尽、重试风暴和状态污染
加入“合法用户滥用”与业务逻辑风险
- 在授权范围内批量做高影响操作
- 组合多个低风险 Tool 形成高风险结果
- 绕开频率、审批或职责分离
- 利用模型不确定性制造责任争议
控制映射到具体执行点
- 身份/权限、输入隔离、Schema、策略、Sandbox、审批
- 幂等/补偿、Trace、SLO、评测和事件响应
- 预防、检测、响应和恢复不能只做预防
- 每个控制标记 Owner 与可验证证据
形成可追踪的风险决策
- 可能性、影响、可检测性和暴露面
- 缓解、规避、转移或有期限接受
- 残余风险、例外 Owner 和到期时间
- 架构、Tool、数据或威胁变化时重新建模