模块 9Agent 安全与治理

Prompt Injection 攻防

注入本质是指令与数据共享解释通道

  • 直接注入来自用户消息
  • 间接注入来自网页、文档、邮件、Tool 或其他 Agent
  • 隐藏文本、编码、图像和多轮内容可承载指令
  • 模型可能把低信任数据误当高优先级指令

危险来自注入与能力的组合

  • 攻击内容进入 Context
  • 模型改变计划、Tool 或输出
  • Runtime 未做确定性校验
  • 高权限 Tool、敏感数据或外发通道完成影响
  • 因此降低模型可受影响性之外更要限制爆炸半径

内容层减少指令混淆

  • 标注来源、信任级别和数据用途
  • 隔离外部内容与系统指令
  • 只抽取任务所需字段而非无界注入原文
  • 对 HTML、附件、隐藏内容和重定向做解析治理
  • 内容清洗是辅助控制,不是安全边界

执行层决定攻击能造成多大影响

  • 最小 Tool 集与最小权限
  • 参数 Schema、业务规则和资源级授权
  • 网络/文件/Sandbox 隔离
  • 高风险动作预览、审批和幂等

防止不可信内容诱导数据外传

  • 敏感数据不进入不必要 Context
  • Tool 输出和模型输出做数据分类检查
  • 外发域名、Artifact 和消息渠道白名单
  • 检测跨来源拼接、编码和分片泄露

检测信号服务于处置

  • 可疑指令模式和内容来源
  • 异常 Tool 选择、参数和调用序列
  • 策略拒绝、审批修改和用户纠正
  • 触发隔离、降低权限、停止 Run 和保全 Trace

对抗测试覆盖完整系统

  • 直接、间接、多模态和多轮注入
  • RAG、Memory、MCP、Subagent 与 Artifact 渠道
  • 混淆编码、角色伪装和安全提示反推
  • 成功标准看越权、泄露和副作用,而非模型是否复述恶意文本