模块 9Agent 安全与治理
Prompt Injection 攻防
注入本质是指令与数据共享解释通道
- 直接注入来自用户消息
- 间接注入来自网页、文档、邮件、Tool 或其他 Agent
- 隐藏文本、编码、图像和多轮内容可承载指令
- 模型可能把低信任数据误当高优先级指令
危险来自注入与能力的组合
- 攻击内容进入 Context
- 模型改变计划、Tool 或输出
- Runtime 未做确定性校验
- 高权限 Tool、敏感数据或外发通道完成影响
- 因此降低模型可受影响性之外更要限制爆炸半径
内容层减少指令混淆
- 标注来源、信任级别和数据用途
- 隔离外部内容与系统指令
- 只抽取任务所需字段而非无界注入原文
- 对 HTML、附件、隐藏内容和重定向做解析治理
- 内容清洗是辅助控制,不是安全边界
执行层决定攻击能造成多大影响
- 最小 Tool 集与最小权限
- 参数 Schema、业务规则和资源级授权
- 网络/文件/Sandbox 隔离
- 高风险动作预览、审批和幂等
防止不可信内容诱导数据外传
- 敏感数据不进入不必要 Context
- Tool 输出和模型输出做数据分类检查
- 外发域名、Artifact 和消息渠道白名单
- 检测跨来源拼接、编码和分片泄露
检测信号服务于处置
- 可疑指令模式和内容来源
- 异常 Tool 选择、参数和调用序列
- 策略拒绝、审批修改和用户纠正
- 触发隔离、降低权限、停止 Run 和保全 Trace
对抗测试覆盖完整系统
- 直接、间接、多模态和多轮注入
- RAG、Memory、MCP、Subagent 与 Artifact 渠道
- 混淆编码、角色伪装和安全提示反推
- 成功标准看越权、泄露和副作用,而非模型是否复述恶意文本