模块 11综合实战与故障案例

Browser Agent 实战

浏览器任务需要具体完成状态

  • 目标站点、账号和允许操作
  • 完成证据:页面状态、下载文件或业务回执
  • 不可执行动作、金额/提交审批
  • 登录、验证码和人工接管边界

感知层组合结构与视觉

  • DOM、Accessibility Tree 和可交互元素
  • 截图/视觉处理动态 Canvas 或无语义 UI
  • 视口、滚动、iframe、Shadow DOM 和弹窗
  • 页面内容是不可信输入,防间接注入

动作原子化且可验证

  • navigate、click、type、select、scroll、upload/download
  • 定位器优先语义和稳定属性,避免绝对坐标
  • 输入前清空/确认字段,提交前预览
  • 每次动作后等待明确条件并观察变化

浏览器会话是外部状态

  • Cookie、Storage、Tab、历史和下载
  • 会话隔离、凭据和 MFA
  • 刷新、重连和页面导航后的定位失效
  • 检查点包含 URL、关键业务状态而非仅 DOM 句柄

动态网页失败处理

  • 网络空闲不是所有应用的完成信号
  • 骨架屏、无限滚动、Toast 和异步校验
  • 元素遮挡、重复文本和布局变化
  • 重试前重新观察,避免重复提交

Browser Agent 的高风险边界

  • 域名、重定向和外链白名单
  • 文件上传下载与恶意内容扫描
  • 密码/Token 不进入模型 Context
  • 付款、发送、删除和发布强审批
  • 防止跨站数据复制和隐蔽外传

评测完整任务而非单次点击

  • 任务成功率、平均步骤和恢复率
  • 站点/布局/语言/延迟变化
  • 错误点击、重复提交和人工接管
  • 固定快照测试与真实站点小流量验证分开