模块 7评测与生产可靠性

回归与发布门禁

Agent 发布单元大于代码

  • 模型和推理参数
  • Prompt、Context 和 Memory 策略
  • Tool Schema、实现和权限
  • 索引、Embedding、Reranker 和数据
  • Workflow、Guardrail、UI 协议和 Runtime

按变更影响选择评测,不盲跑一个总集

  • 目标组件的单元/契约测试
  • 受影响任务和关键切片回归
  • 端到端 Golden Scenario
  • 安全、隐私和副作用硬门禁
  • 周期性全量评测发现跨层耦合

门禁区分硬失败与统计退化

  • Schema、越权、数据泄露和重复副作用零容忍
  • 质量指标允许按置信区间和切片比较
  • 延迟和成本看单位成功任务
  • 新能力收益不能掩盖核心场景回退

评测环境要可复现又避免真实破坏

  • 固定版本、种子和依赖快照
  • Tool 使用 Sandbox/Fake/Record-Replay
  • 数据快照与权限模型接近生产
  • 概率任务多次运行并记录方差

发布逐步扩大真实风险

  • 离线通过后进入 Shadow
  • 内部/低风险租户 Canary
  • 按任务和风险分层扩大
  • 每阶段定义观察窗口与自动停止条件

线上实验要回答因果问题而非只看涨跌

实验单元与分流

  • 按用户、租户、Session 或任务选择随机化单元
  • 控制组与实验组保持稳定分配
  • 共享 Memory、Tool 和组织协作可能造成跨组干扰

指标与统计设计

  • 预先确定一个主要指标和必要的护栏指标
  • 根据最小可检测效应估算样本量与统计功效
  • 同时报告效应量、置信区间和显著性,不只看 p 值

识别实验污染与时序偏差

  • 新奇效应、学习效应和流量结构变化
  • 模型、Prompt、索引或 Tool 在实验中途漂移
  • 多轮交互和跨用户协作破坏样本独立性

停止规则与风险回滚

  • 预注册观察窗口和最小样本,避免反复偷看
  • 安全、合规和核心体验护栏恶化时立即停止
  • 实验结论记录适用切片、不确定性和后续验证

回滚需要覆盖配置、数据和状态

  • 代码、Prompt、模型和路由版本
  • 索引/Embedding 双版本切换
  • Tool Schema 与消费者兼容
  • 在途 Run 固定或迁移到何种版本

门禁豁免必须可治理

  • 业务理由、风险 Owner 和到期时间
  • 缩小流量/权限/功能的补偿控制
  • 线上监控和人工容量
  • 事后补评和关闭条件