模块 7评测与生产可靠性
回归与发布门禁
Agent 发布单元大于代码
- 模型和推理参数
- Prompt、Context 和 Memory 策略
- Tool Schema、实现和权限
- 索引、Embedding、Reranker 和数据
- Workflow、Guardrail、UI 协议和 Runtime
按变更影响选择评测,不盲跑一个总集
- 目标组件的单元/契约测试
- 受影响任务和关键切片回归
- 端到端 Golden Scenario
- 安全、隐私和副作用硬门禁
- 周期性全量评测发现跨层耦合
门禁区分硬失败与统计退化
- Schema、越权、数据泄露和重复副作用零容忍
- 质量指标允许按置信区间和切片比较
- 延迟和成本看单位成功任务
- 新能力收益不能掩盖核心场景回退
评测环境要可复现又避免真实破坏
- 固定版本、种子和依赖快照
- Tool 使用 Sandbox/Fake/Record-Replay
- 数据快照与权限模型接近生产
- 概率任务多次运行并记录方差
发布逐步扩大真实风险
- 离线通过后进入 Shadow
- 内部/低风险租户 Canary
- 按任务和风险分层扩大
- 每阶段定义观察窗口与自动停止条件
线上实验要回答因果问题而非只看涨跌
实验单元与分流
- 按用户、租户、Session 或任务选择随机化单元
- 控制组与实验组保持稳定分配
- 共享 Memory、Tool 和组织协作可能造成跨组干扰
指标与统计设计
- 预先确定一个主要指标和必要的护栏指标
- 根据最小可检测效应估算样本量与统计功效
- 同时报告效应量、置信区间和显著性,不只看 p 值
识别实验污染与时序偏差
- 新奇效应、学习效应和流量结构变化
- 模型、Prompt、索引或 Tool 在实验中途漂移
- 多轮交互和跨用户协作破坏样本独立性
停止规则与风险回滚
- 预注册观察窗口和最小样本,避免反复偷看
- 安全、合规和核心体验护栏恶化时立即停止
- 实验结论记录适用切片、不确定性和后续验证
回滚需要覆盖配置、数据和状态
- 代码、Prompt、模型和路由版本
- 索引/Embedding 双版本切换
- Tool Schema 与消费者兼容
- 在途 Run 固定或迁移到何种版本
门禁豁免必须可治理
- 业务理由、风险 Owner 和到期时间
- 缩小流量/权限/功能的补偿控制
- 线上监控和人工容量
- 事后补评和关闭条件