模块 4规划、执行与多 Agent

自纠正与评估器

先明确要纠正哪类错误

  • 格式和 Schema 错误
  • 事实或引用不一致
  • 计划遗漏、Tool 参数或步骤错误
  • 业务约束和安全策略违反
  • 表达质量不等于任务成功

优先使用独立、确定性的验证信号

  • Schema、编译、测试、查询和业务规则
  • 权威数据源、引用对齐和多源核对
  • 只有难以规则化时才用模型 Critic
  • 高影响或证据冲突进入人工

自检应由风险和信号触发

  • 关键动作或高价值输出
  • 低置信、验证失败或来源冲突
  • 异常步骤数、重复动作或输出漂移
  • 不要对所有简单回答固定增加一次模型调用

Critic 输出必须可行动

  • 通过/不通过与稳定原因码
  • 定位到具体主张、字段或步骤
  • 引用证据和建议修复范围
  • 禁止只输出泛泛的“可以更完善”

修复循环要有边界

  • 只回注必要错误和相关上下文
  • 区分重新生成、局部修补、重新取证和换模型
  • 限制次数、成本和总时长
  • 连续同类失败后升级而不是无限反思

防止评估器与生成器共享盲点

  • 不同 Prompt、模型或验证方法
  • 不向 Judge 暴露候选来源以减少偏置
  • 保留人工校准集
  • 监控修复后变差和过度拒答

证明自纠正不是昂贵装饰

  • 基线与纠正后成功率
  • 按错误类型看净修复率
  • 额外 Token、延迟和失败放大
  • 确定哪些任务启用、禁用或只抽样