模块 4规划、执行与多 Agent
自纠正与评估器
先明确要纠正哪类错误
- 格式和 Schema 错误
- 事实或引用不一致
- 计划遗漏、Tool 参数或步骤错误
- 业务约束和安全策略违反
- 表达质量不等于任务成功
优先使用独立、确定性的验证信号
- Schema、编译、测试、查询和业务规则
- 权威数据源、引用对齐和多源核对
- 只有难以规则化时才用模型 Critic
- 高影响或证据冲突进入人工
自检应由风险和信号触发
- 关键动作或高价值输出
- 低置信、验证失败或来源冲突
- 异常步骤数、重复动作或输出漂移
- 不要对所有简单回答固定增加一次模型调用
Critic 输出必须可行动
- 通过/不通过与稳定原因码
- 定位到具体主张、字段或步骤
- 引用证据和建议修复范围
- 禁止只输出泛泛的“可以更完善”
修复循环要有边界
- 只回注必要错误和相关上下文
- 区分重新生成、局部修补、重新取证和换模型
- 限制次数、成本和总时长
- 连续同类失败后升级而不是无限反思
防止评估器与生成器共享盲点
- 不同 Prompt、模型或验证方法
- 不向 Judge 暴露候选来源以减少偏置
- 保留人工校准集
- 监控修复后变差和过度拒答
证明自纠正不是昂贵装饰
- 基线与纠正后成功率
- 按错误类型看净修复率
- 额外 Token、延迟和失败放大
- 确定哪些任务启用、禁用或只抽样