模块 1模型原理与 Agent 基础

模型优化决策

先定位失败层,再选择优化手段

失败可能来自

  • 任务定义错误
  • 模型能力不足
  • 上下文缺失或污染
  • 工具/Schema 设计错误
  • 运行时状态与流程错误

诊断证据

  • 代表性失败样本
  • Trace 与中间状态
  • 分层指标
  • 人工错误分类
  • 禁止用“换更强模型”掩盖系统性缺陷

先使用低成本、可回退的杠杆

Prompt

  • 指令、示例和输出契约
  • 适合行为边界不清

Context / RAG

  • 补充时效事实与私有知识
  • 适合知识缺失而非行为学习

Tool 与 Workflow

  • 把计算、验证、权限和确定性步骤外置
  • 适合模型不应承担的职责

模型与推理预算

  • 适合能力或复杂度分层
  • 必须看单位成功成本

微调解决的是稳定行为分布,不是所有知识问题

  • 输出风格、领域表达和重复任务模式
  • 大量高质量示例可获得且目标相对稳定
  • 基础模型已具备必要能力
  • Prompt/RAG 成本、延迟或稳定性已成为瓶颈

不适合微调

  • 频繁变化的事实
  • 数据稀少或标签不一致
  • 需要严格权限和计算正确性
  • 无法建立独立评测集

数据先于训练方案

训练数据契约

  • 输入分布与目标输出
  • 来源、许可与隐私
  • 去重、冲突和质量分层

独立评测

  • 禁止训练集泄漏
  • 覆盖边界与拒绝样本
  • 与原基线可比较
  • 用错误类型判断优化是否真正修复问题

蒸馏与合成数据的工程边界

  • 强模型生成候选数据不等于自动获得正确标签
  • 需要规则、人工或多模型校验
  • 蒸馏关注成本与延迟,但可能损失长尾能力
  • 记录 Teacher、Prompt、筛选规则和数据版本以保证可追溯

自托管、托管微调与通用 API 的决策变量

  • 数据不出域、定制深度、吞吐、延迟、人才和运维能力

总成本

  • 训练与实验
  • 推理基础设施
  • 监控、升级和安全响应

退出和迁移

  • 数据与评测资产可移植
  • 避免绑定不可替代的特性

把优化当成有停止条件的实验组合

  • 每个实验只改变一个主要变量
  • 同时观察质量、延迟、成本、安全和维护复杂度
  • 预先定义成功阈值与回滚条件
  • 没有统计或业务收益时停止继续投入

形成可评审的优化 ADR

  • 失败证据与根因假设
  • 候选手段及 Why Not
  • 数据、评测、费用和组织前提
  • 上线、监控、回滚与残余风险