模块 1模型原理与 Agent 基础
模型优化决策
先定位失败层,再选择优化手段
失败可能来自
- 任务定义错误
- 模型能力不足
- 上下文缺失或污染
- 工具/Schema 设计错误
- 运行时状态与流程错误
诊断证据
- 代表性失败样本
- Trace 与中间状态
- 分层指标
- 人工错误分类
- 禁止用“换更强模型”掩盖系统性缺陷
先使用低成本、可回退的杠杆
Prompt
- 指令、示例和输出契约
- 适合行为边界不清
Context / RAG
- 补充时效事实与私有知识
- 适合知识缺失而非行为学习
Tool 与 Workflow
- 把计算、验证、权限和确定性步骤外置
- 适合模型不应承担的职责
模型与推理预算
- 适合能力或复杂度分层
- 必须看单位成功成本
微调解决的是稳定行为分布,不是所有知识问题
- 输出风格、领域表达和重复任务模式
- 大量高质量示例可获得且目标相对稳定
- 基础模型已具备必要能力
- Prompt/RAG 成本、延迟或稳定性已成为瓶颈
不适合微调
- 频繁变化的事实
- 数据稀少或标签不一致
- 需要严格权限和计算正确性
- 无法建立独立评测集
数据先于训练方案
训练数据契约
- 输入分布与目标输出
- 来源、许可与隐私
- 去重、冲突和质量分层
独立评测
- 禁止训练集泄漏
- 覆盖边界与拒绝样本
- 与原基线可比较
- 用错误类型判断优化是否真正修复问题
蒸馏与合成数据的工程边界
- 强模型生成候选数据不等于自动获得正确标签
- 需要规则、人工或多模型校验
- 蒸馏关注成本与延迟,但可能损失长尾能力
- 记录 Teacher、Prompt、筛选规则和数据版本以保证可追溯
自托管、托管微调与通用 API 的决策变量
- 数据不出域、定制深度、吞吐、延迟、人才和运维能力
总成本
- 训练与实验
- 推理基础设施
- 监控、升级和安全响应
退出和迁移
- 数据与评测资产可移植
- 避免绑定不可替代的特性
把优化当成有停止条件的实验组合
- 每个实验只改变一个主要变量
- 同时观察质量、延迟、成本、安全和维护复杂度
- 预先定义成功阈值与回滚条件
- 没有统计或业务收益时停止继续投入
形成可评审的优化 ADR
- 失败证据与根因假设
- 候选手段及 Why Not
- 数据、评测、费用和组织前提
- 上线、监控、回滚与残余风险