模块 1模型原理与 Agent 基础

模型评测与路由

先把任务拆成模型真正面对的能力单元

  • 语言、模态、上下文长度与输出形态
  • 推理、代码、Tool Calling 和指令遵循
  • 事实时效、数据边界和安全等级
  • 交互延迟、吞吐与单位任务成本

建立多维评测矩阵

质量

  • 任务正确率
  • 结构与工具调用准确率
  • 长上下文和多轮稳定性

运行

  • TTFT
  • 端到端延迟
  • 限流、错误率和方差

经济性

  • 输入、缓存与输出费用
  • 重试和工具循环后的单位成功成本

可运营性

  • 版本稳定性
  • 数据政策
  • 可观测性和区域可用性

公平比较需要控制变量

  • 同一任务集、Prompt、工具和输出契约
  • 多次运行而不是单样本
  • 记录拒答、超时和不完整结果
  • 用置信区间或方差说明稳定性
  • 避免公开 Benchmark 代替私有任务验证

路由由策略层负责

静态路由

  • 按任务类型、租户、风险和区域

动态路由

  • 输入复杂度估计
  • 预算与实时容量
  • 历史质量和健康状态

级联与升级

  • 弱模型先行
  • 置信不足升级
  • 强模型复核高风险输出

Fallback 不是简单换模型重试

  • 不同模型能力和上下文格式可能不等价
  • 已执行 Tool 的副作用不能随请求重放
  • 降级时应明确功能、质量和延迟变化
  • 所有候选不可用时需要排队、人工或确定性兜底

模型是会漂移的外部依赖

  • 模型别名、快照、Provider 行为和安全政策变化
  • 灰度流量与 Shadow Evaluation
  • 持续监控任务成功率而非只看 HTTP 错误
  • 升级、回滚和废弃窗口

路由策略必须能被解释和审计

  • 默认模型和例外条件
  • 质量阈值、预算上限与风险门槛
  • Fallback 顺序及其能力损失
  • 何时重新基准测试和谁批准变更