模块 1模型原理与 Agent 基础
模型评测与路由
先把任务拆成模型真正面对的能力单元
- 语言、模态、上下文长度与输出形态
- 推理、代码、Tool Calling 和指令遵循
- 事实时效、数据边界和安全等级
- 交互延迟、吞吐与单位任务成本
建立多维评测矩阵
质量
- 任务正确率
- 结构与工具调用准确率
- 长上下文和多轮稳定性
运行
- TTFT
- 端到端延迟
- 限流、错误率和方差
经济性
- 输入、缓存与输出费用
- 重试和工具循环后的单位成功成本
可运营性
- 版本稳定性
- 数据政策
- 可观测性和区域可用性
公平比较需要控制变量
- 同一任务集、Prompt、工具和输出契约
- 多次运行而不是单样本
- 记录拒答、超时和不完整结果
- 用置信区间或方差说明稳定性
- 避免公开 Benchmark 代替私有任务验证
路由由策略层负责
静态路由
- 按任务类型、租户、风险和区域
动态路由
- 输入复杂度估计
- 预算与实时容量
- 历史质量和健康状态
级联与升级
- 弱模型先行
- 置信不足升级
- 强模型复核高风险输出
Fallback 不是简单换模型重试
- 不同模型能力和上下文格式可能不等价
- 已执行 Tool 的副作用不能随请求重放
- 降级时应明确功能、质量和延迟变化
- 所有候选不可用时需要排队、人工或确定性兜底
模型是会漂移的外部依赖
- 模型别名、快照、Provider 行为和安全政策变化
- 灰度流量与 Shadow Evaluation
- 持续监控任务成功率而非只看 HTTP 错误
- 升级、回滚和废弃窗口
路由策略必须能被解释和审计
- 默认模型和例外条件
- 质量阈值、预算上限与风险门槛
- Fallback 顺序及其能力损失
- 何时重新基准测试和谁批准变更