模块 1模型原理与 Agent 基础

模型推理约束

一次推理请求的时间花在哪里

排队与 Prefill

  • 限流和容量排队
  • 输入上下文编码
  • 输入长度对首 Token 时间的影响

Decode

  • 逐 Token 生成
  • 输出长度与总延迟
  • 停止、取消和截断

网络与客户端

  • 握手和跨区延迟
  • 流消费与渲染
  • 超时层级不一致

Context Window 是共享预算,不是可靠记忆

  • 系统指令、对话、检索、工具结果和输出竞争同一窗口

标称容量与有效容量

  • 任务效果会先于硬上限下降
  • 中间信息容易被忽略
  • 干扰项会稀释关键证据

溢出前必须有策略

  • 拒绝或拆分
  • 摘要与压缩
  • 检索重组
  • 保留可恢复的原始状态

Sampling 参数控制行为方差

Temperature、Top-P、Top-K

  • 改变候选分布和多样性
  • 参数语义存在模型与厂商差异
  • 不应复制一套“万能参数”

确定性只能近似

  • 固定参数不消除服务端变化
  • 模型版本和基础设施会漂移
  • 关键结论必须外部校验

推理预算与输出预算需要分开治理

  • 复杂任务增加推理资源可能改善质量但提高延迟
  • 可见输出短不代表内部计算少
  • 结构化输出必须预留闭合空间
  • 达到收益递减点后应改用工具、分解或更好上下文

缓存改变成本曲线,也引入命中约束

请求内 KV Cache

  • 支撑逐 Token 解码
  • 受序列长度影响

跨请求 Prompt Cache

  • 稳定前缀才可能复用
  • 变量位置影响命中
  • 缓存失效和隐私边界
  • 重试、工具循环和多 Agent 会放大总 Token

从单请求约束扩展到服务容量

  • Provider Rate Limit 与并发上限
  • 排队、背压、超时和熔断的联动
  • 流式连接占用与取消后的资源回收
  • 吞吐优先和交互延迟优先的不同批处理策略

用联合实验替代参数猜测

固定任务集与压力场景

  • 正常输入
  • 长上下文
  • 高并发
  • 失败与重试

同时记录

  • 任务成功率与方差
  • TTFT 与端到端耗时
  • 输入、输出和缓存 Token
  • 每个成功任务的成本

把结果转成系统策略

  • 默认预算
  • 超限降级
  • 路由阈值
  • 容量与费用告警