模块 1模型原理与 Agent 基础
模型推理约束
一次推理请求的时间花在哪里
排队与 Prefill
- 限流和容量排队
- 输入上下文编码
- 输入长度对首 Token 时间的影响
Decode
- 逐 Token 生成
- 输出长度与总延迟
- 停止、取消和截断
网络与客户端
- 握手和跨区延迟
- 流消费与渲染
- 超时层级不一致
Context Window 是共享预算,不是可靠记忆
- 系统指令、对话、检索、工具结果和输出竞争同一窗口
标称容量与有效容量
- 任务效果会先于硬上限下降
- 中间信息容易被忽略
- 干扰项会稀释关键证据
溢出前必须有策略
- 拒绝或拆分
- 摘要与压缩
- 检索重组
- 保留可恢复的原始状态
Sampling 参数控制行为方差
Temperature、Top-P、Top-K
- 改变候选分布和多样性
- 参数语义存在模型与厂商差异
- 不应复制一套“万能参数”
确定性只能近似
- 固定参数不消除服务端变化
- 模型版本和基础设施会漂移
- 关键结论必须外部校验
推理预算与输出预算需要分开治理
- 复杂任务增加推理资源可能改善质量但提高延迟
- 可见输出短不代表内部计算少
- 结构化输出必须预留闭合空间
- 达到收益递减点后应改用工具、分解或更好上下文
缓存改变成本曲线,也引入命中约束
请求内 KV Cache
- 支撑逐 Token 解码
- 受序列长度影响
跨请求 Prompt Cache
- 稳定前缀才可能复用
- 变量位置影响命中
- 缓存失效和隐私边界
- 重试、工具循环和多 Agent 会放大总 Token
从单请求约束扩展到服务容量
- Provider Rate Limit 与并发上限
- 排队、背压、超时和熔断的联动
- 流式连接占用与取消后的资源回收
- 吞吐优先和交互延迟优先的不同批处理策略
用联合实验替代参数猜测
固定任务集与压力场景
- 正常输入
- 长上下文
- 高并发
- 失败与重试
同时记录
- 任务成功率与方差
- TTFT 与端到端耗时
- 输入、输出和缓存 Token
- 每个成功任务的成本
把结果转成系统策略
- 默认预算
- 超限降级
- 路由阈值
- 容量与费用告警