模块 1模型原理与 Agent 基础
LLM 核心原理
文本不是按“字义”直接进入模型
Tokenization
- 子词词表与切分结果
- 中英文、代码和结构化文本的 Token 差异
- Token 数如何影响窗口、延迟与费用
从 Token 到上下文表示
- Embedding 只是起点
- 位置和上下文共同改变表示
- 相似表示不等于事实相同
- 不要把 Token 数等同于字符数或词数
Attention 解决的是条件关联
- 当前位置根据上下文计算相关性
- 多层变换组合局部与全局模式
- 位置、干扰项和长度会改变注意分配
对 Agent 工程的直接影响
- 重要约束必须可检索和可重申
- 长上下文容量不代表等权记忆
- 提示顺序与信息噪声需要评测
输出是逐 Token 的条件生成
每一步都依赖已有输入和已生成内容
- 局部概率最优不保证全局正确
- 早期错误会进入后续上下文
- 流畅与自洽可以伴随事实错误
解码策略改变分布而非知识
- Temperature
- Top-P 与 Top-K
- 贪心、采样与重复运行方差
能力来自训练分布、后训练与推理资源
预训练建立通用模式
- 语言、代码与世界知识的统计压缩
- 不是可追溯原文库
- 知识存在时效、稀疏和冲突
后训练塑造可用行为
- 指令遵循
- 偏好与安全对齐
- 工具调用和结构化输出习惯
推理时能力仍受条件约束
- Prompt 与上下文质量
- 推理预算
- 工具和外部事实源
把“推理”理解为可验证行为
- 模型可生成计划、分解和中间结论
- 中间步骤可能不忠实或错误
- 私有思维链不是系统审计证据
- 应外显计划、引用、工具结果和可检查产物
幻觉不是一个单点 Bug
知识侧
- 训练中缺失或过时
- 相近概念混合
- 来源不可追溯
上下文侧
- 检索错误
- 指令与数据冲突
- Lost-in-the-Middle 与污染
生成侧
- 概率补全填补未知
- 长链错误累积
- 过度服从错误前提
生产 Agent 必须外置的职责
- 事实权威源与 Grounding
- 业务规则、Schema 和运行时验证
- 身份、权限、事务与持久状态
- 评测、Trace、审批和事故恢复