模块 1模型原理与 Agent 基础

LLM 核心原理

文本不是按“字义”直接进入模型

Tokenization

  • 子词词表与切分结果
  • 中英文、代码和结构化文本的 Token 差异
  • Token 数如何影响窗口、延迟与费用

从 Token 到上下文表示

  • Embedding 只是起点
  • 位置和上下文共同改变表示
  • 相似表示不等于事实相同
  • 不要把 Token 数等同于字符数或词数

Attention 解决的是条件关联

  • 当前位置根据上下文计算相关性
  • 多层变换组合局部与全局模式
  • 位置、干扰项和长度会改变注意分配

对 Agent 工程的直接影响

  • 重要约束必须可检索和可重申
  • 长上下文容量不代表等权记忆
  • 提示顺序与信息噪声需要评测

输出是逐 Token 的条件生成

每一步都依赖已有输入和已生成内容

  • 局部概率最优不保证全局正确
  • 早期错误会进入后续上下文
  • 流畅与自洽可以伴随事实错误

解码策略改变分布而非知识

  • Temperature
  • Top-P 与 Top-K
  • 贪心、采样与重复运行方差

能力来自训练分布、后训练与推理资源

预训练建立通用模式

  • 语言、代码与世界知识的统计压缩
  • 不是可追溯原文库
  • 知识存在时效、稀疏和冲突

后训练塑造可用行为

  • 指令遵循
  • 偏好与安全对齐
  • 工具调用和结构化输出习惯

推理时能力仍受条件约束

  • Prompt 与上下文质量
  • 推理预算
  • 工具和外部事实源

把“推理”理解为可验证行为

  • 模型可生成计划、分解和中间结论
  • 中间步骤可能不忠实或错误
  • 私有思维链不是系统审计证据
  • 应外显计划、引用、工具结果和可检查产物

幻觉不是一个单点 Bug

知识侧

  • 训练中缺失或过时
  • 相近概念混合
  • 来源不可追溯

上下文侧

  • 检索错误
  • 指令与数据冲突
  • Lost-in-the-Middle 与污染

生成侧

  • 概率补全填补未知
  • 长链错误累积
  • 过度服从错误前提

生产 Agent 必须外置的职责

  • 事实权威源与 Grounding
  • 业务规则、Schema 和运行时验证
  • 身份、权限、事务与持久状态
  • 评测、Trace、审批和事故恢复