Demo 08

基础模型生命周期:预测 token 如何变成按指令协作?

Transformer 提供了可扩展架构,但从 Base Model 到可协作的 Assistant Model 还要经过数据、目标和后训练选择。这个章节重点解释哪些阶段会更新权重,以及哪些信息只影响当前一次推理。

教学型交互案例

基础模型生命周期实验

预训练、指令微调、偏好反馈和运行时上下文分别改变了什么?

权重可更新 权重保持不变
1 / 6

预训练把大规模语料变成预测任务

模型反复根据前文预测后续 token。规模化数据与计算可以降低训练损失,但语料不是逐条核验的事实库。

这个阶段改变什么 预训练目标

预测目标提供广泛语言模式,不直接定义“怎样才是对用户最有帮助的回答”。

脚本化输出预览 训练信号

给定:人工智能的发展…… → 预测下一个 token

学习目标
  • 区分预训练获得的通用模式与后训练塑造的交互行为。
  • 理解指令数据和偏好比较会更新权重,而运行时上下文只影响当前生成。
  • 知道更会按指令协作不等于拥有实时知识、权限或可靠性保证。
简化说明

本案例用一条历史上重要的后训练路径解释职责边界,不运行真实训练、标注、奖励模型或推理。不同模型会使用不同数据、目标和优化方法;偏好反馈也不保证事实正确、安全或完全符合用户意图。

历史位置与边界

从可扩展架构到可协作模型,再进入完整系统

预训练从大规模语料学习条件生成模式;指令微调与偏好反馈继续更新权重并塑造行为。运行时上下文则只参与当前推理,不会现场重训模型。后训练改善指令跟随,但不会自动提供实时知识、外部权限、事实正确性或完整安全保证,因此下一章仍需要把模型放进检索、工具、记忆和评估组成的系统。

参考资料

Concept Check

用一个问题检验核心直觉

自测只帮助你检查理解,不影响继续学习。记录仅保存在本设备。

把新材料放进 Runtime Context 时,演示中什么会改变?