Demo 08
基础模型生命周期:预测 token 如何变成按指令协作?
Transformer 提供了可扩展架构,但从 Base Model 到可协作的 Assistant Model 还要经过数据、目标和后训练选择。这个章节重点解释哪些阶段会更新权重,以及哪些信息只影响当前一次推理。
教学型交互案例
基础模型生命周期实验
预训练、指令微调、偏好反馈和运行时上下文分别改变了什么?
权重可更新 权重保持不变
1 / 6
预训练把大规模语料变成预测任务
模型反复根据前文预测后续 token。规模化数据与计算可以降低训练损失,但语料不是逐条核验的事实库。
预测目标提供广泛语言模式,不直接定义“怎样才是对用户最有帮助的回答”。
给定:人工智能的发展…… → 预测下一个 token
学习目标
- 区分预训练获得的通用模式与后训练塑造的交互行为。
- 理解指令数据和偏好比较会更新权重,而运行时上下文只影响当前生成。
- 知道更会按指令协作不等于拥有实时知识、权限或可靠性保证。
简化说明
本案例用一条历史上重要的后训练路径解释职责边界,不运行真实训练、标注、奖励模型或推理。不同模型会使用不同数据、目标和优化方法;偏好反馈也不保证事实正确、安全或完全符合用户意图。
历史位置与边界
从可扩展架构到可协作模型,再进入完整系统
预训练从大规模语料学习条件生成模式;指令微调与偏好反馈继续更新权重并塑造行为。运行时上下文则只参与当前推理,不会现场重训模型。后训练改善指令跟随,但不会自动提供实时知识、外部权限、事实正确性或完整安全保证,因此下一章仍需要把模型放进检索、工具、记忆和评估组成的系统。
参考资料
Concept Check
用一个问题检验核心直觉
自测只帮助你检查理解,不影响继续学习。记录仅保存在本设备。