- 核心问题
- 行动后的结果如何逐步进入价值学习、深度表示、偏好后训练与 Agent 系统?
- 策展边界
- 这是一条经过审核的教学路径,不是唯一、完整或已被证明的历史因果链。它只突出反馈信号如何被不同系统复用;未选事件仍属于完整历史。Samuel 节点表示搜索、评估函数与经验更新的早期组合,不把 1959 年工作倒推为后来才形成的完整强化学习范式。
第 1 / 6 步
Samuel Checkers:经验开始改变后续选择
- 继承了什么
- 继承博弈树搜索和人工设计的局面表示。
- 解决了什么
- 让运行经验更新评估函数,从而改变后续搜索倾向。
- 仍缺什么
- 尚未形成后来强化学习的统一问题设定,也没有深度表示或通用收敛结果。
第 2 / 6 步
Q-learning:用结果反馈更新动作价值
- 继承了什么
- 继承状态、动作和累计结果的序贯决策问题。
- 解决了什么
- 给出增量动作价值更新,并在论文条件下建立收敛结果,不要求每一步提供目标动作。
- 仍缺什么
- 表格或离散表示难以直接处理高维像素;有限样本和函数逼近也不由该定理自动保证。
第 3 / 6 步
DQN:深度表示接入价值学习
- 继承了什么
- 继承 Q-learning 的动作价值目标与 CNN 的视觉表示。
- 解决了什么
- 用深度网络和经验回放从 Atari 像素输入学习多个游戏的控制策略。
- 仍缺什么
- 游戏基准中的结果不等于现实世界可靠控制,也没有消除探索、稳定性和泛化问题。
第 4 / 6 步
AlphaGo:学习与搜索重新组合
- 继承了什么
- 继承监督学习、强化学习、策略与价值网络,以及经典树搜索。
- 解决了什么
- 让学习到的评估与 Monte Carlo 树搜索协同处理围棋的巨大行动空间。
- 仍缺什么
- 不能归结为强化学习取代搜索,也不能从围棋表现推出通用智能。
第 5 / 6 步
InstructGPT:偏好信号进入语言模型后训练
- 继承了什么
- 继承预训练语言模型、监督示范、候选排序和策略优化方法。
- 解决了什么
- 在研究的任务与评测分布中,用奖励模型和 PPO 让输出更符合标注协议下的偏好。
- 仍缺什么
- 偏好不是普遍真理,受偏好不保证事实正确或完整安全,偏好优化也不只存在这一条路线。
第 6 / 6 步
Agent / Safety:运行时反馈不等于训练更新
- 继承了什么
- 继承语言模型、工具调用与 observation 驱动的计划修正循环。
- 解决了什么
- 让外部回执改变当前任务的下一步,并通过权限、停止条件与评估约束行动。
- 仍缺什么
- 一次运行中的重试不能证明权重在线更新;可靠性仍需要明确训练管线与持续安全评估。
- 核心问题
- 当搜索、规则、不确定性建模和手工特征各自遇到限制时,AI 如何逐步转向数据驱动与可学习表示?
- 策展边界
- 这是一条展示问题表示方式如何变化与重组的策展路径,不是规则被概率方法、经典机器学习再被深度学习逐步替代的单线历史。各条路线长期交叠;ImageNet 与 AlexNet 节点只突出共同数据、评测和算力如何与既有卷积机制组合。未选事件仍属于完整历史。
第 1 / 7 步
A*:用代价与启发信息组织搜索
- 继承了什么
- 继承把路径问题表示成图、状态与可比较代价的做法。
- 解决了什么
- 在明确条件下,让已走路径代价与领域启发估计共同决定节点展开顺序。
- 仍缺什么
- 启发信息仍由设计者提供;它没有从数据中学习特征,也不会自动表达不确定性。
第 2 / 7 步
MYCIN:把领域知识写成可解释规则
- 继承了什么
- 继承显式知识表示、规则匹配与受限问题求解。
- 解决了什么
- 用规则、置信因子和解释机制处理受限的感染诊疗咨询问题。
- 仍缺什么
- 强表现依赖窄领域知识,知识获取、例外维护与责任边界仍是瓶颈。
第 3 / 7 步
Bayesian network:把不确定依赖组织成图
- 继承了什么
- 继承结构化知识表示与根据证据更新判断的问题。
- 解决了什么
- 用有向图表达条件依赖,并把证据传播与概率推理放进同一框架。
- 仍缺什么
- 图结构与变量仍需要建模;它没有直接解决从高维原始输入学习任务特征。
第 4 / 7 步
SVM:从样本学习最大间隔边界
- 继承了什么
- 继承带标签样本、特征表示与优化目标构成的分类问题。
- 解决了什么
- 把输入映射到高维特征空间,并由支持向量确定最大间隔分类边界。
- 仍缺什么
- 学到分类边界不等于自动得到适合所有任务的多层表示或完整感知系统。
第 5 / 7 步
LeNet:卷积表示进入文档识别流程
- 继承了什么
- 继承多层网络训练,并复用局部连接和参数共享。
- 解决了什么
- 把卷积网络与全局训练用于手写字符和支票读取等真实工程流程。
- 仍缺什么
- 一个受限文档任务的成功没有证明同一规模的数据与计算能覆盖广泛视觉问题。
第 6 / 7 步
ImageNet:共同数据让视觉进步可比较
- 继承了什么
- 继承对象识别对带标签样本、类别组织和共同评测的需求。
- 解决了什么
- 用 WordNet 层级组织大规模图像,为训练与可比较评测提供共同基础。
- 仍缺什么
- 数据集本身不选择模型或完成训练,标签层级也限定了它能测量的问题。
第 7 / 7 步
AlexNet:算法、数据与 GPU 规模同时组合
- 继承了什么
- 继承深层卷积网络、ImageNet 任务与并行计算条件。
- 解决了什么
- 在约 120 万张训练图像上用高效 GPU 实现深层 CNN,并显著降低 ImageNet 错误率。
- 仍缺什么
- 视觉基准突破不表示规则、概率推理或经典搜索已经失效,也不等于通用视觉已经解决。
- 核心问题
- 规模化语言模型进入具体应用时,为什么还可能需要外部知识、后训练、行动循环和持续风险评估?
- 策展边界
- 这是一条经过审核的系统边界路径,不是所有应用都必须经过的流水线,也不是已被证明的单线因果史。各节点解决不同问题,可以被组合、替换或省略;RAG 不会因此更新模型权重,偏好后训练不保证事实与安全,运行时 observation 也不等于训练更新。未选事件仍属于完整历史。
第 1 / 7 步
Transformer:并行 Attention 提供可扩展主干
- 继承了什么
- 继承神经序列转换与从数据学习 token 表示的问题。
- 解决了什么
- 用 attention 取代循环与卷积主干,让 token 直接连接并提高训练并行性。
- 仍缺什么
- 一种架构本身没有决定训练规模,也没有自动提供最新知识、可靠行动或风险治理。
第 2 / 7 步
Scaling Laws:把规模化变成可测量方向
- 继承了什么
- 继承语言模型预测损失,以及模型、数据和计算规模的工程选择。
- 解决了什么
- 在研究范围内量化交叉熵损失与模型规模、数据规模和训练计算量的幂律关系。
- 仍缺什么
- 更低训练损失本身不等于更可靠、更安全或更符合具体用户意图。
第 3 / 7 步
GPT-3:任务适应进入文本上下文
- 继承了什么
- 继承大规模预训练语言模型和自然语言生成接口。
- 解决了什么
- 让模型在不更新权重时,根据提示中的说明和少量示例完成多类任务。
- 仍缺什么
- 上下文内适应不保证知识最新、答案可核验,也不赋予模型外部行动能力。
第 4 / 7 步
RAG:把可检索知识接入生成上下文
- 继承了什么
- 继承预训练生成模型、神经检索器与外部文档索引。
- 解决了什么
- 把参数记忆、可更新外部知识与生成过程拆成可组合的系统部件。
- 仍缺什么
- 检索段落只进入当前上下文,不会更新模型权重,也不能保证最终回答正确。
第 5 / 7 步
InstructGPT:用示范与偏好塑造助手行为
- 继承了什么
- 继承预训练模型、监督示范、候选排序与策略优化。
- 解决了什么
- 在研究任务、标注协议与评测分布内,让输出更符合标注者偏好。
- 仍缺什么
- 偏好不是普遍真理,受偏好不保证事实或完整安全,后训练也不只有这一条路线。
第 6 / 7 步
ReAct:让观察结果改变下一步行动
- 继承了什么
- 继承语言模型推理、外部来源调用与计划修正。
- 解决了什么
- 交错生成推理轨迹、环境动作与观察,让系统根据回执更新当前计划。
- 仍缺什么
- 一次运行中的 observation 不等于权重更新;工具错误、权限和停止条件仍需系统约束。
第 7 / 7 步
NIST GenAI Profile:把风险证据变成持续过程
- 继承了什么
- 继承 AI RMF 的生命周期风险管理框架。
- 解决了什么
- 把红队、事件记录、持续评估与风险处置映射到生成式 AI 风险管理。
- 仍缺什么
- 治理指南不是模型能力,也不能保证组织已经落实控制或让风险永久消失。