Demo 06

强化学习与反馈闭环:结果如何改变未来策略?

当系统无法为每一步拿到唯一标准答案时,行动后的结果可以成为学习信号。本章用两个固定 episode 展示即时小奖励与延迟高回报如何影响下一次策略,并明确区分训练更新与 Agent 在一次运行中根据 observation 改计划。

教学型交互案例

反馈学习闭环实验

reward、偏好比较和运行时 observation 分别在什么时候改变什么?

训练时 / 运行时边界 结果反馈进入明确的更新阶段

episode 结束后比较 return,再由训练流程改变示意策略;本案例不实现具体算法。

步骤 1 / 6

读取状态与初始示意策略

起点有左、右两个动作。初始策略固定显示左侧 70%、右侧 30%;这些数值不是现场采样结果。

机制边界 训练前

Policy 描述行动倾向,不会告诉环境哪一个动作在每一步都是唯一正确答案。

两个固定 episode

两条路径均为审核过的脚本,不执行随机动作采样。

Baseline · 尚未运行

左侧:即时小奖励

固定走当前更常见的左侧动作,一步结束。

动作
待运行
奖励
待运行
回报
待运行
Exploration · 尚未运行

右侧:延迟高奖励

固定探索右侧,先得到 0,再在第二步得到 +3。

动作
待运行
奖励
待运行
回报
待运行
示意策略

初始示意策略

左侧 70%,右侧 30%;数值固定,不进行随机采样。

训练时 / 运行时边界

结果反馈进入明确的更新阶段

模型权重
训练边界:参数可以更新
下一步动作
更新后的策略影响后续 episode

这是什么类型的反馈?

同一个“反馈”词语可能指向作用阶段完全不同的信号。

信号输入作用时机改变什么边界
Target label输入对应的目标输出训练时直接描述期望答案并用于更新参数不等于环境中的长期行动结果
Reward / return动作后的结果与序列累计回报训练时改变价值估计或策略倾向不保证逐步给出唯一正确动作
Preference comparison特定标注协议下的候选比较或排序训练时可进入奖励模型加 RL,也可进入其他直接偏好目标不是普遍真理,也不等于单一 RLHF 流程
Runtime observation当前工具回执或环境新状态运行时改变当前任务的下一步行动不自动成为训练样本或权重更新
学习目标
  • 区分目标标签、reward / return、偏好比较与运行时 observation。
  • 理解策略只在明确的训练边界中更新,普通 Agent 运行不会自动修改模型权重。
  • 观察延迟 reward 为什么需要比较完整 episode 的结果,而不是寻找每一步唯一正确动作。
简化说明

本案例是固定的两条路径和两次训练 episode,不做随机采样,也不运行真实优化器。概率与 reward 只用于解释结果反馈如何改变后续策略,不代表真实机器人、游戏或通用决策任务。强化学习是一类问题设定与方法族,不等于单一算法;RLHF 也不等于全部后训练或完整 alignment。

历史位置与证据边界

反馈可以塑造未来策略,但不是所有反馈都会更新权重

强化学习是一类问题设定与方法族,不等于某个单一算法。Q-learning 给出了在文中条件下学习最优动作价值的更新规则;DQN 把深度网络、经验回放与 Q-learning 用于 Atari;AlphaGo 同时组合监督学习、强化学习、策略网络、价值网络与树搜索。语言模型的偏好比较既可进入 InstructGPT 所用的奖励模型与 PPO 流程,也可进入 DPO 这样的直接偏好目标。人类偏好受任务、标注协议和样本分布限制,而运行时 observation 改变当前任务下一步,本身不能证明模型权重已在线更新。

参考资料

Concept Check

用一个问题检验核心直觉

自测只帮助你检查理解,不影响继续学习。记录仅保存在本设备。

Agent 调用工具失败后,根据错误回执修改参数并重试。这一事实本身说明了什么?