左侧:即时小奖励
固定走当前更常见的左侧动作,一步结束。
- 动作
- 待运行
- 奖励
- 待运行
- 回报
- 待运行
Demo 06
当系统无法为每一步拿到唯一标准答案时,行动后的结果可以成为学习信号。本章用两个固定 episode 展示即时小奖励与延迟高回报如何影响下一次策略,并明确区分训练更新与 Agent 在一次运行中根据 observation 改计划。
教学型交互案例
reward、偏好比较和运行时 observation 分别在什么时候改变什么?
起点有左、右两个动作。初始策略固定显示左侧 70%、右侧 30%;这些数值不是现场采样结果。
Policy 描述行动倾向,不会告诉环境哪一个动作在每一步都是唯一正确答案。
两条路径均为审核过的脚本,不执行随机动作采样。
固定走当前更常见的左侧动作,一步结束。
固定探索右侧,先得到 0,再在第二步得到 +3。
左侧 70%,右侧 30%;数值固定,不进行随机采样。
同一个“反馈”词语可能指向作用阶段完全不同的信号。
| 信号 | 输入 | 作用时机 | 改变什么 | 边界 |
|---|---|---|---|---|
| Target label | 输入对应的目标输出 | 训练时 | 直接描述期望答案并用于更新参数 | 不等于环境中的长期行动结果 |
| Reward / return | 动作后的结果与序列累计回报 | 训练时 | 改变价值估计或策略倾向 | 不保证逐步给出唯一正确动作 |
| Preference comparison | 特定标注协议下的候选比较或排序 | 训练时 | 可进入奖励模型加 RL,也可进入其他直接偏好目标 | 不是普遍真理,也不等于单一 RLHF 流程 |
| Runtime observation | 当前工具回执或环境新状态 | 运行时 | 改变当前任务的下一步行动 | 不自动成为训练样本或权重更新 |
本案例是固定的两条路径和两次训练 episode,不做随机采样,也不运行真实优化器。概率与 reward 只用于解释结果反馈如何改变后续策略,不代表真实机器人、游戏或通用决策任务。强化学习是一类问题设定与方法族,不等于单一算法;RLHF 也不等于全部后训练或完整 alignment。
历史位置与证据边界
强化学习是一类问题设定与方法族,不等于某个单一算法。Q-learning 给出了在文中条件下学习最优动作价值的更新规则;DQN 把深度网络、经验回放与 Q-learning 用于 Atari;AlphaGo 同时组合监督学习、强化学习、策略网络、价值网络与树搜索。语言模型的偏好比较既可进入 InstructGPT 所用的奖励模型与 PPO 流程,也可进入 DPO 这样的直接偏好目标。人类偏好受任务、标注协议和样本分布限制,而运行时 observation 改变当前任务下一步,本身不能证明模型权重已在线更新。
参考资料
Concept Check
自测只帮助你检查理解,不影响继续学习。记录仅保存在本设备。