共 6 步
从经验更新到反馈闭环
行动后的结果如何逐步进入价值学习、深度表示、偏好后训练与 Agent 系统?
推荐学习顺序
用一张学习地图串起规则、统计学习、深度学习、RAG 与 Agent 的演化主线。
Demo 01搜索树 / A*切换 BFS、DFS、A*,观察搜索策略如何影响 frontier。
Demo 02专家系统规则推理选择条件并加入例外,观察 if-then 规则如何产生冲突。
Demo 03贝叶斯更新拖动先验与证据强度,看信念如何被证据更新。
Demo 04决策边界比较线性、非线性、过拟合边界,理解数据驱动学习。
Demo 05CNN 卷积核选择 kernel 并推进窗口,观察 feature map 如何生成。
Demo 06强化学习与反馈闭环比较即时与延迟奖励,区分训练更新和运行时 observation。
Demo 07注意力机制点击 token,比较 Attention 直接连接和 RNN 链式传递。
Demo 08基础模型生命周期逐步区分预训练、指令微调、偏好反馈与运行时上下文分别改变什么。
Demo 09LLM 系统地图理解上下文、检索、工具、记忆和评估为什么围绕大模型出现。
Demo 10RAG Pipeline观察问题如何经过 embedding、检索、重排、prompt、LLM 和引用答案。
Demo 11Agent Loop执行 plan、tool call、observation、revise、final answer 的循环。
Demo 12Safety / Eval对比正常与风险请求,把失败固化为回归测试并经过发布门。
延伸探索