Candlest 的博客

Back

白葱Blur image

0 我的动机#

距离最初接触强化学习已经过了半年。2025 年的 12 月,看完李沐的 《动手学深度学习》 以后,我便马不停蹄地开始看 《动手学强化学习》 。但是,那本参考书实在是过于简略晦涩,像其他中式教材一样,并不适合初学者阅读,而是适合对相关主题已有基本了解的人用来复习。

所以,结合最近半年我接触的强化学习实践,我希望把我入门强化学习的感受和路径记录下来。不但是检验我的知识边界,同时也是未来帮助更多人入门强化学习。

当然我也不是完全面向 0 基础的人,我们假定读者已经完整学完微积分、线代、概率统计,学完李沐的 《动手学深度学习》,有基础的编码能力和计算机系统常识(因为我要尝试以 kaiwudrl、verl、rlinf 为例,在这个总结综述里面穿插 AI infra 的内容)。

1 参考资料#

站在巨人的肩膀上。

我会把我用到的所有材料,以及怎么用都尝试梳理清楚。

1.1 书籍#

1.1.1 《强化学习的数学基础》#

《强化学习的数学基础》

1.1.2 《动手学强化学习》#

见:https://hrl.boyuai.com/。

2 内容规划#

这个系列暂时规划为七篇文章:

  1. 序言:说明写作动机、读者基础和整个系列的内容范围。
  2. 从高考数学到 MDP:从马尔可夫链、马尔可夫奖励过程开始,建立后续内容使用的数学概念。
  3. 传统强化学习方法:继续讨论动态规划、蒙特卡洛方法、时序差分与传统控制算法。
  4. POMDP 与 RL4MOBA:以 Kaiwu DeepRL 为背景,介绍强化学习在游戏场景中的展开。
  5. RL4LLM:以训练 8B OneRec(Qwen2.5)为例,讨论 post-training 阶段的强化学习与 agentic 表现。
  6. Robotic RL:讨论机器人场景中的强化学习,以及我关心的 Diffusion RL 和 Flow Matching RL。
  7. Test-Time RL:讨论测试时强化学习及其可能的发展方向。

总之要完完全全写下来是不少的工作量。但是既然我对这个领域还没有祛魅,对它怀有虔诚——此刻的我相信它有改变世界的力量。

同时我也怀疑我是否有能力完整地讲这个故事讲述出来——我的高中物理老师李忱家曾经说过,「自己有一桶水,才能倒出半桶来匀给别人」。但愿我的储量足够。亦或者,我可以慢慢完善这个故事。

那么现在我们开始吧。下一篇:从高考数学到 MDP

半年的 RL 学习(零):序言
https://blog.candlest.cc/blog/ai/rl/rl-0
Author Candlest
Published at 2026年8月22日