

0 我的动机#
距离最初接触强化学习已经过了半年。2025 年的 12 月,看完李沐的 《动手学深度学习》 以后,我便马不停蹄地开始看 《动手学强化学习》 。但是,那本参考书实在是过于简略晦涩,像其他中式教材一样,并不适合初学者阅读,而是适合对相关主题已有基本了解的人用来复习。
所以,结合最近半年我接触的强化学习实践,我希望把我入门强化学习的感受和路径记录下来。不但是检验我的知识边界,同时也是未来帮助更多人入门强化学习。
当然我也不是完全面向 0 基础的人,我们假定读者已经完整学完微积分、线代、概率统计,学完李沐的 《动手学深度学习》,有基础的编码能力和计算机系统常识(因为我要尝试以 kaiwudrl、verl、rlinf 为例,在这个总结综述里面穿插 AI infra 的内容)。
1 参考资料#
站在巨人的肩膀上。
我会把我用到的所有材料,以及怎么用都尝试梳理清楚。
1.1 书籍#
1.1.1 《强化学习的数学基础》#

1.1.2 《动手学强化学习》#
2 内容规划#
这个系列暂时规划为七篇文章:
- 序言:说明写作动机、读者基础和整个系列的内容范围。
- 从高考数学到 MDP:从马尔可夫链、马尔可夫奖励过程开始,建立后续内容使用的数学概念。
- 传统强化学习方法:继续讨论动态规划、蒙特卡洛方法、时序差分与传统控制算法。
- POMDP 与 RL4MOBA:以 Kaiwu DeepRL 为背景,介绍强化学习在游戏场景中的展开。
- RL4LLM:以训练 8B OneRec(Qwen2.5)为例,讨论 post-training 阶段的强化学习与 agentic 表现。
- Robotic RL:讨论机器人场景中的强化学习,以及我关心的 Diffusion RL 和 Flow Matching RL。
- Test-Time RL:讨论测试时强化学习及其可能的发展方向。
总之要完完全全写下来是不少的工作量。但是既然我对这个领域还没有祛魅,对它怀有虔诚——此刻的我相信它有改变世界的力量。
同时我也怀疑我是否有能力完整地讲这个故事讲述出来——我的高中物理老师李忱家曾经说过,「自己有一桶水,才能倒出半桶来匀给别人」。但愿我的储量足够。亦或者,我可以慢慢完善这个故事。
那么现在我们开始吧。下一篇:从高考数学到 MDP。