[
Home
/
Writing
/
RL Notes
]
Chapter 6 of 7
Policy Gradients — Optimizing the Policy Directly
June 2026
●
18 min read
●
Policy Optimization
← Previous Chapter
Learning from Experience — MC, TD & Control
Next Chapter →
RL Meets LLMs — PPO, GRPO & Reasoning