[
Home
/
Writing
/
RL Notes
]
Chapter 7 of 7
RL Meets LLMs — PPO, GRPO & Reasoning
June 2026
●
12 min read
●
LLM Alignment & reasoning
← Previous Chapter
Policy Gradients — Optimizing the Policy Directly