MANIFOLDMATHEMATICS

Course · PhD & beyond · 117 pp

Reinforcement Learning

From the Bellman Equation to Language Models

← All titles

Your browser will not display a PDF inline.

Open Reinforcement Learning in a new tab

Read-only for now. A complete course in sequential decision making: dynamic programming, temporal-difference learning, policy gradients, deep RL, offline methods, and policy optimisation for large language models.