Markov Decision Processes
MDP: states, actions, transition P(s′|s,a), reward R, discount γ. Policy π(s) → action. Value functions estimate expected return. RL learns policies when you don’t know P. Robot navigation and game AI use this language.
Output — idea / do / check for Markov Decision Processes. Fill those three in the viva.
Exam tip
Name the MDP tuple.