Agenten, Zustände, Aktionen, Belohnungen, Wertfunktionen und Policy-Optimierung ermöglichen Lernen durch Interaktion. Kleine Umgebungen zeigen Exploration, verzögerte Belohnung und instabiles Training.