Aprendizaje por refuerzo: curso de Ciencias de la Computación | Zoonk
85. Aprendizaje por refuerzo
Presenta estados, acciones, recompensas, procesos de decisión de Markov, aprendizaje por valor y métodos de política. La práctica entrena agentes en simuladores y detecta recompensas mal diseñadas.