Aprendizado por reforço: curso de Ciência da Computação | Zoonk
98. Aprendizado por reforço
Trabalha agentes, estados, ações, recompensas, processos de decisão de Markov e métodos baseados em valor e política. O aluno treina agentes em simulações e analisa exploração, estabilidade e segurança.