Reinforcement Learning Avanzado: Política Gradiente

所在平台: Udemy

课程主页: https://www.udemy.com/course/reinforcement-learning-politica-gradiente/

课程评论:没有评论

第一个写评论        关注课程

课程简介

**课程名称:** 高级强化学习:策略梯度 **课程概述:** 本课程是 Udemy 上最全面的强化学习系列课程之一。您将学习如何使用 Python、PyTorch 和 PyTorch Lightning 实现一些最强大的深度强化学习算法。您将从头开始实现解决基于经验的控制任务的自适应算法。您将学习如何将这些技术与神经网络和深度学习方法相结合,以创建能够解决决策任务的自适应人工智能代理。 本课程将介绍强化学习领域的最新技术,并为您准备后续课程中将要探索的其他类型的先进方法。 课程的重点是培养实践技能。因此,在学习每个方法族的要点后,我们将从头开始在 Jupyter 笔记本中实现一种或多种算法。 **基础模块:** * 马尔可夫决策过程(MDP) * 蒙特卡洛方法 * 时间差分方法 * N步自举 * 神经网络简介 * 策略梯度方法 **高级强化学习内容:** * REINFORCE * REINFORCE(用于连续动作空间) * 优势 Actor-Critic (A2C) * 信任区域方法 * Proximal Policy Optimization (PPO) * Generalized Advantage Estimation (GAE) * Trust Region Policy Optimization (TRPO)

课程评论(0条)

课程详情

Esta es la serie de cursos más completa sobre Reinforcement Learning en Udemy. En ella, aprenderás a implementar algunos de los algoritmos de Deep Reinforcement Learning más poderosos en Python utilizando PyTorch y PyTorch Lightning. Implementarás desde cero algoritmos adaptativos que resuelven tareas de control basadas en la experiencia. Aprenderás a combinar estas técnicas con Redes Neuronales y métodos de Aprendizaje Profundo para crear agentes de Inteligencia Artificial adaptativos capaces de resolver tareas de toma de decisiones.Este curso te introducirá al estado del arte en técnicas de Reinforcement Learning. También te preparará para los cursos siguientes en esta serie, donde exploraremos otros métodos avanzados que destacan en otros tipos de tareas.El enfoque del curso está en desarrollar habilidades prácticas. Por lo tanto, después de aprender los conceptos más importantes de cada familia de métodos, implementaremos uno o más de sus algoritmos en cuadernos de Jupyter, desde cero.Módulos de nivelación:- Actualización: El proceso de decisión de Markov (MDP).- Actualización: Métodos de Monte Carlo.- Actualización: Métodos de diferencia temporal.- Actualización: Bootstrap de N pasos.- Actualización: Breve introducción a las Redes Neuronales.- Actualización: Métodos de política gradiente.Aprendizaje por Reforzamiento Avanzado:- REINFORCE- REINFORCE para espacios de acción continuos- Actor-crítico de ventaja (A2C)- Métodos de región de confianza- Optimización de política de proximal (PPO)- Estimación de ventaja generalizada (GAE)- Optimización de política de región de confianza (TRPO)

课程标签

0人关注该课程

主题相关的课程