|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/reinforcement-learning-dqn-a-sac/
课程评论:没有评论
**课程名称:** 高级强化学习:从DQN到SAC **课程概述:** 本课程是Udemy上关于高级强化学习最全面的课程。您将学习如何使用PyTorch和PyTorch Lightning在Python中实现一些最强大的深度强化学习算法。您将从零开始实现自适应算法,以解决基于经验的控制任务。您还将学习如何将这些技术与神经网络和深度学习方法相结合,以创建能够解决决策任务的自适应人工智能代理。 本课程将介绍强化学习的前沿技术,并为您学习该系列接下来的课程做准备,届时我们将探索在其他类型任务中表现出色的更高级方法。 课程侧重于实践技能的培养。因此,在学习了每个方法族最重要的概念后,我们将从头开始在Jupyter Notebook中实现一种或多种算法。 **课程模块:** * **基础回顾:** * 马尔可夫决策过程 (MDP) * Q-Learning * 神经网络简介 * 深度Q-Learning * 策略梯度方法 * **深度强化学习:** * PyTorch Lightning * 使用Optuna进行超参数调整 * 连续动作空间的深度Q-Learning (标准化优势函数-NAF) * 深度确定性策略梯度 (DDPG) * Twin Delayed DDPG (TD3) * 软 Actor-Critic (SAC) * 带视角的经验回放 (HER)
Este es el curso más completo de Aprendizaje por Reforzamiento Avanzado en Udemy. En él, aprenderás a implementar algunos de los algoritmos de Deep Reinforcement Learning más potentes en Python utilizando PyTorch y PyTorch Lightning. Implementarás desde cero algoritmos adaptativos que resuelven tareas de control basadas en la experiencia. Aprenderás a combinar estas técnicas con Redes Neuronales y métodos de Aprendizaje Profundo para crear agentes de Inteligencia Artificial adaptativos capaces de resolver tareas de toma de decisiones.Este curso te introducirá al estado del arte en técnicas de Reinforcement Learning. También te preparará para los próximos cursos de esta serie, donde exploraremos otros métodos avanzados que sobresalen en otros tipos de tareas.El curso se centra en el desarrollo de habilidades prácticas. Por lo tanto, después de aprender los conceptos más importantes de cada familia de métodos, implementaremos uno o más de sus algoritmos en cuadernos Jupyter, desde cero.Módulos de nivelación:- Repaso: El proceso de decisión de Markov (MDP).- Repaso: Q-Learning.- Repaso: Breve introducción a las Redes Neuronales.- Repaso: Deep Q-Learning.- Repaso: Métodos de gradiente de políticas.Deep Reinforcement Learning:- PyTorch Lightning.- Ajuste de hiperparámetros con Optuna.- Deep Q-Learning para espacios de acción continuos (Función de ventaja normalizada - NAF).- Deep Deterministic Policy Gradient (DDPG).- Twin Delayed DDPG (TD3).- Soft Actor-Critic (SAC).- Repetición de Experiencia con Perspectiva (HER).