|
所在平台: Udemy |
课程主页: https://www.udemy.com/course/ittensive-python-reinforcement-learning/
课程评论:没有评论
**课程名称:Python强化学习** **课程概述:** 本课程是ITtensive机器学习项目中的最后一门课程,旨在教授如何使用Python进行强化学习。课程将涵盖3个主要实践项目,并深入讲解强化学习的理论基础。 **主要实践项目:** 1. **井字棋对弈:** * 构建3x3井字棋游戏环境。 * 实现获胜条件。 * 训练简单的代理(玩家),使其能够将游戏导向平局。 * 通过基础策略介绍Bellman方程、Q-learning 和 追随学习。 * 比较不同策略(包括epsilon-greedy和优化epsilon-greedy)在玩家间对弈的效率。 * **项目:** 开发自有的井字棋获胜代理。 2. **平衡小车(CartPole):** * 使用CartPole AI Gym环境。 * 学习如何根据传感器数据平衡小车。 * 介绍深度Q网络(DQN)的构建原理。 * 使用DQN加速和稳定学习过程。 * 比较不同学习方式的代理:随机过程、学习环境状态分布(先验/后验概率)、模拟短期/长期记忆。 * 讨论学习和优化全连接神经网络的问题。 * **项目:** 开发优化的DQN来平衡小车。 3. **二十一点(Blackjack):** * 使用AI Gym环境计算二十一点的最佳出牌策略。 * 应用蒙特卡洛方法,包括单次/多次试验、整存整取/分期付款策略以及探索起点优化。 * 通过状态空间中的等值面可视化代理的最佳行为策略。 * **项目:** 计算最优二十一点博弈策略。 **课程理论内容:** * 机器学习与强化学习的任务 * 强化学习的评估指标 * 开发与探索的平衡问题 * 马尔可夫决策过程 * Bellman原理与方程 * 蒙特卡洛方法 * Q-表和Q-learning * Epsilon-greedy策略 * 衰减Epsilon-greedy策略 * UCB策略 * Thompson采样策略 * 深度Q网络的构建与训练 * 短期与长期记忆 * 整存整取策略与分期付款策略
Внимание: для доступа к курсам ITtensive на Udemy напишите, пожалуйста, на support@ittensive.com с названием курса или группы курсов, которые хотите пройти.Это завершающий курс программы Машинное обучение от ITtensive., В этом курсе мы разберем 3 задачи обучения с подкреплением:1. Игра в крестики-нолики на доске 3x3. Запрограммируем среду, условия выигрыша и обучим простых и не очень агентов (игроков) сводить игру к ничье. На примере базовых стратегий рассмотрим работу уравнения Беллмана, Q-обучения и обучения с преследованием.Используя различные стратегии, включая эпсилон жадные и оптимизированные эпсилон жадные, сравним их эффективность при игре друг с другом.Проект: разработка собственного выигрышного агента для игры в крестики-нолики.2. Задача балансировка тележки в физическом окружении. Используем CartPole AI Gym и научимся балансировать тележку в зависимости от данных сенсоров. Изучим принципы построения нейросети обучения с подкреплением (DQN = Deep Q-Network) и используем ее для ускорения и стабилизации процесса обучения.Сравним обучение агента на случайных процессах, на изучении распределения состояний среды (априорные и постериорные вероятности), на эмуляции кратковременной и долговременной памяти агента, разберем проблемы обучения и оптимизации полносвязной нейросети.Проект: разработка оптимизированной DQN для балансировки тележки.3. Игра в блекджек (21 очко). Используем окружение AI Gym для расчета оптимальных ходов при игре в Блекджек. Используем методы Монте-Карло, включая одиночные и множественные касания, единую и разделенную политики, а также оптимизацию исследовательских стартов.Визуализируем оптимальную политику поведения агента через изоповерхности в пространстве состояний среды.Проект: расчет оптимальной стратегии игры в блекджек.Теория по курсу включает:Задачи машинного обучения и обучения с подкреплениемМетрики обучения с подкреплениемПроблема баланса эксплуатации и разведкиЦепь случайных процессов МарковаПринцип и уравнение БеллманаМетоды Монте-КарлоQ-таблица и Q-обучениеЭпсилон-жадная стратегииЭпсилон-жадная стратегия с убываниемUCB-стратегияСтратегия ТомпсонаСоздание и обучение Deep Q-NetworkКратковременная и долговременная памятьЕдиная и разделенная политики