Машинное обучение с подкреплением: обычное и глубокое
Как устроено обучение
Подробнее
Что нужно для старта
- Вузовская программа по математическому анализу, теории вероятностей, дискретной математике
- Базовые знания в области машинного обучения
- Понимание кода на языке Python
Что вы получите
- Понимать основные концепции обучения с подкреплением (RL) и глубокого обучения с подкреплением (DRL).
- Применять базовые и продвинутые алгоритмы RL для решения реальных задач.
- Визуализировать и адаптировать алгоритмы RL.
- Разрабатывать и оптимизировать модели RL с использованием нейронных сетей.
- Использовать инструменты Pytorch и Ray для реализации и тестирования RL-алгоритмов.
Для кого этот курс
- Data Engineer
- ML Engineer
- Разработчик
Программа курса
• Обзор основных концепций
• Интегралы
• Производные
• Примеры
• Случайные величины
• Функции плотности вероятности
• Математическое ожидание
• Условные, совместные и безусловные вероятности
• Примеры. Практика
• Марковские процессы принятия решений
• Динамическое программирование с примером
• Уравнение Беллмана
• Оценка стратегии
• Итерация по стратегиям
• Итерация по ценностям
• Примеры
• Практика
• Обучение и планирование
• Детерминированное
• Стохастическое
• Аппроксимация линейной функции-значения
• Сравнение и практика
• Q-обучение
• SARSA
• Методы Исполнитель-критик
• Градиент стратегии
• Методы дерева Монте-Карло
• Обучение и исполнение
• Примеры
• Практика
• Аппроксимация нелинейной функции
• Прорыв DeepMind
• Объяснение Alpha-Star
• Память, внимание, рекурсия
• Обратное RL
• Обучение нескольких агентов
• Иерархическое обучение
• Развитие поощрений – AutoRL
• Оптимизации стратегий
• Трейдинг
• Понимание речи и вопросно-ответные системы (опционально)
• Балансировка нагрузки (опционально)
• Другие применения (опционально)
• Основы тензорного исчисления
• Реализация алгоритма RL с нуля
• Тестирование и визуализация
• Практика
• Основные понятия: исполнители, модели будущего, совместное использование памяти и т.д.
• Пример с решением
• Различные алгоритмы
• Сеточный поиск и визуализация
• Практика
• SMDP, AMDP, SAMDP
• Проекция на 3D-пространство с помощью TSNE
• Примеры
01Часть I. Предыстория
• Обзор основных концепций
• Интегралы
• Производные
• Примеры
• Случайные величины
• Функции плотности вероятности
• Математическое ожидание
• Условные, совместные и безусловные вероятности
• Примеры. Практика
02Часть II. Обзор
• Марковские процессы принятия решений
• Динамическое программирование с примером
• Уравнение Беллмана
• Оценка стратегии
• Итерация по стратегиям
• Итерация по ценностям
• Примеры
• Практика
• Обучение и планирование
• Детерминированное
• Стохастическое
• Аппроксимация линейной функции-значения
• Сравнение и практика
• Q-обучение
• SARSA
• Методы Исполнитель-критик
• Градиент стратегии
• Методы дерева Монте-Карло
• Обучение и исполнение
• Примеры
• Практика
03Часть III. RL + глубокое обучение
• Аппроксимация нелинейной функции
• Прорыв DeepMind
• Объяснение Alpha-Star
• Память, внимание, рекурсия
• Обратное RL
• Обучение нескольких агентов
• Иерархическое обучение
• Развитие поощрений – AutoRL
• Оптимизации стратегий
• Трейдинг
• Понимание речи и вопросно-ответные системы (опционально)
• Балансировка нагрузки (опционально)
• Другие применения (опционально)
04Часть IV. Практические примеры и инструменты
• Основы тензорного исчисления
• Реализация алгоритма RL с нуля
• Тестирование и визуализация
• Практика
• Основные понятия: исполнители, модели будущего, совместное использование памяти и т.д.
• Пример с решением
• Различные алгоритмы
• Сеточный поиск и визуализация
• Практика
• SMDP, AMDP, SAMDP
• Проекция на 3D-пространство с помощью TSNE
• Примеры
Удостоверение о прохождении
Отзывы о курсе
Оставьте отзыв
Расскажите о качестве обучения, поддержке и результате. Это поможет другим выбрать организацию осознанно.
Оставьте заявку
Консультант ответит на вопросы о курсе «Машинное обучение с подкреплением: обычное и глубокое» и поможет разобраться в деталях обучения.
Нажимая кнопку, вы даете согласие на обработку персональных данных
Информация обновлена 7 сентября 2026 г.

IBS Training Center 













![[АРХИВ] Deep Learning (семестр 1, осень 2023)](https://cdn.stepik.net/media/cache/images/courses/181974/cover_bq8Ten0/442ca96b71e76542dff55bbbc4aca303.png)

![[АРХИВ] Deep Learning (семестр 1, весна 2025)](https://cdn.stepik.net/media/cache/images/courses/230362/cover_4tkfoRj/492fc6dc0234358ce905da4c4ca71bd6.jpg)
![[АРХИВ] Deep Learning (семестр 1, весна 2023): продвинутый поток](https://cdn.stepik.net/media/cache/images/courses/135003/cover_2zXJL9O/db54e2933429a4cc0c45c3035311ac6f.jpg)
![[АРХИВ] Deep Learning (семестр 2, осень 2024)](https://cdn.stepik.net/media/cache/images/courses/196142/cover_dLZWnQI/f5772a02869d297a8c6632f8c7d74b55.jpg)

