Reinforcement Learning (Обучение с подкреплением) — от базовых алгоритмов до Deep Q-Network и проектов
Подробнее
Программа курса
Тема 1. От классического ML к RL: адаптация в реальном времени Проблемы статичных данных и фиксированных распределений. Зависимость последовательных решений. Концепция обучения в процессе взаимодействия (чат-боты, рекомендательные системы, умный дом). Тема 2. Анатомия RL: Агент, Среда и Награда Ключевые термины: Agent, Environment, Reward, Action. Цикл обучения RL. Марковский процесс принятия решений. Примеры: AlphaGo, OpenAI Five, AlphaZero, Boston Dynamics, Tesla.
Тема 3. Формализация задачи и алгоритм Q-Learning Проектирование Environment (reset, step). Функция ценности и Политика. Уравнение Беллмана, Q-функции, жадная стратегия, дисконтирование. Практикум: реализация QLearningAgent. Тема 4. Продвинутые алгоритмы: Policy Gradient и Actor-Critic Policy Gradient: прямая оптимизация политики. Actor-Critic: объединение подходов, TD-ошибка. Критерии выбора алгоритма. Практикум: реализация PolicyGradientAgent и ActorCriticAgent.
Тема 5. RL для работы с текстами RL в машинном переводе: фокус на связности текста. Адаптация повествования в играх. Оптимизация диалоговых систем. Тема 6. RLHF: Обучение с подкреплением на основе отзывов людей Пайплайн RLHF: предобучение, сбор оценок, Reward Model, дообучение. PPO (Proximal Policy Optimization). Проблемы: предвзятость, галлюцинации, субъективность.
Тема 7. Практикум: Разработка среды и политик Восстановление пропущенных элементов Environment. Усложнение логики среды. Модификация класса Policy: стратегия выбора действий. Тема 8. Разбор кейса: Создание адаптивной системы генерации ответов Интеграция LLaMA с Q-Learning и принципами RLHF. Генерация ответов разного уровня сложности. Использование Q-таблицы для выбора оптимального стиля. Адаптация под предпочтения пользователя в реальном времени.
01Раздел 1
Тема 1. От классического ML к RL: адаптация в реальном времени Проблемы статичных данных и фиксированных распределений. Зависимость последовательных решений. Концепция обучения в процессе взаимодействия (чат-боты, рекомендательные системы, умный дом). Тема 2. Анатомия RL: Агент, Среда и Награда Ключевые термины: Agent, Environment, Reward, Action. Цикл обучения RL. Марковский процесс принятия решений. Примеры: AlphaGo, OpenAI Five, AlphaZero, Boston Dynamics, Tesla.
02Раздел 2
Тема 3. Формализация задачи и алгоритм Q-Learning Проектирование Environment (reset, step). Функция ценности и Политика. Уравнение Беллмана, Q-функции, жадная стратегия, дисконтирование. Практикум: реализация QLearningAgent. Тема 4. Продвинутые алгоритмы: Policy Gradient и Actor-Critic Policy Gradient: прямая оптимизация политики. Actor-Critic: объединение подходов, TD-ошибка. Критерии выбора алгоритма. Практикум: реализация PolicyGradientAgent и ActorCriticAgent.
03Раздел 3
Тема 5. RL для работы с текстами RL в машинном переводе: фокус на связности текста. Адаптация повествования в играх. Оптимизация диалоговых систем. Тема 6. RLHF: Обучение с подкреплением на основе отзывов людей Пайплайн RLHF: предобучение, сбор оценок, Reward Model, дообучение. PPO (Proximal Policy Optimization). Проблемы: предвзятость, галлюцинации, субъективность.
04Раздел 4
Тема 7. Практикум: Разработка среды и политик Восстановление пропущенных элементов Environment. Усложнение логики среды. Модификация класса Policy: стратегия выбора действий. Тема 8. Разбор кейса: Создание адаптивной системы генерации ответов Интеграция LLaMA с Q-Learning и принципами RLHF. Генерация ответов разного уровня сложности. Использование Q-таблицы для выбора оптимального стиля. Адаптация под предпочтения пользователя в реальном времени.
Удостоверение повышения квалификации Академия АйТи
Отзывы о курсе
Оставьте отзыв
Расскажите о качестве обучения, поддержке и результате. Это поможет другим выбрать организацию осознанно.
Оставьте заявку
Консультант ответит на вопросы о курсе «Reinforcement Learning (Обучение с подкреплением) — от базовых алгоритмов до Deep Q-Network и проектов» и поможет разобраться в деталях обучения.
Нажимая кнопку, вы даете согласие на обработку персональных данных
Информация обновлена 28 сентября 2026 г.

Академия АйТи 



















![Deep Learning (семестр 2, осень 2025) [АРХИВ]](https://cdn.stepik.net/media/cache/images/courses/251729/cover_uYd5Nmu/57394f3a8960d94e010ee67b55750d62.jpg)
