Мы используем cookie для стабильной работы сервиса. Подробнее

Reinforcement Learning (Обучение с подкреплением) — от базовых алгоритмов до Deep Q-Network и проектов

ФорматОнлайн
Длительность16 ак.часов
Объём4 занятий
По окончанииУдостоверение повышения квалификации Академия АйТи
О курсе

Подробнее

Интенсивный курс по Reinforcement Learning: MDP, Q-Learning, Deep Q-Network (DQN), нейронные сети, Cross-Entropy метод, практические проекты в OpenAI Gym.
Содержание

Программа курса

4 занятия
№ТемаЧто внутри
01Раздел 1

Тема 1. От классического ML к RL: адаптация в реальном времени Проблемы статичных данных и фиксированных распределений. Зависимость последовательных решений. Концепция обучения в процессе взаимодействия (чат-боты, рекомендательные системы, умный дом). Тема 2. Анатомия RL: Агент, Среда и Награда Ключевые термины: Agent, Environment, Reward, Action. Цикл обучения RL. Марковский процесс принятия решений. Примеры: AlphaGo, OpenAI Five, AlphaZero, Boston Dynamics, Tesla.

02Раздел 2

Тема 3. Формализация задачи и алгоритм Q-Learning Проектирование Environment (reset, step). Функция ценности и Политика. Уравнение Беллмана, Q-функции, жадная стратегия, дисконтирование. Практикум: реализация QLearningAgent. Тема 4. Продвинутые алгоритмы: Policy Gradient и Actor-Critic Policy Gradient: прямая оптимизация политики. Actor-Critic: объединение подходов, TD-ошибка. Критерии выбора алгоритма. Практикум: реализация PolicyGradientAgent и ActorCriticAgent.

03Раздел 3

Тема 5. RL для работы с текстами RL в машинном переводе: фокус на связности текста. Адаптация повествования в играх. Оптимизация диалоговых систем. Тема 6. RLHF: Обучение с подкреплением на основе отзывов людей Пайплайн RLHF: предобучение, сбор оценок, Reward Model, дообучение. PPO (Proximal Policy Optimization). Проблемы: предвзятость, галлюцинации, субъективность.

04Раздел 4

Тема 7. Практикум: Разработка среды и политик Восстановление пропущенных элементов Environment. Усложнение логики среды. Модификация класса Policy: стратегия выбора действий. Тема 8. Разбор кейса: Создание адаптивной системы генерации ответов Интеграция LLaMA с Q-Learning и принципами RLHF. Генерация ответов разного уровня сложности. Использование Q-таблицы для выбора оптимального стиля. Адаптация под предпочтения пользователя в реальном времени.

01Раздел 1

Тема 1. От классического ML к RL: адаптация в реальном времени Проблемы статичных данных и фиксированных распределений. Зависимость последовательных решений. Концепция обучения в процессе взаимодействия (чат-боты, рекомендательные системы, умный дом). Тема 2. Анатомия RL: Агент, Среда и Награда Ключевые термины: Agent, Environment, Reward, Action. Цикл обучения RL. Марковский процесс принятия решений. Примеры: AlphaGo, OpenAI Five, AlphaZero, Boston Dynamics, Tesla.

02Раздел 2

Тема 3. Формализация задачи и алгоритм Q-Learning Проектирование Environment (reset, step). Функция ценности и Политика. Уравнение Беллмана, Q-функции, жадная стратегия, дисконтирование. Практикум: реализация QLearningAgent. Тема 4. Продвинутые алгоритмы: Policy Gradient и Actor-Critic Policy Gradient: прямая оптимизация политики. Actor-Critic: объединение подходов, TD-ошибка. Критерии выбора алгоритма. Практикум: реализация PolicyGradientAgent и ActorCriticAgent.

03Раздел 3

Тема 5. RL для работы с текстами RL в машинном переводе: фокус на связности текста. Адаптация повествования в играх. Оптимизация диалоговых систем. Тема 6. RLHF: Обучение с подкреплением на основе отзывов людей Пайплайн RLHF: предобучение, сбор оценок, Reward Model, дообучение. PPO (Proximal Policy Optimization). Проблемы: предвзятость, галлюцинации, субъективность.

04Раздел 4

Тема 7. Практикум: Разработка среды и политик Восстановление пропущенных элементов Environment. Усложнение логики среды. Модификация класса Policy: стратегия выбора действий. Тема 8. Разбор кейса: Создание адаптивной системы генерации ответов Интеграция LLaMA с Q-Learning и принципами RLHF. Генерация ответов разного уровня сложности. Использование Q-таблицы для выбора оптимального стиля. Адаптация под предпочтения пользователя в реальном времени.

Документ после выпуска

Удостоверение повышения квалификации Академия АйТи

Организатор

Автор курса

Академия АйТиАкадемия АйТи
Академия АйТи - партнер для кастомизированного проектного обучения. Оказывает услуги по развитию бизнеса и трансформации через подготовку квалифицированных кадров. Проводит масштабные образовательные проекты, профессиональную переподготовку, программы повышения квалификации, курсы по самым востребованным направлениям. Разрабатывает образовательный контент под потребности заказчика. Компания строит образовательные экосистемы, а также внедряет и развивает e-learning технологии для управления кадрами. Благодаря высокому уровню экспертизы в решениях дистанционного обучения и разработке контента для корпоративного сегмента Академия АйТи является лидером в обучении ИТ и информационной безопасности – дисциплинах на стыке ИТ и бизнеса, а также в подготовке кадров для цифровой экономики.
Подробнее об авторе
Мнения учеников

Отзывы о курсе

Оставьте отзыв

Расскажите о качестве обучения, поддержке и результате. Это поможет другим выбрать организацию осознанно.

Напишите ваш коментарий, не менее 30 символов

Нажимая кнопку, вы даете согласие на обработку персональных данных

Оставьте заявку

Консультант ответит на вопросы о курсе «Reinforcement Learning (Обучение с подкреплением) — от базовых алгоритмов до Deep Q-Network и проектов» и поможет разобраться в деталях обучения.

Комментарий ...

Нажимая кнопку, вы даете согласие на обработку персональных данных

Информация обновлена 28 сентября 2026 г.

Продолжить выбор

Похожие курсы

Machine Learning: тариф Базовый
29 сентября
Machine Learning: тариф Базовый

Практический онлайн-курс, на котором вы изучите алгоритмы машинного обучения и научитесь использовать лучшие методики для оценки качества моделей и построите первые модели для обу…

Онлайн
Персональный наставникДомашние задания+4
145 900 ₽от 15 197 ₽/мес на 6079 мес.
Мнемотехники. Мнемотехники
Мнемотехники. Мнемотехники

Простой и современный курс по прокачке памяти. Подростки узнают, как работает память, освоят техники запоминания и интервальные повторения, а также научатся использовать ИИ, чтобы…

Онлайн
2 990 ₽
Excel + Google Таблицы с нуля до PRO + ИИ
−45%4 месяца
Excel + Google Таблицы с нуля до PRO + ИИ

Курс для тех, кто не любит рутину и хочет автоматизировать работу. Научитесь оперативно составлять сложные отчёты и строить прогнозы. Сможете работать в таблицах быстрее с помощью…

Онлайн
54 362 ₽−45%
29 899 ₽от 2 492 ₽/мес на 12 мес.
Начать без затрат

Бесплатные курсы

Natural Language Processing
Бесплатно
Natural Language Processing

The course focuses on Natural Language Processing (NLP), with an emphasis on Large Language Models (LLMs). You will explore key NLP tasks and methods, learn to use pretrained lang…

Онлайн10 занятий
Бесплатно
Claude Code с нуля до реальных задач
Бесплатно1 месяц
Claude Code с нуля до реальных задач

Вы разовьёте аналитическое мышление, научитесь искать уязвимости и обеспечивать безопасность IT-систем. Освоите востребованную профессию даже с нулевым опытом в IT. Программа курс…

Онлайн
Бесплатноот 11 647 ₽/мес
Нейронные сети
Бесплатно6 - 10 часов в неделю
Нейронные сети

В данном курсе мы детально разберём процесс создания и применения нейронных сетей. В первую очередь, мы ставим перед собой цель объяснить основополагающие теоретические идеи и пра…

Онлайн5 занятий
Бесплатно
Нейросети для дизайна
Бесплатно48 академических часов
Нейросети для дизайна

Сфера изобразительного искусства и дизайна — одна из тех, по которой искусственный интеллект прошёлся сильнее всего. Множество дизайнеров и иллюстраторов уже начали использовать н…

Онлайн1 занятий
Видеоуроки
Бесплатно
ГигаЧат: ваш универсальный помощник для жизни
Бесплатно28 сентября
ГигаЧат: ваш универсальный помощник для жизни

Бесплатное обучение работе с ГигаЧатом на курсе от Нетологии для начинающих. Выполните 6 проектов: создайте сказку, листовку, резюме и план питания. Освойте нейросети и получите с…

Онлайн8 занятий
Бесплатно