Основы Hadoop
Как устроено обучение
Подробнее
Что нужно для старта
- Умение работать в командной оболочке Unix/Linux (bash). Опыт работы с базами данных желателен, но не обязателен.
Что вы получите
- Понимать ключевые концепции и архитектуру Hadoop;
- Записывать и читать данные в/из HDFS;
- Понимать устройство MapReduce-программ;
- Обращаться к табличным данным с использованием Hive;
- Обращаться к табличным данным с использованием Spark SQL/DataFrame в пакетном режиме;
- Обрабатывать потоки данных с использованием Spark Structured Streaming;
- Использовать HBase для низколатентного сохранения и чтения данных.
Для кого этот курс
- Data Engineer
- Big Data Analyst
- Data Scientist
Программа курса
⠀
• Архитектура, репликация, чтение и запись данных, команды HDFS.
• Практика: подключение к кластеру, работа с файловой системой из shell и Hue.
• Практика: запуск приложений.
• Архитектура YARN, запуск приложений в YARN.
• Практика: запуск приложений и наблюдение за кластером через UI.
• Архитектура, метаданные таблиц, форматы файлов, язык запросов HiveQL.
• Практика (Hue, hive, beeline, Tez UI): создание таблиц, чтение и запись CSV, Parquet, ORC, партиционирование, SQL-запросы с агрегацией и соединениями.
• DataFrame/SQL, метаданные, форматы файлов, источники данных, RDD.
• Практика (Zeppelin, Spark UI): чтение и запись из БД (JDBC), CSV, Parquet, партиционирование, SQL-запросы с агрегацией и соединениями, планы выполнения запросов, мониторинг.
• Spark Streaming, Spark Structured Streaming, Flink.
• Практика: чтение/обработка/запись потоков между Kafka, реляционной БД и файловой системой.
• Архитектура, язык запросов.
• Практика (HBase shell): запись и чтение данных.
01Основные концепции современной архитектуры данных
⠀
02HDFS: Hadoop Distributed File System
• Архитектура, репликация, чтение и запись данных, команды HDFS.
• Практика: подключение к кластеру, работа с файловой системой из shell и Hue.
03Парадигма MapReduce и ее реализация на Java и в Hadoop Streaming
• Практика: запуск приложений.
04YARN: управление распределенным выполнением приложений
• Архитектура YARN, запуск приложений в YARN.
• Практика: запуск приложений и наблюдение за кластером через UI.
05Введение в Hive
• Архитектура, метаданные таблиц, форматы файлов, язык запросов HiveQL.
• Практика (Hue, hive, beeline, Tez UI): создание таблиц, чтение и запись CSV, Parquet, ORC, партиционирование, SQL-запросы с агрегацией и соединениями.
06Введение в Spark
• DataFrame/SQL, метаданные, форматы файлов, источники данных, RDD.
• Практика (Zeppelin, Spark UI): чтение и запись из БД (JDBC), CSV, Parquet, партиционирование, SQL-запросы с агрегацией и соединениями, планы выполнения запросов, мониторинг.
07Введение в потоковую обработку данных
• Spark Streaming, Spark Structured Streaming, Flink.
• Практика: чтение/обработка/запись потоков между Kafka, реляционной БД и файловой системой.
08Введение в HBase
• Архитектура, язык запросов.
• Практика (HBase shell): запись и чтение данных.
Удостоверение о прохождении
Отзывы о курсе
Оставьте отзыв
Расскажите о качестве обучения, поддержке и результате. Это поможет другим выбрать организацию осознанно.
Оставьте заявку
Консультант ответит на вопросы о курсе «Основы Hadoop» и поможет разобраться в деталях обучения.
Нажимая кнопку, вы даете согласие на обработку персональных данных
Информация обновлена 7 сентября 2026 г.

IBS Training Center 
















