Основы Apache Spark
Как устроено обучение
Подробнее
Что нужно для старта
- Базовые навыки программирования на языке Python. Базовые знания SQL..
Что вы получите
- Создавать и распараллеливать RDD и DataFrame
- Запускать Spark и управлять кластерами для распределенной обработки данных
- Читать и записывать данные из внешних хранилищ
- Оптимизировать производительность Spark-приложений
- Использовать веб-ноутбуки Jupyter для разработки и тестирования кода
Для кого этот курс
- Разработчик
- Архитектор ПО
- Big Data Analyst
Программа курса
• Map/Reduce и Spark в Hadoop. Примеры
• Spark в Lambda-архитектуре
• Кластеры для распределенной обработки данных
• Как запустить Spark
• Исполнители, задания, задачи в Spark
• В чем разница между SparkSession и SparkContext
• Как создавать и распараллеливать RDD
• Как трансформировать RDD
• Как анализировать и управлять обработкой RDD (план и DAG)
• Как сохранять и хранить RDD в HDFS
• Как группировать и соединять RDD
• В чем разница между RDD и DataFrame
• Как создавать и распараллеливать DataFrame
• Как анализировать и управлять выполнением DataFrame (план и DAG)
• Как сохранять DataFrame в HDFS
• Как читать/писать данные с файлового хранилища (HDFS, S3, FTP, локальной файловой системы)
• Какой формат данных выбрать
• Как распараллеливать чтение/запись в JDBC
• Как создать DataFrame из MPP (Cassandra, Vertica, Greenplum)
• Как работать с Kafka
• Как считать строки
• Как обрабатывать математические агрегации
• Как группировать строки
• Как правильное соединять DataFrames
• Как и зачем переключаться на Spark SQL
• Как работать с таблицей EXTERNAL
• Как работать с таблицей MANAGED
• Какие оконные функции существуют и как их использовать в Spark
• Когда не следует использовать оконные функции
• Что такое UDF, UDAF и как их использовать
• Как оптимизировать UDFs в PySpark
• Логические: как добавить фильтр
• Численные: как подсчитать сумму, произведение, статистику
• Строковый: как использовать регулярные выражения
• Комплексные: как работать со структурами, массивами
• Как работать с данными
• Недостаточно памяти
• Маленькие файлы в HDFS
• Асимметричные данные
• Медленные соединения
• Трансляция больших таблиц
• Совместное использование ресурсов
• Новые механизмы оптимизации: AQE и DPP
• Оркестраторы
• Устройство Airflow
• Встроенные операторы Airflow
• SparkSubmitOperator
01Концепции и архитектура Spark
• Map/Reduce и Spark в Hadoop. Примеры
• Spark в Lambda-архитектуре
• Кластеры для распределенной обработки данных
• Как запустить Spark
• Исполнители, задания, задачи в Spark
02Программирование с помощью RDD: трансформации и действия
• В чем разница между SparkSession и SparkContext
• Как создавать и распараллеливать RDD
• Как трансформировать RDD
• Как анализировать и управлять обработкой RDD (план и DAG)
• Как сохранять и хранить RDD в HDFS
• Как группировать и соединять RDD
03Программирование с помощью DataFrame
• В чем разница между RDD и DataFrame
• Как создавать и распараллеливать DataFrame
• Как анализировать и управлять выполнением DataFrame (план и DAG)
• Как сохранять DataFrame в HDFS
04Загрузка данных с внешних хранилищ и во внешние хранилища
• Как читать/писать данные с файлового хранилища (HDFS, S3, FTP, локальной файловой системы)
• Какой формат данных выбрать
• Как распараллеливать чтение/запись в JDBC
• Как создать DataFrame из MPP (Cassandra, Vertica, Greenplum)
• Как работать с Kafka
05Написание логики с использованием Spark DSL
• Как считать строки
• Как обрабатывать математические агрегации
• Как группировать строки
• Как правильное соединять DataFrames
06Написание логики с использованием Spark SQL
• Как и зачем переключаться на Spark SQL
• Как работать с таблицей EXTERNAL
• Как работать с таблицей MANAGED
07Использование функций Window и UDF
• Какие оконные функции существуют и как их использовать в Spark
• Когда не следует использовать оконные функции
• Что такое UDF, UDAF и как их использовать
• Как оптимизировать UDFs в PySpark
08Типы Spark
• Логические: как добавить фильтр
• Численные: как подсчитать сумму, произведение, статистику
• Строковый: как использовать регулярные выражения
• Комплексные: как работать со структурами, массивами
• Как работать с данными
09Примеры оптимизации Spark
• Недостаточно памяти
• Маленькие файлы в HDFS
• Асимметричные данные
• Медленные соединения
• Трансляция больших таблиц
• Совместное использование ресурсов
• Новые механизмы оптимизации: AQE и DPP
10Запуск Spark в Airflow
• Оркестраторы
• Устройство Airflow
• Встроенные операторы Airflow
• SparkSubmitOperator
Удостоверение о прохождении
Отзывы о курсе
Оставьте отзыв
Расскажите о качестве обучения, поддержке и результате. Это поможет другим выбрать организацию осознанно.
Оставьте заявку
Консультант ответит на вопросы о курсе «Основы Apache Spark» и поможет разобраться в деталях обучения.
Нажимая кнопку, вы даете согласие на обработку персональных данных
Информация обновлена 31 августа 2026 г.

IBS Training Center 





















