Мы используем cookie для стабильной работы сервиса. Подробнее

Основы Apache Spark

4.5
ФорматОнлайн
Длительность26 академ. часов
Объём10 занятий
УровеньСредний
По окончанииУдостоверение о прохождении
Всё для обучения

Как устроено обучение

Практические занятия
О курсе

Подробнее

Обучайтесь основам Apache Spark и используйте его для эффективной обработки больших данных. В данном курсе вы узнаете все необходимое для работы с фреймворком Apache Spark, включая программирование на Python, создание табличных запросов с помощью Spark SQL и обработку данных с использованием RDD и DataFrame. Уникальное сочетание теории и практики поможет вам быстро освоить все нюансы Spark и применить их на реальных проектах.
Требования

Что нужно для старта

  • Базовые навыки программирования на языке Python. Базовые знания SQL..
Результат

Что вы получите

  • Создавать и распараллеливать RDD и DataFrame
  • Запускать Spark и управлять кластерами для распределенной обработки данных
  • Читать и записывать данные из внешних хранилищ
  • Оптимизировать производительность Spark-приложений
  • Использовать веб-ноутбуки Jupyter для разработки и тестирования кода
Аудитория

Для кого этот курс

  • Разработчик
  • Архитектор ПО
  • Big Data Analyst
Содержание

Программа курса

10 занятий
ТемаЧто внутри
01Концепции и архитектура Spark

• Map/Reduce и Spark в Hadoop. Примеры
• Spark в Lambda-архитектуре
• Кластеры для распределенной обработки данных
• Как запустить Spark
• Исполнители, задания, задачи в Spark

02Программирование с помощью RDD: трансформации и действия

• В чем разница между SparkSession и SparkContext
• Как создавать и распараллеливать RDD
• Как трансформировать RDD
• Как анализировать и управлять обработкой RDD (план и DAG)
• Как сохранять и хранить RDD в HDFS
• Как группировать и соединять RDD

03Программирование с помощью DataFrame

• В чем разница между RDD и DataFrame
• Как создавать и распараллеливать DataFrame
• Как анализировать и управлять выполнением DataFrame (план и DAG)
• Как сохранять DataFrame в HDFS

04Загрузка данных с внешних хранилищ и во внешние хранилища

• Как читать/писать данные с файлового хранилища (HDFS, S3, FTP, локальной файловой системы)
• Какой формат данных выбрать
• Как распараллеливать чтение/запись в JDBC
• Как создать DataFrame из MPP (Cassandra, Vertica, Greenplum)
• Как работать с Kafka

05Написание логики с использованием Spark DSL

• Как считать строки
• Как обрабатывать математические агрегации
• Как группировать строки
• Как правильное соединять DataFrames

06Написание логики с использованием Spark SQL

• Как и зачем переключаться на Spark SQL
• Как работать с таблицей EXTERNAL
• Как работать с таблицей MANAGED

07Использование функций Window и UDF

• Какие оконные функции существуют и как их использовать в Spark
• Когда не следует использовать оконные функции
• Что такое UDF, UDAF и как их использовать
• Как оптимизировать UDFs в PySpark

08Типы Spark

• Логические: как добавить фильтр
• Численные: как подсчитать сумму, произведение, статистику
• Строковый: как использовать регулярные выражения
• Комплексные: как работать со структурами, массивами
• Как работать с данными

09Примеры оптимизации Spark

• Недостаточно памяти
• Маленькие файлы в HDFS
• Асимметричные данные
• Медленные соединения
• Трансляция больших таблиц
• Совместное использование ресурсов
• Новые механизмы оптимизации: AQE и DPP

10Запуск Spark в Airflow

• Оркестраторы
• Устройство Airflow
• Встроенные операторы Airflow
• SparkSubmitOperator

01Концепции и архитектура Spark

• Map/Reduce и Spark в Hadoop. Примеры
• Spark в Lambda-архитектуре
• Кластеры для распределенной обработки данных
• Как запустить Spark
• Исполнители, задания, задачи в Spark

02Программирование с помощью RDD: трансформации и действия

• В чем разница между SparkSession и SparkContext
• Как создавать и распараллеливать RDD
• Как трансформировать RDD
• Как анализировать и управлять обработкой RDD (план и DAG)
• Как сохранять и хранить RDD в HDFS
• Как группировать и соединять RDD

03Программирование с помощью DataFrame

• В чем разница между RDD и DataFrame
• Как создавать и распараллеливать DataFrame
• Как анализировать и управлять выполнением DataFrame (план и DAG)
• Как сохранять DataFrame в HDFS

04Загрузка данных с внешних хранилищ и во внешние хранилища

• Как читать/писать данные с файлового хранилища (HDFS, S3, FTP, локальной файловой системы)
• Какой формат данных выбрать
• Как распараллеливать чтение/запись в JDBC
• Как создать DataFrame из MPP (Cassandra, Vertica, Greenplum)
• Как работать с Kafka

05Написание логики с использованием Spark DSL

• Как считать строки
• Как обрабатывать математические агрегации
• Как группировать строки
• Как правильное соединять DataFrames

06Написание логики с использованием Spark SQL

• Как и зачем переключаться на Spark SQL
• Как работать с таблицей EXTERNAL
• Как работать с таблицей MANAGED

07Использование функций Window и UDF

• Какие оконные функции существуют и как их использовать в Spark
• Когда не следует использовать оконные функции
• Что такое UDF, UDAF и как их использовать
• Как оптимизировать UDFs в PySpark

08Типы Spark

• Логические: как добавить фильтр
• Численные: как подсчитать сумму, произведение, статистику
• Строковый: как использовать регулярные выражения
• Комплексные: как работать со структурами, массивами
• Как работать с данными

09Примеры оптимизации Spark

• Недостаточно памяти
• Маленькие файлы в HDFS
• Асимметричные данные
• Медленные соединения
• Трансляция больших таблиц
• Совместное использование ресурсов
• Новые механизмы оптимизации: AQE и DPP

10Запуск Spark в Airflow

• Оркестраторы
• Устройство Airflow
• Встроенные операторы Airflow
• SparkSubmitOperator

Документ после выпуска

Удостоверение о прохождении

Организатор

Автор курса

IBS Training CenterIBS Training Center
Оценка и обучение ИТ-специалистов по ключевым направлениям разработки программного обеспечения. Курсы от экспертов-практиков по языкам программирования, системному и бизнес-анализу, архитектуре ПО, ручному и автоматизированному тестированию ПО, Big Data и машинному обучению, управлению проектами и Agile. Действует скидка 10% на обучение физических лиц.
Подробнее об авторе
Мнения учеников

Отзывы о курсе

Оставьте отзыв

Расскажите о качестве обучения, поддержке и результате. Это поможет другим выбрать организацию осознанно.

Напишите ваш коментарий, не менее 30 символов

Нажимая кнопку, вы даете согласие на обработку персональных данных

Оставьте заявку

Консультант ответит на вопросы о курсе «Основы Apache Spark» и поможет разобраться в деталях обучения.

Комментарий ...

Нажимая кнопку, вы даете согласие на обработку персональных данных

Направления:Анализ данных

Информация обновлена 31 августа 2026 г.

Продолжить выбор

Похожие курсы

Компьютерная лингвистика
11 месяцев
Компьютерная лингвистика

Овладейте современными инструментами обработки естественных языков, включая работу с нейросетями. В рамках программы Вы выполните два масштабных проекта с нуля и пройдете стажиров…

Онлайн7 занятийПродвинутый
240 000 ₽
Построение выводов по данным
4 недели
Построение выводов по данным

Приветствуем на четвертом курсе программы "Машинное обучение и анализ данных" – "Построение выводов по данным". Методы прикладной статистики, о которых пойдёт речь в этом курсе, —…

Онлайн4 занятий
15 000 ₽
Начать без затрат

Бесплатные курсы

Мегаинтенсив по анализу данных
Бесплатно
Мегаинтенсив по анализу данных

В программе интенсива 3 трека, разделенные по уровням сложности: для начинающих, для продолжающих и многогранный Data Science. Для начинающих За 4 занятия вы сможете пройти путь о…

Онлайн5 занятий
Бесплатно
IT-сеанс: погружение в мир данных
Бесплатно
IT-сеанс: погружение в мир данных

Презентации спикеров и записи выступлений с Зимней школы по аналитике и Data Science 2025. Приглашаем к просмотру докладов всех, кто хочет разобраться: Зачем переходить в IT? Как…

Онлайн5 занятий
Бесплатно