Курс на Stepik
Обложка курса «Apache Spark и PySpark на практике: ETL и большие данные» на Stepik
4 190 ₽

Apache Spark и PySpark на практике: ETL и большие данные ★ 0.000

Открыть на
STEPIK.ORG

Практический курс по Apache Spark и PySpark для инженеров данных и аналитиков. Разберём архитектуру Spark, DataFrame API, ETL, joins, partitions, shuffle, Parquet, Catalyst, explain(), кеширование и оптимизацию. Построим полноценный конвейер обработки данных: raw data → PySpark → Parquet → ClickHouse.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Apache Spark и PySpark на практике: ETL и большие данные»Учеников на курсе 3
Сертификаты, выданные на курсе «Apache Spark и PySpark на практике: ETL и большие данные»Сертификатов выдано 0
Отзывы о курсе «Apache Spark и PySpark на практике: ETL и большие данные»Отзывов получено 0
Рейтинг курса «Apache Spark и PySpark на практике: ETL и большие данные»Рейтинг курса 0.000
Уроки в курсе «Apache Spark и PySpark на практике: ETL и большие данные»Количество уроков 34
Тесты в курсе «Apache Spark и PySpark на практике: ETL и большие данные»Количество квизов 99
Стоимость курса «Apache Spark и PySpark на практике: ETL и большие данные»Стоимость курса 4 190 ₽ —
Обновления курса «Apache Spark и PySpark на практике: ETL и большие данные»Обновления курса — —
Дата публикации курса «Apache Spark и PySpark на практике: ETL и большие данные»Дата публикации курса — ———
Последнее обновление курса «Apache Spark и PySpark на практике: ETL и большие данные»Последнее обновление — ———
Сложность easy — ———

Содержание курса

Разделы в курсе «Apache Spark и PySpark на практике: ETL и большие данные» 7 разделов Уроки в курсе «Apache Spark и PySpark на практике: ETL и большие данные» 34 урока Тесты в курсе «Apache Spark и PySpark на практике: ETL и большие данные» 99 тестов Последнее обновление курса «Apache Spark и PySpark на практике: ETL и большие данные» обн. 8 октября 2026

Знакомство с Apache Spark

4 урока
1. Знакомство с Apache Spark ↗
2. Apache Spark: Driver, Executors, Cluster Manager и Worker ↗
3. Устанавливаем Spark и PySpark ↗
4. Первое PySpark-приложение ↗

DataFrame API и обработка данных

5 уроков
1. DataFrame и схема данных ↗
2. select, filter и withColumn ↗
3. Работа с функциями PySpark ↗
4. groupBy() и агрегаты ↗
5. Spark SQL ↗

Как Spark выполняет код

5 уроков
1. Ленивые вычисления. Transformations и Actions ↗
2. Jobs, Stages и Tasks ↗
3. Partitions ↗
4. Shuffle ↗
5. Spark UI ↗

Файлы и хранение данных

4 урока
1. CSV и JSON в Spark ↗
2. Parquet ↗
3. Partitioned datasets ↗
4. Проблема маленьких файлов ↗

Joins и сложные преобразования

5 уроков
1. Join в PySpark ↗
2. Что происходит при Join внутри Spark ↗
3. Broadcast Join ↗
4. Data Skew ↗
5. Window Functions ↗

Производительность Spark

6 уроков
1. Логический и физический план Spark ↗
2. Catalyst Optimizer ↗
3. Repartition и Coalesce ↗
4. Cache и Persist ↗
5. Настройка ресурсов Spark ↗
6. Разбираем медленный Spark Job ↗

Итоговый ETL-проект

5 уроков
1. Проектируем production-подобный Spark ETL ↗
2. PostgreSQL → PySpark → Parquet ↗
3. PySpark → ClickHouse ↗
4. Сборка полноценного ETL pipeline ↗
5. Production-подходы и куда двигаться дальше ↗