Курс на Stepik
Обложка курса «Apache Spark с нуля для аналитиков и инженеров данных» на Stepik
2 990 ₽

Apache Spark с нуля для аналитиков и инженеров данных ★ 0.000

Открыть на
STEPIK.ORG

Научитесь превращать сырые данные в аналитические витрины на PySpark. Отработайте преобразования, соединения и оконные расчёты в задачах с автопроверкой, затем соберите локальный учебный проект: от загрузки данных и истории клиентов до дашборда в Metabase. Spark изучаем с нуля; основы Python и SQL уже нужны.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Apache Spark с нуля для аналитиков и инженеров данных»Учеников на курсе 0
Сертификаты, выданные на курсе «Apache Spark с нуля для аналитиков и инженеров данных»Сертификатов выдано 0
Отзывы о курсе «Apache Spark с нуля для аналитиков и инженеров данных»Отзывов получено 0
Рейтинг курса «Apache Spark с нуля для аналитиков и инженеров данных»Рейтинг курса 0.000
Уроки в курсе «Apache Spark с нуля для аналитиков и инженеров данных»Количество уроков 55
Тесты в курсе «Apache Spark с нуля для аналитиков и инженеров данных»Количество квизов 44
Задачи с кодом в курсе «Apache Spark с нуля для аналитиков и инженеров данных»Количество задач с кодом 76
Стоимость курса «Apache Spark с нуля для аналитиков и инженеров данных»Стоимость курса 2 990 ₽ —
Обновления курса «Apache Spark с нуля для аналитиков и инженеров данных»Обновления курса — —
Дата публикации курса «Apache Spark с нуля для аналитиков и инженеров данных»Дата публикации курса — ———
Последнее обновление курса «Apache Spark с нуля для аналитиков и инженеров данных»Последнее обновление — ———
Сложность normal — ———

Содержание курса

Разделы в курсе «Apache Spark с нуля для аналитиков и инженеров данных» 11 разделов Уроки в курсе «Apache Spark с нуля для аналитиков и инженеров данных» 55 уроков Тесты в курсе «Apache Spark с нуля для аналитиков и инженеров данных» 44 теста Задачи в курсе «Apache Spark с нуля для аналитиков и инженеров данных» 76 задач Последнее обновление курса «Apache Spark с нуля для аналитиков и инженеров данных» обн. 8 октября 2026

Общая информация о курсе

5 уроков
1. О курсе ↗
2. Идея ↗
3. Реализация ↗
4. Туториал для практических заданий ↗
5. FAQ (Часто задаваемые вопросы) ↗

Знакомство со Spark

3 урока
1. Зачем нужен Spark, MapReduce, архитектура ↗
2. Первый PySpark-код: SparkSession, DataFrame ↗
3. Чтение из таблицы, типы данных, схема ↗

DataFrame API

8 уроков
1. RDD vs DataFrame, lazy eval, action vs transformation ↗
2. Колонки и выражения: F.col, F.lit, операторы ↗
3. select, withColumn, drop, alias ↗
4. F.when / Column.otherwise — категоризация ↗
5. Сортировка, distinct, dropDuplicates, limit ↗
6. Работа с датами ↗
7. Работа со строками ↗
8. NULL handling ↗

Агрегации

4 урока
1. groupBy и базовые агрегаты (sum, count, avg, min, max) ↗
2. Множественные агрегаты, alias, группировка по нескольким columns ↗
3. countDistinct, approx_count_distinct ↗
4. pivot — длинный → широкий формат ↗

Spark SQL и оконные функции

5 уроков
1. Оконные функции: концепция и ранжирование ↗
2. Агрегаты в окне (sum, avg, count через .over) ↗
3. lag и lead — сравнение с соседями ↗
4. rowsBetween / rangeBetween — скользящие окна ↗
5. percent_rank, ntile, cume_dist — статистическое ранжирование ↗

Сложные типы и UDF

5 уроков
1. Массивы: split, collect_list, collect_set, explode, array-функци ↗
2. Map и Struct: nested-данные, доступ к вложенным полям ↗
3. JSON: парсинг и сериализация (from_json, to_json, get_json_objec ↗
4. Управление схемой ↗
5. UDF — пользовательские функции ↗

Joins

3 урока
1. inner / left / right / full outer joins ↗
2. Broadcast join ↗
3. Self-join и многоступенчатые джойны ↗

Spark под капотом

6 уроков
1. Lazy evaluation, DAG, transformations vs actions ↗
2. Catalyst Optimizer и план выполнения ↗
3. Партиционирование: repartition vs coalesce ↗
4. Shuffle: почему дорого и как минимизировать ↗
5. Кэширование: cache, persist, уровни хранения ↗
6. AQE и тюнинг ↗

Финальный мини-проект

3 урока
1. Очистка сырых данных ↗
2. Сборка витрины ↗
3. Финал. Аналитика на витрине ↗

Настройка пет-проекта. Среда и инфраструктура.

6 уроков
1. Архитектура пет-проекта и стека ↗
2. Установка инструментов: Docker и Git ↗
3. Клонируем и поднимаем стек ↗
4. Наполняем данными: генератор источников ↗
5. Первый слой: ingestion → bronze ↗
6. Форматы хранения: почему Parquet ↗

Настройка пет-проекта. Трансформации: bronze → silver → gold

7 уроков
1. Silver: очистка и дедупликация через Delta Lake ↗
2. SCD2: история изменений через MERGE INTO ↗
3. Gold: бизнес-витрины ↗
4. Выгрузка gold → ClickHouse ↗
5. Metabase: дашборды по URL ↗
6. Delta vs Iceberg + оркестрация (теория для собеса) ↗
7. Итоги курса и следующие шаги ↗