Курс на Stepik
Обложка курса «PySpark с нуля» на Stepik
108 000 ₽

PySpark с нуля 5.000

Открыть на
STEPIK.ORG

Курс предназначен для начинающих специалистов в области обработки больших данных. Вы изучите основы распределённых вычислений с Apache Spark, научитесь работать с RDD и DataFrame, познакомитесь с Spark SQL, оптимизацией запросов, потоковой обработкой и библиотекой машинного обучения MLlib. В финале курса Вы решите практическое задание и добавите готовый проект в портфолио.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «PySpark с нуля»Учеников на курсе 267
Сертификаты, выданные на курсе «PySpark с нуля»Сертификатов выдано 0
Отзывы о курсе «PySpark с нуля»Отзывов получено 1
Рейтинг курса «PySpark с нуля»Рейтинг курса 5.000
Уроки в курсе «PySpark с нуля»Количество уроков 56
Тесты в курсе «PySpark с нуля»Количество квизов 221
Задачи с кодом в курсе «PySpark с нуля»Количество задач с кодом 6
Время прохождения курса «PySpark с нуля»Время прохождения курса
Стоимость курса «PySpark с нуля»Стоимость курса 108 000 ₽
Обновления курса «PySpark с нуля»Обновления курса
Дата публикации курса «PySpark с нуля»Дата публикации курса
Последнее обновление курса «PySpark с нуля»Последнее обновление
Сложность easy

Содержание курса

Разделы в курсе «PySpark с нуля» 12 разделов Уроки в курсе «PySpark с нуля» 56 уроков Тесты в курсе «PySpark с нуля» 221 тест Задачи в курсе «PySpark с нуля» 6 задач Время прохождения курса «PySpark с нуля» 14 ч. Последнее обновление курса «PySpark с нуля» обн. 14 июля 2026

Знакомство с платформой и сдача практических задач

1 урок
1. Введение в курс и платформу

Введение в Spark и основы распределенных вычислений

6 уроков
1. Что такое Apache Spark и его место в экосистеме Big Data
2. Архитектура Spark: драйвер, исполнители, кластерные менеджеры
3. Чем Spark лучше Hadoop MapReduce? Отложенные вычисления
4. Обзор PySpark API и его особенностей
5. Установка и настройка Spark
6. Первый запуск PySpark

Работа с данными в PySpark: RDD

6 уроков
1. Что такое RDD (Resilient Distributed Dataset)
2. Преобразования
3. Действия
4. Практическое задание
5. Самостоятельная работа
6. Итоговое задание

Работа с данными в PySpark: DataFrame и Spark SQL

11 уроков
1. DataFrame в PySpark: понятие, схема, создание
2. Основные операции DataFrame API
3. Spark SQL
4. Схемы данных и типы
5. Встроенные функции PySpark
6. User Defined Functions
7. Форматы: Avro, Parquet, ORC
8. Pandas API
9. Практическое задание
10. Самостоятельная работа
11. Итоговое задание

Оптимизация производительности PySpark-приложений

8 уроков
1. Широкие и узкие преобразования, shuffle
2. Партиционирование
3. Анализ плана выполнения (explain), стратегии JOIN
4. Обработка неравномерных данных (Data Skew)
5. Кэширование (cache, persist) и контрольные точки (checkpoint)
6. Catalyst Optymizer
7. Tungsten Execution Engine
8. Итоговое задание

Потоковая обработка с PySpark Structured Streaming

6 уроков
1. Введение в PySpark Streaming
2. Источники данных для Structured Streaming
3. Вывод данных, Режимы вывода и Триггеры
4. Управление состоянием и временем
5. Самостоятельная работа
6. Итоговое задание

Машинное обучение с PySpark MLlib

6 уроков
1. Введение в PySpark ML
2. Предварительная обработка данных
3. Основные алгоритмы машинного обучения в PySpark ML
4. Оценка моделей в PySpark ML
5. Кросс-валидация и подбор гиперпараметров
6. Построение и оценка ML Pipelines

Интеграция PySpark с внешними системами

1 урок
1. Знакомство с хранилищами данных для работы с PySpark

Отладка и профилирование PySpark-приложений

1 урок
1. Как устранять ошибки?

Чеклисты и шпаргалки по PySpark

1 урок
1. Основные приемы

Продвинутые темы PySpark

1 урок
1. Что такое DeltaLake?

Финальные проекты

1 урок
1. Варианты итоговых работ