Курс на Stepik
Обложка курса «PySpark для аналитиков: от Pandas до терабайтных вычислений» на Stepik
Бесплатно

PySpark для аналитиков: от Pandas до терабайтных вычислений 0.000

Открыть на
STEPIK.ORG

Считайте метрики на терабайтах, оставаясь аналитиком: RFM, когорты, воронки, Data Quality и оптимизация в PySpark. Без Scala и кластеров — всё в Google Colab. 99 уроков и 44 задачи с автопроверкой. Разборы: zasqlpython.ru

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «PySpark для аналитиков: от Pandas до терабайтных вычислений»Учеников на курсе 296
Сертификаты, выданные на курсе «PySpark для аналитиков: от Pandas до терабайтных вычислений»Сертификатов выдано 0
Отзывы о курсе «PySpark для аналитиков: от Pandas до терабайтных вычислений»Отзывов получено 0
Рейтинг курса «PySpark для аналитиков: от Pandas до терабайтных вычислений»Рейтинг курса 0.000
Уроки в курсе «PySpark для аналитиков: от Pandas до терабайтных вычислений»Количество уроков 99
Тесты в курсе «PySpark для аналитиков: от Pandas до терабайтных вычислений»Количество квизов 181
Задачи с кодом в курсе «PySpark для аналитиков: от Pandas до терабайтных вычислений»Количество задач с кодом 22
Время прохождения курса «PySpark для аналитиков: от Pandas до терабайтных вычислений»Время прохождения курса
Обновления курса «PySpark для аналитиков: от Pandas до терабайтных вычислений»Обновления курса
Дата публикации курса «PySpark для аналитиков: от Pandas до терабайтных вычислений»Дата публикации курса
Последнее обновление курса «PySpark для аналитиков: от Pandas до терабайтных вычислений»Последнее обновление

Чему вы научитесь

«Данные не помещаются в память» — фраза, после которой задача аналитика уходит к дата-инженерам. Ноутбук виснет на groupby, выгрузка идёт четвёртый час, а продуктовые метрики считаются по сэмплу и с оговорками.

PySpark убирает этот потолок: та же логика, те же метрики — но на терабайтах. Этот курс учит работать с ним как аналитик, а не как инженер: без Scala, без администрирования кластеров, без единой строчки конфигов YARN.

СейчасПосле курса
groupby на 50 млн строк кладёт ноутбукагрегация на терабайтах за минуты
считаете по сэмплу, «чтобы влезло»расчёт на полных данных
«джойн висит на 99%», непонятно почемучитаете план, находите перекос, чините
ждёте дата-инженера на каждую вторую задачусчитаете сами и закрываете быстрее
Чему вы научитесь
  • Считать RFM, когорты, воронки и retention на данных, которые не влезают в память
  • Переносить готовую логику pandas и SQL в PySpark, не переписывая с нуля
  • Читать план запроса explain() и находить причину, почему запрос тормозит
  • Лечить перекос данных, OOM и медленные джойны: broadcast, AQE, salting, кэш
  • Проводить Data Quality-аудит одним проходом: пропуски, дубли, битые ключи, валидация
  • Уверенно владеть окнами, cube/rollup, pivot, массивами и UDF
  • Готовить витрины для BI: Parquet, партиционирование, форматы выгрузки
  • Работать на актуальном Spark 4.x: VARIANT, Arrow-native UDF, pipe-синтаксис

Разборы по каждой теме и шпаргалки — на zasqlpython.ru.

Программа: 9 модулей, 99 уроков
Модуль 0. Старткогда Spark нужен, а когда честнее взять Polars или DuckDB; первые запросы
Модуль 1. Архитектураленивость, DAG, джобы, стадии и задачи — почему код ведёт себя именно так
Модуль 2. От pandas к Sparkперенос привычной логики: фильтры, колонки, группировки, null-семантика
Модуль 3. Данные и форматысхемы, Parquet, партиционирование, облако, Delta Lake, типы и таймзоны
Модуль 4. Метрикиджойны, окна, cube/rollup, pivot, массивы, semi/anti-джойны
Модуль 5. Data Qualityпропуски, дубли, валидация, регулярки, приближённые алгоритмы
Модуль 6. Производительностьплан запроса, перекос, OOM, AQE, Spark UI, оптимизация
Модуль 7. UDF и Arrowкогда UDF оправдан, а когда убивает производительность
Модуль 8. Spark SQL и витриныSQL-движок, выгрузка в BI, финальный проект

Подробный разбор программы и дополнительные материалы: zasqlpython.ru.

Как проходит обучение

Курс построен так, что вы решаете сами — готовых ответов в уроках нет. Каждая задача проходит один и тот же путь:

1. В задании — датасет и конкретный вопрос.
2. Вы решаете настоящим PySpark в Google Colab: ноутбук модуля уже собран, данные вшиты — копировать ничего не нужно.
3. Вводите ответ на Stepik и сразу видите результат автопроверки.
9 модулей, 99 уроков, 44 задачи с автопроверкой. Без таймеров — думайте столько, сколько нужно. Ничего не устанавливаете: Spark запускается в браузере, свой кластер не нужен. Готовые ноутбуки и разборы — на zasqlpython.ru.
Что вы получаете
  • Навык, который снимает потолок в работе и заметен в резюме
  • 44 решённые задачи и готовые Colab-ноутбуки — рабочие заготовки, а не учебные примеры
  • Отработанные метрики: RFM-сегментация, когортный анализ, DQ-скоркарта, оптимизация джойнов
  • Сертификат Stepik по набранным за задания баллам
  • Доступ к базе разборов и шпаргалок на zasqlpython.ru
Частые вопросы
Нужен ли свой кластер или мощный компьютер?
Нет. Все задачи решаются в бесплатном Google Colab — Spark запускается прямо в браузере. Достаточно ноутбука с интернетом.
Нужно ли знать Java или Scala?
Нет. Весь курс — на Python. Scala и настройка кластеров сознательно оставлены за рамками: это работа дата-инженера, а не аналитика.
А может, мне хватит pandas?
Возможно — и курс начинается с честного разбора, когда Spark НЕ нужен и лучше взять Polars или DuckDB. Спойлер: пока данные влезают в память, Spark только мешает. Подробнее — на zasqlpython.ru.
Сколько времени займёт?
Примерно 40–50 часов. Дедлайнов нет, темп свой: курс проходится в удобном ритме, прогресс сохраняется.
Что делать, если задача не решается?
В каждом задании есть подсказка с нужными функциями, а разборы всех задач выложены на zasqlpython.ru. Попытки не ограничены, таймеров нет.
Будет ли сертификат?
Да. Сертификат Stepik выдаётся автоматически по количеству набранных за задания баллов — обычный и с отличием.

Автор курса — практикующий аналитик. Больше материалов по Python, SQL и PySpark: zasqlpython.ru.

О курсе

Считайте метрики на терабайтах, оставаясь аналитиком: RFM, когорты, воронки, Data Quality и оптимизация в PySpark. Без Scala и кластеров — всё в Google Colab. 99 уроков и 44 задачи с автопроверкой. Разборы: zasqlpython.ru

Для кого этот курс

  • Аналитик данных, упёршийся в потолок pandas
  • Продуктовый аналитик, который считает метрики по сэмплу, потому что полные данные не тянутся
  • BI- и дата-аналитик, которому выдали доступ к Spark-кластеру и оставили разбираться
  • SQL-аналитик, переходящий на большие данные
  • Тот, кто устал зависеть от дата-инженеров в каждой второй задаче
Кому не подойдёт: курс не про дата-инженерию. Если нужны Scala, настройка YARN, деплой и администрирование кластеров — это не сюда. Здесь рабочий процесс аналитика: чистка данных, метрики, Data Quality, оптимизация. Разбор «кому подойдёт» — на zasqlpython.ru.

Начальные требования

  • Python на уровне уверенного pandas: DataFrame, groupby, merge
  • Базовый SQL: SELECT, JOIN, GROUP BY, агрегаты
  • Готовность решать задачи руками — теории здесь меньше, чем практики
Что не нужно: Scala, Java, Hadoop, собственный кластер и установка Spark. Всё работает в бесплатном Google Colab — достаточно браузера. Материалы для подготовки и шпаргалки по pandas и SQL: zasqlpython.ru.

Преподаватели курса

Нагрузка

99 уроков, 44 задачи с автопроверкой, ~40-50 часов практики

Расскажите о курсе друзьям