Чему вы научитесь
- Строить полный жизненный цикл данных (end-to-end) — от получения данных из источников до аналитических дашбордов.
- Понимать основные принципы работы современных систем обработки данных.
- Разбираться в архитектуре современного конвейера данных и взаимодействии его основных компонентов.
- Получать данные из файлов различных форматов и внешних API.
- Загружать данные в PostgreSQL и организовывать их хранение.
- Реализовывать ETL-процессы для сбора и первичной обработки данных.
- Использовать SQL для выборки, проверки и анализа данных.
- Автоматизировать выполнение конвейеров данных с помощью Apache Airflow.
- Выполнять преобразование данных с использованием dbt.
- Контейнеризировать приложения и инфраструктуру с помощью Docker и Docker Compose.
- Использовать Git для контроля версий проекта.
- Понимать принципы потоковой обработки данных на примере Apache Kafka.
- Проводить базовый анализ данных в Jupyter Notebook.
- Создавать аналитические дашборды в Apache Superset.
- Настраивать базовый мониторинг инфраструктуры с использованием Prometheus и Grafana.
- Работать с объектным хранилищем MinIO.
- Строить гибридную архитектуру хранения (data lakehouse) с использованием Apache Iceberg и Trino.
- Собирать и запускать полноценный конвейер данных на современном open-source стеке.
О курсе
Для кого этот курс
Начальные требования
Для комфортного прохождения курса рекомендуются:
- Базовые знания Python (переменные, циклы, функции, работа с библиотеками) — или готовность повторить материал по ходу курса.
- Базовое знакомство с SQL (SELECT, JOIN, GROUP BY, оконные функции) — или готовность повторить материал по ходу курса.
- Общее представление о том, что такое базы данных.
- Желателен, но не обязателен опыт работы с командной строкой/терминалом.
Преподаватели курса
Как проходит обучение
Курс построен вокруг одного сквозного практического проекта — вы последовательно проходите уроки, где после каждой темы закрепляете материал на практике. Формат каждого урока: краткое введение в тему → настройка нужной инфраструктуры → написание кода → разбор и объяснение → сборка через Docker Compose → запуск и проверка результата.
В курс входят:
- Текстовые уроки с пошаговыми инструкциями и объяснением, зачем нужен каждый инструмент.
- Практические задания и тесты с автоматической проверкой после ключевых тем.
- Работа с реальной инфраструктурой через Docker Compose на каждом этапе — от баз данных до мониторинга.
К концу курса вы соберёте полноценный дата-пайплайн от источника данных до аналитического дашборда — не разрозненные примеры, а один работающий проект, который можно показать на собеседовании, а также на основе которого можно продолжить изучение других инструментов.
Что вы получите
- Практический опыт сборки полноценного дата-пайплайна уровня Junior Data Engineer.
- Работающий pet-проект для портфолио, который можно показать на собеседовании.
- Понимание того, как компоненты современного дата-стека (Python, PostgreSQL, dbt, Airflow, Kafka, Superset, Grafana) работают и взаимодействуют друг с другом.
- Навыки практической работы с инфраструктурой: развёртывание сервисов через Docker Compose, запуск и отладка пайплайнов, базовая настройка мониторинга и логирования.
- Доступ к форуму студентов — обсуждение решений, вопросы и обратная связь от однокурсников.
- Сертификат о прохождении курса от Stepik.