Чему вы научитесь
- План на 16 недель
- 1. Python для эффективной обработки данных
- • Итераторы и генераторы
- • yield и lazy evaluation
- • Генераторные выражения
- • Потоковая обработка данных
- • Работа с большими объёмами данных и памятью
- 2. NumPy
- • ndarray, shape, dimensions, dtype
- • Индексация и slicing
- • Векторизированные вычисления
- • Broadcasting
- • Агрегации
- • NumPy vs обычные Python-циклы
- 3. Pandas: основы
- • Series и DataFrame
- • Index и columns
- • Типы данных
- • Загрузка и первичное исследование datasets
- • loc, iloc
- • Фильтрация и query
- 4. Pandas: преобразование данных
- • rename, astype, assign
- • Создание новых признаков
- • map и apply
- • Векторизация
- • Производительность Pandas
- 5. Pandas: группировка и агрегация
- • groupby
- • agg
- • Несколько агрегатов
- • transform
- • filter
- • MultiIndex
- • Расчёт бизнес-метрик
- 6. Pandas: объединение и изменение структуры данных
- • merge
- • INNER / LEFT / RIGHT / OUTER JOIN
- • One-to-one, one-to-many, many-to-many
- • Cardinality и дубликаты ключей
- • concat
- • pivot, pivot_table, melt
- 7. Время и очистка данных
- • Работа с datetime
- • Timezone
- • Resampling
- • Rolling и накопительные показатели
- • Пропуски
- • Дубликаты
- • Некорректные типы
- • Выбросы
- • Проверка качества данных
- 8. Исследовательский анализ данных
- • Как правильно проводить EDA
- • Постановка аналитического вопроса
- • Поиск закономерностей и аномалий
- • Формирование и проверка гипотез
- • Matplotlib
- • Seaborn
- • Выбор правильного типа визуализации
- Практический кейс: исследование поведения клиентов на реальном наборе данных.
- 9. Python + PostgreSQL
- • Подключение к PostgreSQL из Python
- • DB-API
- • Connection и Cursor
- • Параметризованные запросы
- • Transactions
- • SQLAlchemy
- • Engine и Connection
- • Работа с DataFrame и PostgreSQL
- 10. Надёжная загрузка данных из API
- • Pagination
- • Rate limits
- • Timeout
- • Retries
- • Обработка ошибок
- • Incremental loading
- • Watermark
- • Checkpoint
- • Защита от дубликатов
- Практика: API → Python → PostgreSQL
- 11. ETL / ELT и проектирование Data Pipeline
- • ETL и ELT
- • Extract → Transform → Load
- • Raw / Sta
О курсе
Курс будет длиться 4 месяца и рассчитан на тех, кто прошел уроки с 1.1 по 6.6 базового курса по Python (https://stepik.org/course/271947/syllabus).
После прохождения курса вы сможете использовать Python для решения практических задач анализа данных и Data Engineering.
Python регулярно встречается в вакансиях по анализу и инженерии данных. Знание Python стало одним из базовых профессиональных навыков.
Для кого этот курс
Курс рассчитан на тех, кто прошел уроки с 1.1 по 6.6 базового курса по Python (https://stepik.org/course/271947/syllabus), а также для тех, кто хочет устроиться на должность аналитика или инженера данных или ужен работает в такой должности и хочет развивать свою карьеру.
Начальные требования
пройти уроки с 1.1 по 6.6 базового курса по Python (https://stepik.org/course/271947/syllabus)
Преподаватели курса
Как проходит обучение
Нужно смотреть видеоуроки, делать домашние задания и решать тесты
Что вы получите
- Освоите базовые инструменты инженерии и анализа данных на Python