Содержание пакета (3 курса)
1. DuckDB на практике: SQL-аналитика прямо в Python и файлах 4.67
Введение и быстрый старт
6 уроков
1.
Добро пожаловать и структура курса
↗
2.
Что такое DuckDB и почему это “аналитика без сервера”?
↗
3.
Где применяется DuckDB (аналитика, data engineering, Python)?
↗
4.
Установка DuckDB (CLI + Python)
↗
5.
Первый запрос за 5 минут
↗
6.
БОНУС: Сравнение скорости: DuckDB vs Polars vs Pandas
↗
Работа с файлами -> главная фишка DuckDB
6 уроков
1.
Чтение CSV напрямую без импорта
↗
2.
Работа с Parquet (эффективная аналитика)
↗
3.
Чтение JSON-файлов
↗
4.
Запросы к файлам как к таблицам
↗
5.
Экспорт результатов в CSV / Parquet
↗
6.
Практический мини-кейс
↗
SQL-возможности DuckDB
5 уроков
1.
Расширения SQL (GROUP BY ALL, EXCLUDE, REPLACE, COLUMNS)
↗
2.
Быстрое исследование данных (SUMMARIZE, SAMPLE)
↗
3.
Window Functions
↗
4.
PIVOT
↗
5.
Генерация данных (generate_series)
↗
DuckDB + Python
4 урока
1.
Подключение DuckDB в Python
↗
2.
Выполнение SQL из Python
↗
3.
Интеграция с pandas
↗
4.
Аналитический workflow: файл → SQL → DataFrame → результат
↗
Мини-проект: аналитика реальных данных
5 уроков
1.
Постановка задачи
↗
2.
Загрузка данных
↗
3.
Очистка и трансформации
↗
4.
Аналитические запросы
↗
5.
Финальный отчёт
↗
Заключение
3 урока
1.
Где DuckDB использовать в реальных проектах?
↗
2.
Ограничения и когда выбрать другую БД
↗
3.
Что дальше?
↗
2. SQL и Python для проверки данных: автотесты и Great Expectations 5.00
Введение
4 урока
1.
О чём этот курс и кому он подойдёт
↗
2.
Как устроен курс и как его проходить
↗
3.
Что такое Data Quality и почему это важно
↗
4.
Архитектура проекта курса
↗
Типичные проблемы качества данных
5 уроков
1.
Какие проблемы бывают в данных
↗
2.
Почему ломаются аналитические пайплайны
↗
3.
Проверки качества данных: основные категории
↗
4.
Практика: анализ данных интернет-магазина
↗
5.
Практика: поиск проблем качества данных
↗
SQL-проверки качества данных
7 уроков
1.
Почему SQL=основной инструмент Data Quality
↗
2.
NULL (completeness=полнота)
↗
3.
Дубликаты (uniqeness=уникальность)
↗
4.
Диапазоны (validity=валидность)
↗
5.
Связность (Referential integrity)
↗
6.
Схема (schema checks)
↗
7.
Практика: пишем SQL-checks
↗
Data Quality проверки в Python
5 уроков
1.
Когда SQL-проверок недостаточно
↗
2.
Валидация данных с Pydantic
↗
3.
Проверка DataFrame с Pandera
↗
4.
Практика: validation pipeline
↗
5.
Практика: обработка ошибок данных
↗
Проверки данных с Great Expectations
5 уроков
1.
Что такое Great Expectations?
↗
2.
Типы проверок (expectations)
↗
3.
Создание validation suite
↗
4.
Data Docs и отчёты проверок
↗
5.
Практика: проверка dataset
↗
Data Observability
5 уроков
1.
Data Observability: что это такое
↗
2.
Freshness checks
↗
3.
Volume monitoring
↗
4.
Schema monitoring
↗
5.
Практика: мониторинг таблицы
↗
Интеграция проверок в Airflow
4 урока
1.
Где запускать Data Quality проверки
↗
2.
Data Quality задачи в Airflow
↗
3.
Fail pipeline при ошибке данных
↗
4.
Практика: добавляем проверки в DAG
↗
Финальный проект
3 урока
1.
Постановка задачи
↗
2.
Реализация
↗
3.
Самопроверка / эталон
↗
3. Yandex DataSphere: Аналитика в Облаке 5.00
DataSphere: от нуля до первого ноутбука
3 урока
1.
DataSphere vs Google Colab: в чём разница
↗
2.
Яндекс.Облако: регистрация и стартовый грант
↗
3.
Создаём первый проект и запускаем ноутбук
↗
Данные: загружаем, читаем, строим графики
3 урока
1.
Библиотеки: что есть и как добавить нужное
↗
2.
Загружаем .parquet и делаем первый анализ
↗
3.
Стоимость: как считается тарификация
↗
Аналитика в облаке: Object Storage, EDA, выводы
3 урока
1.
Object Storage: загружаем данные для анализа
↗
2.
EDA: пропуски, типы, распределения, выбросы
↗
3.
Object Storage: сохраняем результаты
↗
Экосистема Яндекс.Облака: что дальше
3 урока
1.
PostgreSQL: подключаемся из ноутбука
↗
2.
Как дать коллеге доступ к проекту
↗
3.
Дальше: Jobs, DataLens и аналитический стек
↗