Чему вы научитесь
- объяснять путь от байтов и кодировки до записей, типов и бизнес-семантики
- надёжно читать и записывать CSV, JSON, NDJSON, Parquet и Avro
- работать со схемами, nested-данными, эволюцией и совместимостью producer/consumer
- выбирать row groups, codecs, partitioning и compaction для Parquet
- строить атомарный и идемпотентный обмен через файловые системы и S3
- диагностировать повреждения, проверять качество и защищать чувствительные данные
О курсе
CSV, JSON, Parquet и Avro для дата-инженера: байты и кодировки, схемы, сжатие, Arrow, эволюция, S3, качество, безопасность и production-пайплайн.
Для кого этот курс
начинающие и растущие дата-инженеры, работающие с файловыми источниками; Python, pandas, Polars и Spark-разработчики, которым нужна глубина форматов; аналитические инженеры, строящие staging и Data Lake; платформенные инженеры, отвечающие за S3, Schema Registry и data contracts.
Начальные требования
базовый Python: функции, файлы, исключения и установка пакетов Python 3.12+, PyArrow, fastavro, Polars и DuckDB; окружение разбирается в курсе опыт с Data Lake или Kafka полезен, но не обязателен
Преподаватели курса
Как проходит обучение
Каждый урок проходится по циклу: понять идею, запустить и изменить пример, ответить на тест, самостоятельно решить практику и только затем свериться с разбором.
Материал выстроен последовательно, без обязательных дедлайнов. Рекомендуется вести учебный репозиторий и журнал ошибок.
Формат курса
Самостоятельный текстовый курс: подробная теория, запускаемые примеры, тесты для самопроверки, практические задачи с решениями и итоговый проект.
Что вы получите
- полный текстовый конспект курса с рабочими примерами
- 675 тестовых вопросов для самопроверки
- 417 практических задач с решениями
- итоговый проект: Production-пайплайн файлового Data Lake: безопасный приём CSV/JSON, валидация и quarantine, преобразование в Parquet/Avro, партиционирование, контрольные суммы, атомарная публикация, тесты и мониторинг.
Нагрузка
110-170 часов