Курс на Stepik
Обложка курса «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера» на Stepik
Бесплатно

Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера 0.000

Открыть на
STEPIK.ORG

CSV, JSON, Parquet и Avro для дата-инженера: байты и кодировки, схемы, сжатие, Arrow, эволюция, S3, качество, безопасность и production-пайплайн.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Учеников на курсе 9
Сертификаты, выданные на курсе «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Сертификатов выдано 0
Отзывы о курсе «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Отзывов получено 0
Рейтинг курса «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Рейтинг курса 0.000
Уроки в курсе «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Количество уроков 156
Тесты в курсе «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Количество квизов 675
Обновления курса «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Обновления курса
Дата публикации курса «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Дата публикации курса
Последнее обновление курса «Работа с файлами CSV, JSON, Parquet и Avro для дата-инженера»Последнее обновление
Сложность normal

Чему вы научитесь

  • объяснять путь от байтов и кодировки до записей, типов и бизнес-семантики
  • надёжно читать и записывать CSV, JSON, NDJSON, Parquet и Avro
  • работать со схемами, nested-данными, эволюцией и совместимостью producer/consumer
  • выбирать row groups, codecs, partitioning и compaction для Parquet
  • строить атомарный и идемпотентный обмен через файловые системы и S3
  • диагностировать повреждения, проверять качество и защищать чувствительные данные

О курсе

CSV, JSON, Parquet и Avro для дата-инженера: байты и кодировки, схемы, сжатие, Arrow, эволюция, S3, качество, безопасность и production-пайплайн.

Для кого этот курс

начинающие и растущие дата-инженеры, работающие с файловыми источниками; Python, pandas, Polars и Spark-разработчики, которым нужна глубина форматов; аналитические инженеры, строящие staging и Data Lake; платформенные инженеры, отвечающие за S3, Schema Registry и data contracts.

Начальные требования

базовый Python: функции, файлы, исключения и установка пакетов Python 3.12+, PyArrow, fastavro, Polars и DuckDB; окружение разбирается в курсе опыт с Data Lake или Kafka полезен, но не обязателен

Преподаватели курса

Как проходит обучение

Каждый урок проходится по циклу: понять идею, запустить и изменить пример, ответить на тест, самостоятельно решить практику и только затем свериться с разбором.

Материал выстроен последовательно, без обязательных дедлайнов. Рекомендуется вести учебный репозиторий и журнал ошибок.

Формат курса

Самостоятельный текстовый курс: подробная теория, запускаемые примеры, тесты для самопроверки, практические задачи с решениями и итоговый проект.

Что вы получите

  • полный текстовый конспект курса с рабочими примерами
  • 675 тестовых вопросов для самопроверки
  • 417 практических задач с решениями
  • итоговый проект: Production-пайплайн файлового Data Lake: безопасный приём CSV/JSON, валидация и quarantine, преобразование в Parquet/Avro, партиционирование, контрольные суммы, атомарная публикация, тесты и мониторинг.

Нагрузка

110-170 часов

Расскажите о курсе друзьям