Чему вы научитесь
- Понимать предпосылки появления распределённых систем и эволюцию от DWH к Data Lake.
- Объяснять архитектуру Hadoop и роль каждого компонента: HDFS, YARN, MapReduce.
- Описывать принципы работы HDFS — распределённого хранения с репликацией и отказоустойчивостью.
- Анализировать механизмы управления ресурсами в YARN и жизненный цикл приложений.
- Понимать модель MapReduce и её применение для параллельной обработки данных.
- Использовать HiveQL для создания таблиц и выполнения аналитических запросов в Hive.
- Различать управляемые и внешние таблицы, понимать принципы партицирования и кластеризации.
- Оценивать преимущества и ограничения классических инструментов экосистемы Hadoop.
- Определять место Spark в современном ландшафте Big Data и его отличие от MapReduce.
- Понимать внутреннее устройство формата ORC: индексацию, фильтры Блума и их роль в оптимизации запросов.
О курсе
Для кого этот курс
Начальные требования
-
Базовое понимание SQL (SELECT, WHERE, GROUP BY) — будет достаточно.
-
Общее представление о работе с файлами и данных (что такое CSV, JSON) — приветствуется.
-
Опыт программирования не требуется, но полезно иметь базовые навыки работы с командной строкой (терминалом).
-
Знание Python или Java — не обязательно, но упростит понимание примеров с Spark.