Курс на Stepik
Обложка курса «Распределённые системы хранения, обработки данных: Hadoop, Spark» на Stepik
Бесплатно

Распределённые системы хранения, обработки данных: Hadoop, Spark 0.000

Открыть на
STEPIK.ORG

Погрузитесь в мир больших данных: от основ Hadoop и HDFS до продвинутой оптимизации запросов с помощью формата ORC. Курс проведёт вас через всю экосистему Hadoop — от распределённого хранения (HDFS) и управления ресурсами (YARN) до модели обработки MapReduce и её эволюции в Apache Spark. Вы узнаете, как Hive превращает сложные MapReduce-задачи в простые SQL-запросы, а главное — как формат ORC с его колоночным хранением, встроенными индексами и фильтрами Блума ускоряет работу с данными в десятки раз.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Распределённые системы хранения, обработки данных: Hadoop, Spark»Учеников на курсе 2
Сертификаты, выданные на курсе «Распределённые системы хранения, обработки данных: Hadoop, Spark»Сертификатов выдано 0
Отзывы о курсе «Распределённые системы хранения, обработки данных: Hadoop, Spark»Отзывов получено 0
Рейтинг курса «Распределённые системы хранения, обработки данных: Hadoop, Spark»Рейтинг курса 0.000
Уроки в курсе «Распределённые системы хранения, обработки данных: Hadoop, Spark»Количество уроков 13
Тесты в курсе «Распределённые системы хранения, обработки данных: Hadoop, Spark»Количество квизов 19
Обновления курса «Распределённые системы хранения, обработки данных: Hadoop, Spark»Обновления курса
Дата публикации курса «Распределённые системы хранения, обработки данных: Hadoop, Spark»Дата публикации курса
Последнее обновление курса «Распределённые системы хранения, обработки данных: Hadoop, Spark»Последнее обновление

Чему вы научитесь

  • Понимать предпосылки появления распределённых систем и эволюцию от DWH к Data Lake.
  • Объяснять архитектуру Hadoop и роль каждого компонента: HDFS, YARN, MapReduce.
  • Описывать принципы работы HDFS — распределённого хранения с репликацией и отказоустойчивостью.
  • Анализировать механизмы управления ресурсами в YARN и жизненный цикл приложений.
  • Понимать модель MapReduce и её применение для параллельной обработки данных.
  • Использовать HiveQL для создания таблиц и выполнения аналитических запросов в Hive.
  • Различать управляемые и внешние таблицы, понимать принципы партицирования и кластеризации.
  • Оценивать преимущества и ограничения классических инструментов экосистемы Hadoop.
  • Определять место Spark в современном ландшафте Big Data и его отличие от MapReduce.
  • Понимать внутреннее устройство формата ORC: индексацию, фильтры Блума и их роль в оптимизации запросов.

О курсе

Погрузитесь в мир больших данных: от основ Hadoop и HDFS до продвинутой оптимизации запросов с помощью формата ORC. Курс проведёт вас через всю экосистему Hadoop — от распределённого хранения (HDFS) и управления ресурсами (YARN) до модели обработки MapReduce и её эволюции в Apache Spark. Вы узнаете, как Hive превращает сложные MapReduce-задачи в простые SQL-запросы, а главное — как формат ORC с его колоночным хранением, встроенными индексами и фильтрами Блума ускоряет работу с данными в десятки раз.

Для кого этот курс

Начинающие инженеры данных (Data Engineers) — хотите понять, как устроена экосистема Big Data с нуля. Аналитики данных (Data Analysts) — работаете с большими данными через Hive и хотите ускорять свои запросы. Разработчики (Backend, Python, Java) — планируете перейти в сферу обработки больших данных. Студенты и выпускники IT-специальностей — хотите получить конкурентное преимущество на рынке. Технические менеджеры — хотите понимать, на каких технологиях строится инфраструктура данных в компании. Все, кто работает с Data Lake — и хотите превратить его из «болота» в структурированное хранилище.

Начальные требования

  • Базовое понимание SQL (SELECT, WHERE, GROUP BY) — будет достаточно.

  • Общее представление о работе с файлами и данных (что такое CSV, JSON) — приветствуется.

  • Опыт программирования не требуется, но полезно иметь базовые навыки работы с командной строкой (терминалом).

  • Знание Python или Java — не обязательно, но упростит понимание примеров с Spark.

Преподаватели курса

Расскажите о курсе друзьям