Чему вы научитесь
- Проектировать отказоустойчивую архитектуру Control Plane и настраивать распределенный консенсус etcd под экстремальными нагрузками.
- Управлять жизненным циклом подов через CRI-рантаймы, оптимизировать cgroups v2 и тонко распределять ресурсы нод хоста.
- Интегрировать внешние СХД через CSI-драйверы и безопасно эксплуатировать тяжелые СУБД (PostgreSQL, ClickHouse, Kafka) внутри кластера.
- Настраивать eBPF-датапланы (Cilium), BGP-маршрутизацию и высоконагруженную подсистему CoreDNS.
- Развертывать Service Mesh нового поколения (Ambient Mesh, Cilium Mesh) для реализации Zero Trust безопасности и умного L7-трафика.
- Настраивать реактивное и проактивное автомасштабирование с помощью Karpenter, HPA, VPA и KEDA без войн автоскейлеров.
- Внедрять GitOps-процессы на базе ArgoCD для управления тысячами микросервисов в Enterprise-среде.
- Защищать рантайм подов (PSA, gVisor, Kyverno), настраивать JIT RBAC и выстраивать Supply Chain безопасность артефактов.
- Строить сквозную eBPF-телеметрию, непрерывное профилирование ядра и регламентировать Day-2 операции по восстановлению Control Plane. 📊
- Проводить распределенный Chaos Engineering, симулировать аварии дата-центров и предотвращать каскадные сбои.
- Программировать кастомные CRD, создавать операторы на Go и внедрять Crossplane для концепции Platform Engineering.
- Оптимизировать экономику кластера (FinOps) на базе OpenCost и сокращать TCO инфраструктуры компании.
- Развертывать отказоустойчивый K8s на Bare-metal (Talos Linux, MetalLB) и настраивать автономную Edge/IoT маршрутизацию.
О курсе
Для кого этот курс
Начальные требования
Этот курс ориентирован на инженеров уровня Senior и Lead. Программа не содержит базовой теории и с первых минут погружает в сложные архитектурные нюансы.
Вы понимаете, как устроено декларативное описание манифестов, и умеете деплоить приложения в кластер.
Преподаватели курса
Как проходит обучение
Обучение на курсе построено вокруг глубокого самостоятельного погружения в инженерную практику, разбора реальных инцидентов и проектирования сложных систем. 🧩
Процесс обучения включает в себя несколько ключевых этапов:
Изучение детальных текстовых лекций 📖
Каждый урок представляет собой глубокий технический материал с разбором архитектурных схем, алгоритмов работы внутренних компонентов Kubernetes (API Machinery, CRI, CSI, CNI) и анализом исходного кода. Никакой "воды", только инженерная суть.
Анализ деструктивных антипаттернов 💥
Вместо шаблонных примеров вы будете разбирать реальные архитектурные ошибки, которые приводят к отказу Control Plane на больших масштабах. Вы научитесь видеть скрытые риски в конфигурациях до того, как они попадут в продакшн.
Работа с практическими регламентами (Runbooks) 🛠️
Вы получите готовые пошаговые инструкции для проведения Day-2 операций на живых кластерах. Это включает в себя сценарии аварийного восстановления etcd, "горячую" миграцию сетевых плагинов, онлайн-расширение дисков и ротацию критических сертификатов.
Разбор исторических постмортемов 🕵️
Важной частью обучения является исследование реальных масштабных аварий крупных технологических компаний. Вы научитесь применять методологию Root Cause Analysis (RCA) для поиска первопричин сбоев в распределенных системах.
Обучение проходит полностью в асинхронном формате. Вы можете изучать материалы и выполнять задания в удобном для себя темпе, совмещая учебу с основной работой.
Что вы получите
- Глубокие архитектурные знания внутреннего устройства Kubernetes уровня сеньора и архитектора.
- Коллекцию проверенных в продакшене инженерных регламентов (Runbooks) для сложных Day-2 операций.
- Готовый масштабный архитектурный проект гео-распределенной Enterprise-платформы в ваше портфолио.
- Навыки низкоуровневой диагностики и траблшутинга затяжных инфраструктурных аварий.
- Умение оптимизировать ресурсы и рассчитывать экономику облачных и bare-metal кластеров (FinOps).
- Пожизненный доступ ко всем текстовым материалам курса, архитектурным схемам и обновлениям.