Курс на Stepik
Обложка курса «Современные LLM» на Stepik
15 000 ₽

Современные LLM 0.000

Открыть на
STEPIK.ORG

Инженерный курс о современных LLM — от токенизации, RoPE, attention, MoE и альтернатив Transformer до pretraining, KV-кэшей, квантизации, SFT, RLHF/DPO/GRPO, reasoning, RAG, агентов и evaluation. Платный курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами, проверенные ноутбуки и собственную MiniLLM (dense S, M и L и их MoE-близнецы) от данных до абляций. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Современные LLM»Учеников на курсе 0
Сертификаты, выданные на курсе «Современные LLM»Сертификатов выдано 0
Отзывы о курсе «Современные LLM»Отзывов получено 0
Рейтинг курса «Современные LLM»Рейтинг курса 0.000
Уроки в курсе «Современные LLM»Количество уроков 368
Тесты в курсе «Современные LLM»Количество квизов 299
Стоимость курса «Современные LLM»Стоимость курса 15 000 ₽
Обновления курса «Современные LLM»Обновления курса
Дата публикации курса «Современные LLM»Дата публикации курса
Последнее обновление курса «Современные LLM»Последнее обновление
Сложность normal

Чему вы научитесь

«Современные LLM» — инженерный курс о полном жизненном цикле языковой модели: от данных, токенизации и архитектуры до post-training, эффективного инференса, evaluation и прикладных систем.

Курс нужен не для запоминания очередного списка моделей. Его цель — дать систематику, с которой можно читать model card и технический отчёт, проверять арифметику архитектуры, видеть цену проектного решения и отличать устойчивый механизм от датированного рыночного среза.

Маршрут начинается с современного ландшафта LLM и базовых контрактов decoder-only Transformer. Далее рассматриваются токенизация и эмбеддинги, позиционные кодировки, attention, нормализация и активации, MoE, SSM/Mamba и диффузионные LLM; затем — данные и pretraining, KV-кэши, speculative decoding, квантизация, SFT, preference optimization, reasoning и test-time compute, multimodality, RAG, агенты и evaluation.

Формулы связываются с проверяемым кодом. Ноутбуки показывают механизмы, численную устойчивость, батчинг, контрольные примеры и воспроизводимость. Это инженерно аккуратный учебный код, а не обещание production-ready реализации: специализированные GPU-ядра, распределённое обучение и промышленный serving требуют отдельной оптимизации под модель, runtime и железо.

Платная версия на Stepik включает структурированный маршрут, автопроверяемые вопросы, аналитические и вычислительные упражнения, подробные решения, проверенные RU-ноутбуки, отдельные демонстрации к проектным упражнениям и итоговый Capstone. В Capstone вы собираете компактную MiniLLM от данных и byte-level BPE до post-training, инференса и контролируемых абляций. Внешней оценки проекта нет: итог фиксируется и оценивается самостоятельно.

Лекционные тексты и иллюстрации без тестов, упражнений и практического notebook-маршрута будут опубликованы открыто на GitHub и, возможно, на отдельном сайте. Русская и английская версии курса являются самостоятельными и синхронизированными изданиями.

«Современные LLM» входит в развивающуюся серию самостоятельных курсов об ML и LLM. Сейчас вместе с ним в серию входят «Теория информации для машинного обучения от NLP и LLM до CV и RL» и «Reinforcement Learning для LLM». Серия может пополняться новыми курсами; каждый из них можно проходить отдельно, а перекрёстные ссылки предлагают дополнительное углубление, а не задают обязательные зависимости.

О курсе

Инженерный курс о современных LLM — от токенизации, RoPE, attention, MoE и альтернатив Transformer до pretraining, KV-кэшей, квантизации, SFT, RLHF/DPO/GRPO, reasoning, RAG, агентов и evaluation. Платный курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами, проверенные ноутбуки и собственную MiniLLM (dense S, M и L и их MoE-близнецы) от данных до абляций. Курс входит в развивающуюся серию об ML и LLM.

Для кого этот курс

Для ML-, AI- и LLM-инженеров, которым нужна целостная карта современных архитектур, обучения, инференса и evaluation вместо набора разрозненных рецептов. Для специалистов по NLP, retrieval/RAG, агентам и мультимодальным системам, которые хотят понимать контракты между моделью и прикладным контуром. Для исследователей, студентов старших курсов, магистрантов, аспирантов и самостоятельно обучающихся специалистов, которым нужен мост от статей к воспроизводимым экспериментам. Для разработчиков, уже использующих LLM через API или open-weight модели и желающих перейти от настройки параметров к пониманию механизмов и инженерных компромиссов. Курс не рассчитан на первое знакомство с программированием или машинным обучением и не является кратким руководством по одному фреймворку или API.

Начальные требования

Предполагается знакомство с основами машинного обучения: train/validation/test, функция потерь, градиентный спуск, переобучение и базовая вероятностная интерпретация модели.

Нужны основы Python и умение читать PyTorch-код. Достаточно уверенно работать с тензорами, формами, broadcasting и простыми training loops.

Понадобятся основы линейной алгебры и математического анализа: векторы, матрицы, скалярные произведения, производные, градиенты и softmax. Теория вероятностей нужна на уровне распределений, условной вероятности и математического ожидания.

Знакомство с Transformer полезно, но не обязательно: справочный модуль 18 даёт подробный маршрут по базовой encoder–decoder архитектуре, attention и формулам. Его можно пройти перед основным модулем 1.

Для практики понадобится Jupyter или Google Colab. Основные демонстрации и smoke-маршруты рассчитаны на доступное окружение; GPU полезен для расширенных запусков, но не требуется для чтения теории и большинства контрольных экспериментов.

Опыт с CUDA, распределённым обучением, production-serving или reinforcement learning не требуется: границы этих специализированных дисциплин обозначаются отдельно.

Преподаватели курса

Как проходит обучение

Курс проходится в собственном темпе и прежде всего состоит из текстовых уроков с формулами, иллюстрациями, таблицами и ссылками на первоисточники.

Основной маршрут включает 17 модулей. Дополнительная ветвь 7b посвящена диффузионным LLM, модуль 18 служит справочником по базовому Transformer, а последний модуль содержит итоговый Capstone.

Большинство модулей построено по повторяющемуся маршруту:

• инженерный вопрос и точная постановка;
• механизм, формулы и числовые проверки;
• современные реализации и границы применимости;
• автопроверяемые тесты после ключевых разделов;
• аналитические, вычислительные и проектные упражнения;
• подробные решения, notebook и ключевые работы для дальнейшего чтения.
Тесты оцениваются автоматически. Обычные упражнения не являются внешней аттестацией: сначала полезно решить задачу самостоятельно, затем открыть подробное решение. Проектные упражнения остаются отдельным практическим маршрутом; для части из них доступны демонстрационные ноутбуки.

Ноутбуки существуют отдельно для русского и английского курсов и запускаются в Colab или локально. Они ориентированы на проверяемые механизмы и небольшие эксперименты; расширенные профили могут потребовать GPU.

Capstone объединяет pretraining, post-training, inference и ablations в проекте MiniLLM. Проект не проверяется извне: вы сохраняете конфиг, seed, метрики, итоговые веса или checkpoint, составляете отчёт и используете таблицу самооценки.

Рекомендуемый темп — 5–7 часов в неделю, но жёсткого расписания нет. Справочный модуль и дополнительные углубления можно читать выборочно.

Что вы получите

  • 368 текстовых уроков: системный маршрут от базового Transformer и токенизации до pretraining, post-training, эффективного инференса, RAG, агентов и evaluation.
  • 299 автопроверяемых тестовых вопросов по всем разделам курса.
  • 137 вопросов для самопроверки с раскрываемыми ответами.
  • 65 аналитических и вычислительных упражнений с подробными решениями.
  • 36 отдельных проектных упражнений и 17 project-demo notebooks: небольшие воспроизводимые реализации не подменяют полный проект, а показывают pipeline, метрики, инварианты и negative controls.
  • 19 основных notebooks — по одному на каждый учебный трек M1–M18 и дополнительный M7b; все проверены исполнением и подготовлены для локального Jupyter или Colab.
  • 4 Capstone notebooks, образующие сквозной проект: данные, byte-level BPE и pretraining; SFT и DPO; inference с KV/prefix cache, speculative decoding и квантизацией; контролируемые ablations.
  • Полный учебный код MiniLLM: data pipeline, tokenizer, dense/MoE decoder, обучение и resume, post-training, генерация, кэши, speculative decoding, fake quantization, probes и отчётность.
  • Масштабируемые профили MiniLLM: dense S, M и L и их MoE-близнецы — от S на 6.3M параметров до dense L на 1.02B и L-MoE примерно с 1.06B активных параметров на токен (10.02B total во всех экспертах); крупные профили служат проверяемыми compute/memory passports и не требуют полного обучения.
  • Код MiniLLM поставляется с полным набором проверок корректности архитектуры, обучения, данных, post-training и inference.
  • Списки ключевых статей и первоисточников, инженерные таблицы и практика измерения памяти, задержки, параметров, loss и воспроизводимости вместо оценки по одной итоговой метрике.

Нагрузка

5–7 часов в неделю

Расскажите о курсе друзьям