Чему вы научитесь
«Современные LLM» — инженерный курс о полном жизненном цикле языковой модели: от данных, токенизации и архитектуры до post-training, эффективного инференса, evaluation и прикладных систем.
Курс нужен не для запоминания очередного списка моделей. Его цель — дать систематику, с которой можно читать model card и технический отчёт, проверять арифметику архитектуры, видеть цену проектного решения и отличать устойчивый механизм от датированного рыночного среза.
Маршрут начинается с современного ландшафта LLM и базовых контрактов decoder-only Transformer. Далее рассматриваются токенизация и эмбеддинги, позиционные кодировки, attention, нормализация и активации, MoE, SSM/Mamba и диффузионные LLM; затем — данные и pretraining, KV-кэши, speculative decoding, квантизация, SFT, preference optimization, reasoning и test-time compute, multimodality, RAG, агенты и evaluation.
Формулы связываются с проверяемым кодом. Ноутбуки показывают механизмы, численную устойчивость, батчинг, контрольные примеры и воспроизводимость. Это инженерно аккуратный учебный код, а не обещание production-ready реализации: специализированные GPU-ядра, распределённое обучение и промышленный serving требуют отдельной оптимизации под модель, runtime и железо.
Платная версия на Stepik включает структурированный маршрут, автопроверяемые вопросы, аналитические и вычислительные упражнения, подробные решения, проверенные RU-ноутбуки, отдельные демонстрации к проектным упражнениям и итоговый Capstone. В Capstone вы собираете компактную MiniLLM от данных и byte-level BPE до post-training, инференса и контролируемых абляций. Внешней оценки проекта нет: итог фиксируется и оценивается самостоятельно.
Лекционные тексты и иллюстрации без тестов, упражнений и практического notebook-маршрута будут опубликованы открыто на GitHub и, возможно, на отдельном сайте. Русская и английская версии курса являются самостоятельными и синхронизированными изданиями.
«Современные LLM» входит в развивающуюся серию самостоятельных курсов об ML и LLM. Сейчас вместе с ним в серию входят «Теория информации для машинного обучения от NLP и LLM до CV и RL» и «Reinforcement Learning для LLM». Серия может пополняться новыми курсами; каждый из них можно проходить отдельно, а перекрёстные ссылки предлагают дополнительное углубление, а не задают обязательные зависимости.
О курсе
Для кого этот курс
Начальные требования
Предполагается знакомство с основами машинного обучения: train/validation/test, функция потерь, градиентный спуск, переобучение и базовая вероятностная интерпретация модели.
Нужны основы Python и умение читать PyTorch-код. Достаточно уверенно работать с тензорами, формами, broadcasting и простыми training loops.
Понадобятся основы линейной алгебры и математического анализа: векторы, матрицы, скалярные произведения, производные, градиенты и softmax. Теория вероятностей нужна на уровне распределений, условной вероятности и математического ожидания.
Знакомство с Transformer полезно, но не обязательно: справочный модуль 18 даёт подробный маршрут по базовой encoder–decoder архитектуре, attention и формулам. Его можно пройти перед основным модулем 1.
Для практики понадобится Jupyter или Google Colab. Основные демонстрации и smoke-маршруты рассчитаны на доступное окружение; GPU полезен для расширенных запусков, но не требуется для чтения теории и большинства контрольных экспериментов.
Опыт с CUDA, распределённым обучением, production-serving или reinforcement learning не требуется: границы этих специализированных дисциплин обозначаются отдельно.
Преподаватели курса
Как проходит обучение
Курс проходится в собственном темпе и прежде всего состоит из текстовых уроков с формулами, иллюстрациями, таблицами и ссылками на первоисточники.
Основной маршрут включает 17 модулей. Дополнительная ветвь 7b посвящена диффузионным LLM, модуль 18 служит справочником по базовому Transformer, а последний модуль содержит итоговый Capstone.
Большинство модулей построено по повторяющемуся маршруту:
• инженерный вопрос и точная постановка;
• механизм, формулы и числовые проверки;
• современные реализации и границы применимости;
• автопроверяемые тесты после ключевых разделов;
• аналитические, вычислительные и проектные упражнения;
• подробные решения, notebook и ключевые работы для дальнейшего чтения.
Тесты оцениваются автоматически. Обычные упражнения не являются внешней аттестацией: сначала полезно решить задачу самостоятельно, затем открыть подробное решение. Проектные упражнения остаются отдельным практическим маршрутом; для части из них доступны демонстрационные ноутбуки.
Ноутбуки существуют отдельно для русского и английского курсов и запускаются в Colab или локально. Они ориентированы на проверяемые механизмы и небольшие эксперименты; расширенные профили могут потребовать GPU.
Capstone объединяет pretraining, post-training, inference и ablations в проекте MiniLLM. Проект не проверяется извне: вы сохраняете конфиг, seed, метрики, итоговые веса или checkpoint, составляете отчёт и используете таблицу самооценки.
Рекомендуемый темп — 5–7 часов в неделю, но жёсткого расписания нет. Справочный модуль и дополнительные углубления можно читать выборочно.
Что вы получите
- 368 текстовых уроков: системный маршрут от базового Transformer и токенизации до pretraining, post-training, эффективного инференса, RAG, агентов и evaluation.
- 299 автопроверяемых тестовых вопросов по всем разделам курса.
- 137 вопросов для самопроверки с раскрываемыми ответами.
- 65 аналитических и вычислительных упражнений с подробными решениями.
- 36 отдельных проектных упражнений и 17 project-demo notebooks: небольшие воспроизводимые реализации не подменяют полный проект, а показывают pipeline, метрики, инварианты и negative controls.
- 19 основных notebooks — по одному на каждый учебный трек M1–M18 и дополнительный M7b; все проверены исполнением и подготовлены для локального Jupyter или Colab.
- 4 Capstone notebooks, образующие сквозной проект: данные, byte-level BPE и pretraining; SFT и DPO; inference с KV/prefix cache, speculative decoding и квантизацией; контролируемые ablations.
- Полный учебный код MiniLLM: data pipeline, tokenizer, dense/MoE decoder, обучение и resume, post-training, генерация, кэши, speculative decoding, fake quantization, probes и отчётность.
- Масштабируемые профили MiniLLM: dense S, M и L и их MoE-близнецы — от S на 6.3M параметров до dense L на 1.02B и L-MoE примерно с 1.06B активных параметров на токен (10.02B total во всех экспертах); крупные профили служат проверяемыми compute/memory passports и не требуют полного обучения.
- Код MiniLLM поставляется с полным набором проверок корректности архитектуры, обучения, данных, post-training и inference.
- Списки ключевых статей и первоисточников, инженерные таблицы и практика измерения памяти, задержки, параметров, loss и воспроизводимости вместо оценки по одной итоговой метрике.