Чему вы научитесь
- Формализовывать задачи обучения и инференса LLM как MDP, contextual bandit или выбор полного ответа, явно задавая состояние, действие, награду и горизонт.
- Вычислять return, функции V/Q/A, Bellman targets, Monte Carlo и TD-оценки и понимать компромисс между смещением и дисперсией.
- Применять REINFORCE, actor–critic, GAE и PPO; разбирать policy loss, value loss, clipping, entropy bonus и KL-регуляризацию.
- Различать on-policy, off-policy, imitation learning и offline RL; проверять допущения о support/coverage и интерпретировать off-policy evaluation.
- Строить пайплайны предпочтений и моделей награды; анализировать шум разметки, калибровку, смещения LLM-судей и reward hacking.
- Сравнивать RLHF, DPO и родственные preference objectives, RLVR и GRPO по источнику данных, контракту обратной связи и оценивателю.
- Проектировать верификаторы и group-relative сигналы, отличая Best-of-N и test-time search от обновления параметров политики.
- Проектировать agentic RL-среды и rollout-контракты: инструменты, частичную наблюдаемость, причины остановки, маски, версии политики и устаревание данных.
- Организовывать асинхронную RL-инфраструктуру и воспроизводимые эксперименты с checkpoint-ами, версиями данных, наград, конфигураций и логов.
- Оценивать LLM/RL-системы при сопоставимом бюджете с помощью pass@k, парных сравнений, доверительных интервалов, нескольких seed-ов и таксономии ошибок.
- Проводить проверки устойчивости и безопасности, находить переоптимизацию прокси-цели и составлять паспорт протокола для аудируемых результатов.
- Переносить формулы в notebook-эксперименты, проверять численные инварианты и объяснять ограничения и failure modes полученных результатов.
О курсе
Для кого этот курс
Начальные требования
Предполагается знакомство с основами машинного обучения: train/validation/test, функции потерь, градиентная оптимизация, переобучение и базовая вероятностная интерпретация модели.
Нужны Python и умение читать базовый PyTorch-код. Достаточно уверенно работать с тензорами, формами, broadcasting и простыми training loops.
Понадобятся основы теории вероятностей, линейной алгебры и математического анализа: распределения, условная вероятность, математическое ожидание, векторы, матрицы, производные и градиенты.
Желательно понимать устройство Transformer, токенизацию, autoregressive generation, softmax и log-probabilities. Курс «Современные LLM» даёт дополнительное углубление, но не является обязательным.
Предыдущий курс по reinforcement learning не требуется: модули 1–5 последовательно вводят необходимый классический аппарат. Знакомый с RL читатель может использовать их как ускоренное повторение.
Для практики понадобится Jupyter или Google Colab. Основные задания рассчитаны на CPU и доступное окружение; бесплатный Colab T4 покрывает короткие запуски. Платные API, мощные GPU и распределённое обучение используются только в факультативных расширениях.
Преподаватели курса
Как проходит обучение
Курс проходится в собственном темпе и прежде всего состоит из текстовых уроков с формулами, иллюстрациями, таблицами, кодом и ссылками на первоисточники.
Основной маршрут включает 13 модулей в трёх частях: фундамент и быстрое введение в классический RL; post-training и RL для LLM; инфраструктура, evaluation и безопасность.
Большинство модулей построено по повторяющемуся маршруту:
• точная постановка и контракт данных;
• механизм, формулы и малые числовые проверки;
• перенос на LLM и современные реализации;
• автопроверяемые тесты после ключевых разделов;
• аналитические и вычислительные задания;
• подробные решения, notebook и ключевые работы для дальнейшего чтения.
Тесты оцениваются автоматически. Обычные задания не являются внешней аттестацией: сначала полезно решить задачу самостоятельно, затем открыть подробное решение.
Практика разделена по ресурсным профилям. Профиль A работает на CPU и в Stepik; профиль B использует бесплатный Colab T4; факультативные B+ и C могут потребовать платный API, мощный GPU или распределённый запуск.
Ноутбуки запускаются в Colab или локально и отделяют дешёвые smoke-проверки от реальных ветвей с открытыми моделями. Расширенные эксперименты требуют отдельно фиксировать версии моделей, наборов данных, конфиг, seed и метрики.
Рекомендуемый темп — 5–7 часов в неделю, но жёсткого расписания нет. Читатель с опытом классического RL может пройти первые пять модулей ускоренно.
Что вы получите
- 13 модулей и 114 уроков: 62 лекционных урока, 39 отдельных уроков с заданиями и 13 уроков с первоисточниками.
- 750 шагов на Stepik, включая 414 заданий и самопроверок; RU- и EN-версии синхронизированы, а внутри лекций есть кликабельные оглавления.
- 151 встроенная в лекции самопроверка с условием и раскрываемым подробным решением.
- 109 концептуальных заданий в нативных форматах тестов Stepik с оценкой 1 и раскрываемыми пояснениями.
- 77 аналитических и вычислительных заданий с подробными решениями и явными допустимыми погрешностями там, где нужен численный ответ.
- 77 программных заданий для проектирования и реализации алгоритмов с раскрываемыми эталонными решениями без обязательного выполнения кода на платформе.
- 13 локализованных notebooks — по одному на модуль; они прикреплены к соответствующим лекциям и подходят для локального Jupyter или Colab.
- Подробные разборы, отрицательные примеры, проверки допущений и диагностика failure modes вместо одного краткого комментария к ответу.
- 13 отдельных уроков «Источники» с ключевыми статьями, первоисточниками, статусом утверждений и границами переносимости результатов.
- Практический маршрут от MDP, бандитов, REINFORCE и PPO до reward models, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры, evaluation и safety.