Курс на Stepik
Обложка курса «Reinforcement Learning для LLM» на Stepik
Бесплатно

Reinforcement Learning для LLM 0.000

Открыть на
STEPIK.ORG

Инженерный курс по обучению с подкреплением для LLM и систем с агентами: от MDP, бандитов, REINFORCE/PPO и offline RL до моделей награды, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры и evaluation. Курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами и ноутбуки. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Reinforcement Learning для LLM»Учеников на курсе 5
Сертификаты, выданные на курсе «Reinforcement Learning для LLM»Сертификатов выдано 0
Отзывы о курсе «Reinforcement Learning для LLM»Отзывов получено 0
Рейтинг курса «Reinforcement Learning для LLM»Рейтинг курса 0.000
Уроки в курсе «Reinforcement Learning для LLM»Количество уроков 114
Тесты в курсе «Reinforcement Learning для LLM»Количество квизов 136
Обновления курса «Reinforcement Learning для LLM»Обновления курса
Дата публикации курса «Reinforcement Learning для LLM»Дата публикации курса
Последнее обновление курса «Reinforcement Learning для LLM»Последнее обновление
Сложность normal

Чему вы научитесь

  • Формализовывать задачи обучения и инференса LLM как MDP, contextual bandit или выбор полного ответа, явно задавая состояние, действие, награду и горизонт.
  • Вычислять return, функции V/Q/A, Bellman targets, Monte Carlo и TD-оценки и понимать компромисс между смещением и дисперсией.
  • Применять REINFORCE, actor–critic, GAE и PPO; разбирать policy loss, value loss, clipping, entropy bonus и KL-регуляризацию.
  • Различать on-policy, off-policy, imitation learning и offline RL; проверять допущения о support/coverage и интерпретировать off-policy evaluation.
  • Строить пайплайны предпочтений и моделей награды; анализировать шум разметки, калибровку, смещения LLM-судей и reward hacking.
  • Сравнивать RLHF, DPO и родственные preference objectives, RLVR и GRPO по источнику данных, контракту обратной связи и оценивателю.
  • Проектировать верификаторы и group-relative сигналы, отличая Best-of-N и test-time search от обновления параметров политики.
  • Проектировать agentic RL-среды и rollout-контракты: инструменты, частичную наблюдаемость, причины остановки, маски, версии политики и устаревание данных.
  • Организовывать асинхронную RL-инфраструктуру и воспроизводимые эксперименты с checkpoint-ами, версиями данных, наград, конфигураций и логов.
  • Оценивать LLM/RL-системы при сопоставимом бюджете с помощью pass@k, парных сравнений, доверительных интервалов, нескольких seed-ов и таксономии ошибок.
  • Проводить проверки устойчивости и безопасности, находить переоптимизацию прокси-цели и составлять паспорт протокола для аудируемых результатов.
  • Переносить формулы в notebook-эксперименты, проверять численные инварианты и объяснять ограничения и failure modes полученных результатов.

О курсе

Инженерный курс по обучению с подкреплением для LLM и систем с агентами: от MDP, бандитов, REINFORCE/PPO и offline RL до моделей награды, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры и evaluation. Курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами и ноутбуки. Курс входит в развивающуюся серию об ML и LLM.

Для кого этот курс

Для ML-, AI- и LLM-инженеров, которым нужен системный маршрут от классического RL к современному post-training языковых моделей. Для специалистов по alignment, preference optimization, RLVR, reasoning и агентным системам, которые хотят понимать контракты данных, политики и награды. Для исследователей, студентов старших курсов, магистрантов, аспирантов и самостоятельно обучающихся специалистов, которым нужен мост от статей к воспроизводимым экспериментам. Для практиков, уже использующих SFT, DPO, PPO, GRPO или LLM-судей и желающих точнее понимать допущения, диагностику и failure modes этих методов. Курс не рассчитан на первое знакомство с Python или машинным обучением и не является кратким руководством по одному фреймворку.

Начальные требования

Предполагается знакомство с основами машинного обучения: train/validation/test, функции потерь, градиентная оптимизация, переобучение и базовая вероятностная интерпретация модели.

Нужны Python и умение читать базовый PyTorch-код. Достаточно уверенно работать с тензорами, формами, broadcasting и простыми training loops.

Понадобятся основы теории вероятностей, линейной алгебры и математического анализа: распределения, условная вероятность, математическое ожидание, векторы, матрицы, производные и градиенты.

Желательно понимать устройство Transformer, токенизацию, autoregressive generation, softmax и log-probabilities. Курс «Современные LLM» даёт дополнительное углубление, но не является обязательным.

Предыдущий курс по reinforcement learning не требуется: модули 1–5 последовательно вводят необходимый классический аппарат. Знакомый с RL читатель может использовать их как ускоренное повторение.

Для практики понадобится Jupyter или Google Colab. Основные задания рассчитаны на CPU и доступное окружение; бесплатный Colab T4 покрывает короткие запуски. Платные API, мощные GPU и распределённое обучение используются только в факультативных расширениях.

Преподаватели курса

Как проходит обучение

Курс проходится в собственном темпе и прежде всего состоит из текстовых уроков с формулами, иллюстрациями, таблицами, кодом и ссылками на первоисточники.

Основной маршрут включает 13 модулей в трёх частях: фундамент и быстрое введение в классический RL; post-training и RL для LLM; инфраструктура, evaluation и безопасность.

Большинство модулей построено по повторяющемуся маршруту:

• точная постановка и контракт данных;
• механизм, формулы и малые числовые проверки;
• перенос на LLM и современные реализации;
• автопроверяемые тесты после ключевых разделов;
• аналитические и вычислительные задания;
• подробные решения, notebook и ключевые работы для дальнейшего чтения.
Тесты оцениваются автоматически. Обычные задания не являются внешней аттестацией: сначала полезно решить задачу самостоятельно, затем открыть подробное решение.

Практика разделена по ресурсным профилям. Профиль A работает на CPU и в Stepik; профиль B использует бесплатный Colab T4; факультативные B+ и C могут потребовать платный API, мощный GPU или распределённый запуск.

Ноутбуки запускаются в Colab или локально и отделяют дешёвые smoke-проверки от реальных ветвей с открытыми моделями. Расширенные эксперименты требуют отдельно фиксировать версии моделей, наборов данных, конфиг, seed и метрики.

Рекомендуемый темп — 5–7 часов в неделю, но жёсткого расписания нет. Читатель с опытом классического RL может пройти первые пять модулей ускоренно.

Что вы получите

  • 13 модулей и 114 уроков: 62 лекционных урока, 39 отдельных уроков с заданиями и 13 уроков с первоисточниками.
  • 750 шагов на Stepik, включая 414 заданий и самопроверок; RU- и EN-версии синхронизированы, а внутри лекций есть кликабельные оглавления.
  • 151 встроенная в лекции самопроверка с условием и раскрываемым подробным решением.
  • 109 концептуальных заданий в нативных форматах тестов Stepik с оценкой 1 и раскрываемыми пояснениями.
  • 77 аналитических и вычислительных заданий с подробными решениями и явными допустимыми погрешностями там, где нужен численный ответ.
  • 77 программных заданий для проектирования и реализации алгоритмов с раскрываемыми эталонными решениями без обязательного выполнения кода на платформе.
  • 13 локализованных notebooks — по одному на модуль; они прикреплены к соответствующим лекциям и подходят для локального Jupyter или Colab.
  • Подробные разборы, отрицательные примеры, проверки допущений и диагностика failure modes вместо одного краткого комментария к ответу.
  • 13 отдельных уроков «Источники» с ключевыми статьями, первоисточниками, статусом утверждений и границами переносимости результатов.
  • Практический маршрут от MDP, бандитов, REINFORCE и PPO до reward models, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры, evaluation и safety.

Нагрузка

5–7 часов в неделю

Расскажите о курсе друзьям