Курс на Stepik
Обложка курса «Reinforcement Learning для LLM» на Stepik
5 000 ₽

Reinforcement Learning для LLM 0.000

Открыть на
STEPIK.ORG

Инженерный курс по обучению с подкреплением для LLM и систем с агентами: от MDP, бандитов, REINFORCE/PPO и offline RL до моделей награды, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры и evaluation. Платный курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами и ноутбуки. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Reinforcement Learning для LLM»Учеников на курсе 0
Сертификаты, выданные на курсе «Reinforcement Learning для LLM»Сертификатов выдано 0
Отзывы о курсе «Reinforcement Learning для LLM»Отзывов получено 0
Рейтинг курса «Reinforcement Learning для LLM»Рейтинг курса 0.000
Уроки в курсе «Reinforcement Learning для LLM»Количество уроков 114
Тесты в курсе «Reinforcement Learning для LLM»Количество квизов 136
Задачи с кодом в курсе «Reinforcement Learning для LLM»Количество задач с кодом 7
Стоимость курса «Reinforcement Learning для LLM»Стоимость курса 5 000 ₽
Обновления курса «Reinforcement Learning для LLM»Обновления курса
Дата публикации курса «Reinforcement Learning для LLM»Дата публикации курса
Последнее обновление курса «Reinforcement Learning для LLM»Последнее обновление
Сложность normal

Чему вы научитесь

  • Формализовывать задачи обучения и инференса LLM как MDP, contextual bandit или выбор полного ответа, явно задавая состояние, действие, награду и горизонт.
  • Вычислять return, функции V/Q/A, Bellman targets, Monte Carlo и TD-оценки и понимать компромисс между смещением и дисперсией.
  • Применять REINFORCE, actor–critic, GAE и PPO; разбирать policy loss, value loss, clipping, entropy bonus и KL-регуляризацию.
  • Различать on-policy, off-policy, imitation learning и offline RL; проверять допущения о support/coverage и интерпретировать off-policy evaluation.
  • Строить пайплайны предпочтений и моделей награды; анализировать шум разметки, калибровку, смещения LLM-судей и reward hacking.
  • Сравнивать RLHF, DPO и родственные preference objectives, RLVR и GRPO по источнику данных, контракту обратной связи и оценивателю.
  • Проектировать верификаторы и group-relative сигналы, отличая Best-of-N и test-time search от обновления параметров политики.
  • Проектировать agentic RL-среды и rollout-контракты: инструменты, частичную наблюдаемость, причины остановки, маски, версии политики и устаревание данных.
  • Организовывать асинхронную RL-инфраструктуру и воспроизводимые эксперименты с checkpoint-ами, версиями данных, наград, конфигураций и логов.
  • Оценивать LLM/RL-системы при сопоставимом бюджете с помощью pass@k, парных сравнений, доверительных интервалов, нескольких seed-ов и таксономии ошибок.
  • Проводить проверки устойчивости и безопасности, находить переоптимизацию прокси-цели и составлять паспорт протокола для аудируемых результатов.
  • Переносить формулы в notebook-эксперименты, проверять численные инварианты и объяснять ограничения и failure modes полученных результатов.

О курсе

Инженерный курс по обучению с подкреплением для LLM и систем с агентами: от MDP, бандитов, REINFORCE/PPO и offline RL до моделей награды, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры и evaluation. Платный курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами и ноутбуки. Курс входит в развивающуюся серию об ML и LLM.

Для кого этот курс

Для ML-, AI- и LLM-инженеров, которым нужен системный маршрут от классического RL к современному post-training языковых моделей. Для специалистов по alignment, preference optimization, RLVR, reasoning и агентным системам, которые хотят понимать контракты данных, политики и награды. Для исследователей, студентов старших курсов, магистрантов, аспирантов и самостоятельно обучающихся специалистов, которым нужен мост от статей к воспроизводимым экспериментам. Для практиков, уже использующих SFT, DPO, PPO, GRPO или LLM-судей и желающих точнее понимать допущения, диагностику и failure modes этих методов. Курс не рассчитан на первое знакомство с Python или машинным обучением и не является кратким руководством по одному фреймворку.

Начальные требования

Предполагается знакомство с основами машинного обучения: train/validation/test, функции потерь, градиентная оптимизация, переобучение и базовая вероятностная интерпретация модели.

Нужны Python и умение читать базовый PyTorch-код. Достаточно уверенно работать с тензорами, формами, broadcasting и простыми training loops.

Понадобятся основы теории вероятностей, линейной алгебры и математического анализа: распределения, условная вероятность, математическое ожидание, векторы, матрицы, производные и градиенты.

Желательно понимать устройство Transformer, токенизацию, autoregressive generation, softmax и log-probabilities. Курс «Современные LLM» даёт дополнительное углубление, но не является обязательным.

Предыдущий курс по reinforcement learning не требуется: модули 1–5 последовательно вводят необходимый классический аппарат. Знакомый с RL читатель может использовать их как ускоренное повторение.

Для практики понадобится Jupyter или Google Colab. Основные задания рассчитаны на CPU и доступное окружение; бесплатный Colab T4 покрывает короткие запуски. Платные API, мощные GPU и распределённое обучение используются только в факультативных расширениях.

Преподаватели курса

Как проходит обучение

Курс проходится в собственном темпе и прежде всего состоит из текстовых уроков с формулами, иллюстрациями, таблицами, кодом и ссылками на первоисточники.

Основной маршрут включает 13 модулей в трёх частях: фундамент и быстрое введение в классический RL; post-training и RL для LLM; инфраструктура, evaluation и безопасность.

Большинство модулей построено по повторяющемуся маршруту:

• точная постановка и контракт данных;
• механизм, формулы и малые числовые проверки;
• перенос на LLM и современные реализации;
• автопроверяемые тесты после ключевых разделов;
• аналитические и вычислительные задания;
• подробные решения, notebook и ключевые работы для дальнейшего чтения.
Тесты оцениваются автоматически. Обычные задания не являются внешней аттестацией: сначала полезно решить задачу самостоятельно, затем открыть подробное решение.

Практика разделена по ресурсным профилям. Профиль A работает на CPU и в Stepik; профиль B использует бесплатный Colab T4; факультативные B+ и C могут потребовать платный API, мощный GPU или распределённый запуск.

Ноутбуки запускаются в Colab или локально и отделяют дешёвые smoke-проверки от реальных ветвей с открытыми моделями. Расширенные эксперименты требуют отдельно фиксировать версии моделей, наборов данных, конфиг, seed и метрики.

Рекомендуемый темп — 5–7 часов в неделю, но жёсткого расписания нет. Читатель с опытом классического RL может пройти первые пять модулей ускоренно.

Что вы получите

  • 13 модулей и 114 уроков: 62 лекционных урока, 39 отдельных уроков с заданиями и 13 уроков с первоисточниками.
  • 750 шагов на Stepik, включая 414 заданий и самопроверок; RU- и EN-версии синхронизированы, а внутри лекций есть кликабельные оглавления.
  • 151 встроенная в лекции самопроверка с условием и раскрываемым подробным решением.
  • 109 концептуальных заданий в нативных форматах тестов Stepik с оценкой 1 и раскрываемыми пояснениями.
  • 77 аналитических и вычислительных заданий с подробными решениями и явными допустимыми погрешностями там, где нужен численный ответ.
  • 77 программных заданий для проектирования и реализации алгоритмов с раскрываемыми эталонными решениями без обязательного выполнения кода на платформе.
  • 13 локализованных notebooks — по одному на модуль; они прикреплены к соответствующим лекциям и подходят для локального Jupyter или Colab.
  • Подробные разборы, отрицательные примеры, проверки допущений и диагностика failure modes вместо одного краткого комментария к ответу.
  • 13 отдельных уроков «Источники» с ключевыми статьями, первоисточниками, статусом утверждений и границами переносимости результатов.
  • Практический маршрут от MDP, бандитов, REINFORCE и PPO до reward models, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры, evaluation и safety.

Нагрузка

5–7 часов в неделю

Расскажите о курсе друзьям