Курс на Stepik
Обложка курса «Reinforcement Learning для LLM» на Stepik
5 000 ₽

Reinforcement Learning для LLM 0.000

Открыть на
STEPIK.ORG

Инженерный курс по обучению с подкреплением для LLM и систем с агентами: от MDP, бандитов, REINFORCE/PPO и offline RL до моделей награды, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры и evaluation. Платный курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами и ноутбуки. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Reinforcement Learning для LLM»Учеников на курсе 0
Сертификаты, выданные на курсе «Reinforcement Learning для LLM»Сертификатов выдано 0
Отзывы о курсе «Reinforcement Learning для LLM»Отзывов получено 0
Рейтинг курса «Reinforcement Learning для LLM»Рейтинг курса 0.000
Уроки в курсе «Reinforcement Learning для LLM»Количество уроков 114
Тесты в курсе «Reinforcement Learning для LLM»Количество квизов 136
Задачи с кодом в курсе «Reinforcement Learning для LLM»Количество задач с кодом 7
Стоимость курса «Reinforcement Learning для LLM»Стоимость курса 5 000 ₽
Обновления курса «Reinforcement Learning для LLM»Обновления курса
Дата публикации курса «Reinforcement Learning для LLM»Дата публикации курса
Последнее обновление курса «Reinforcement Learning для LLM»Последнее обновление
Сложность normal

Содержание курса

Разделы в курсе «Reinforcement Learning для LLM» 13 разделов Уроки в курсе «Reinforcement Learning для LLM» 114 уроков Тесты в курсе «Reinforcement Learning для LLM» 136 тестов Задачи в курсе «Reinforcement Learning для LLM» 7 задач Последнее обновление курса «Reinforcement Learning для LLM» обн. 9 августа 2026

Введение: Reinforcement Learning для LLM

8 уроков
1. Минимальный язык обучения с подкреплением
2. Какую RL-постановку выбрать для LLM
3. Современная карта дообучения LLM
4. Практика и первые численные эксперименты
5. Концептуальные задания
6. Аналитические задания
7. Программные задания
8. Источники и дальнейшее чтение

Состояние, ценность и уравнения Беллмана

8 уроков
1. От истории к состоянию, затем к ценности
2. Уравнения Беллмана: оценивание и улучшение
3. Оценивание без модели: от полной траектории к бутстрэппингу
4. Управление: текущая и целевая политики
5. Концептуальные задания
6. Аналитические задания
7. Программные задания
8. Источники и дальнейшее чтение

Бандиты, исследование и одношаговые решения

8 уроков
1. Одношаговое решение и цена незнания
2. Исследование, направляемое неопределённостью
3. Контекстные бандиты и оценивание по журналам
4. Энтропия, температура и несколько кандидатов
5. Концептуальные задания
6. Аналитические задания
7. Программные задания
8. Источники и дальнейшее чтение

Градиенты политики: от REINFORCE к PPO

9 уроков
1. Оценивание градиента политики и REINFORCE
2. Опорные уровни и групповые оценки
3. Актор–критик и обобщённое оценивание преимущества
4. От старой политики к PPO
5. Мост к обучению LLM
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Фиксированные данные: имитация, глубокие Q-методы и офлайн-RL

9 уроков
1. Имитационное обучение и SFT
2. DQN: Q-learning с нейросетью
3. Офлайн-RL: что можно узнать из фиксированного журнала
4. Decision Transformer: политика как условная модель траектории
5. Карта фиксированных данных для дообучения LLM
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

LLM как политика: токены, логарифмы вероятностей и KL

9 уроков
1. Токеновый MDP без скрытых предположений
2. Логиты, маски и логарифмы вероятностей
3. KL относительно базовой политики
4. Фактическая политика поведения при генерации
5. Контракт роллаута для RL с проверяемыми наградами
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Модели награды и данные о предпочтениях

9 уроков
1. Обратная связь как данные, а не как готовая истина
2. Обучение скалярной модели награды
3. Оценивание: порядок, вероятность, перенос и неопределённость
4. Переоптимизация прокси-награды
5. Современные системы вознаграждения
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

RLHF и прямые методы оптимизации предпочтений

9 уроков
1. От предпочтений к KL-регуляризованной политике
2. DPO: вывод, функция потерь и градиент
3. Где ломается простая картина
4. Варианты прямой оптимизации предпочтений
5. От формулы к воспроизводимому запуску
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

RLVR и GRPO: награды, групповые оценки и устойчивость

9 уроков
1. RLVR как контракт обратной связи
2. Каноническая GRPO
3. Нормировка и семейство вариантов
4. Динамика обучения и диагностика
5. От формулы к воспроизводимому запуску
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Поиск, проверка и вычислительный бюджет на этапе генерации

9 уроков
1. Что именно масштабируется на этапе генерации
2. Повторная генерация и агрегирование
3. Проверяющие системы и Best-of-N
4. Процессные оценки и структурированный поиск
5. Адаптивный бюджет и экономика
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

RL для LLM-агентов: инструменты, среда и длинные траектории

9 уроков
1. От ответа к взаимодействию со средой
2. Траектория, маска и функция потерь
3. Распределение заслуги на длинном горизонте
4. Исследование и оптимизация агентной политики
5. Среда, безопасность и воспроизводимая практика
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Инфраструктура RL для LLM: память, роллауты и асинхронность

9 уроков
1. RL-контур как поток данных
2. Память и пропускная способность
3. Конвейеры, очереди и медленные роллауты
4. Несвежесть, рассогласование и синхронизация весов
5. Восстановление, наблюдаемость и выбор стека
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Оценивание RL для LLM: статистика, взлом награды, безопасность

9 уроков
1. Оценивание как измерительная система
2. pass@k, жизненный цикл бенчмарка и загрязнение
3. Взлом награды и судья под давлением
4. Безопасность и протокольный паспорт
5. Минимальная система оценивания и финал курса
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение