Курс на Stepik
Обложка курса «Reinforcement Learning для LLM» на Stepik
Бесплатно

Reinforcement Learning для LLM 0.000

Открыть на
STEPIK.ORG

Инженерный курс по обучению с подкреплением для LLM и систем с агентами: от MDP, бандитов, REINFORCE/PPO и offline RL до моделей награды, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры и evaluation. Курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами и ноутбуки. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Reinforcement Learning для LLM»Учеников на курсе 5
Сертификаты, выданные на курсе «Reinforcement Learning для LLM»Сертификатов выдано 0
Отзывы о курсе «Reinforcement Learning для LLM»Отзывов получено 0
Рейтинг курса «Reinforcement Learning для LLM»Рейтинг курса 0.000
Уроки в курсе «Reinforcement Learning для LLM»Количество уроков 114
Тесты в курсе «Reinforcement Learning для LLM»Количество квизов 136
Обновления курса «Reinforcement Learning для LLM»Обновления курса
Дата публикации курса «Reinforcement Learning для LLM»Дата публикации курса
Последнее обновление курса «Reinforcement Learning для LLM»Последнее обновление
Сложность normal

Содержание курса

Разделы в курсе «Reinforcement Learning для LLM» 13 разделов Уроки в курсе «Reinforcement Learning для LLM» 114 уроков Тесты в курсе «Reinforcement Learning для LLM» 136 тестов Последнее обновление курса «Reinforcement Learning для LLM» обн. 14 августа 2026

Введение: Reinforcement Learning для LLM

8 уроков
1. Минимальный язык обучения с подкреплением
2. Какую RL-постановку выбрать для LLM
3. Современная карта дообучения LLM
4. Практика и первые численные эксперименты
5. Концептуальные задания
6. Аналитические задания
7. Программные задания
8. Источники и дальнейшее чтение

Состояние, ценность и уравнения Беллмана

8 уроков
1. От истории к состоянию, затем к ценности
2. Уравнения Беллмана: оценивание и улучшение
3. Оценивание без модели: от полной траектории к бутстрэппингу
4. Управление: текущая и целевая политики
5. Концептуальные задания
6. Аналитические задания
7. Программные задания
8. Источники и дальнейшее чтение

Бандиты, исследование и одношаговые решения

8 уроков
1. Одношаговое решение и цена незнания
2. Исследование, направляемое неопределённостью
3. Контекстные бандиты и оценивание по журналам
4. Энтропия, температура и несколько кандидатов
5. Концептуальные задания
6. Аналитические задания
7. Программные задания
8. Источники и дальнейшее чтение

Градиенты политики: от REINFORCE к PPO

9 уроков
1. Оценивание градиента политики и REINFORCE
2. Опорные уровни и групповые оценки
3. Актор–критик и обобщённое оценивание преимущества
4. От старой политики к PPO
5. Мост к обучению LLM
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Фиксированные данные: имитация, глубокие Q-методы и офлайн-RL

9 уроков
1. Имитационное обучение и SFT
2. DQN: Q-learning с нейросетью
3. Офлайн-RL: что можно узнать из фиксированного журнала
4. Decision Transformer: политика как условная модель траектории
5. Карта фиксированных данных для дообучения LLM
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

LLM как политика: токены, логарифмы вероятностей и KL

9 уроков
1. Токеновый MDP без скрытых предположений
2. Логиты, маски и логарифмы вероятностей
3. KL относительно базовой политики
4. Фактическая политика поведения при генерации
5. Контракт роллаута для RL с проверяемыми наградами
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Модели награды и данные о предпочтениях

9 уроков
1. Обратная связь как данные, а не как готовая истина
2. Обучение скалярной модели награды
3. Оценивание: порядок, вероятность, перенос и неопределённость
4. Переоптимизация прокси-награды
5. Современные системы вознаграждения
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

RLHF и прямые методы оптимизации предпочтений

9 уроков
1. От предпочтений к KL-регуляризованной политике
2. DPO: вывод, функция потерь и градиент
3. Где ломается простая картина
4. Варианты прямой оптимизации предпочтений
5. От формулы к воспроизводимому запуску
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

RLVR и GRPO: награды, групповые оценки и устойчивость

9 уроков
1. RLVR как контракт обратной связи
2. Каноническая GRPO
3. Нормировка и семейство вариантов
4. Динамика обучения и диагностика
5. От формулы к воспроизводимому запуску
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Поиск, проверка и вычислительный бюджет на этапе генерации

9 уроков
1. Что именно масштабируется на этапе генерации
2. Повторная генерация и агрегирование
3. Проверяющие системы и Best-of-N
4. Процессные оценки и структурированный поиск
5. Адаптивный бюджет и экономика
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

RL для LLM-агентов: инструменты, среда и длинные траектории

9 уроков
1. От ответа к взаимодействию со средой
2. Траектория, маска и функция потерь
3. Распределение заслуги на длинном горизонте
4. Исследование и оптимизация агентной политики
5. Среда, безопасность и воспроизводимая практика
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Инфраструктура RL для LLM: память, роллауты и асинхронность

9 уроков
1. RL-контур как поток данных
2. Память и пропускная способность
3. Конвейеры, очереди и медленные роллауты
4. Несвежесть, рассогласование и синхронизация весов
5. Восстановление, наблюдаемость и выбор стека
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение

Оценивание RL для LLM: статистика, взлом награды, безопасность

9 уроков
1. Оценивание как измерительная система
2. pass@k, жизненный цикл бенчмарка и загрязнение
3. Взлом награды и судья под давлением
4. Безопасность и протокольный паспорт
5. Минимальная система оценивания и финал курса
6. Концептуальные задания
7. Аналитические задания
8. Программные задания
9. Источники и дальнейшее чтение