Курс на Stepik
Обложка курса «Reinforcement Learning для LLM» на Stepik
Бесплатно

Reinforcement Learning для LLM ★ 5.000

Открыть на
STEPIK.ORG

Инженерный курс по обучению с подкреплением для LLM и систем с агентами: от MDP, бандитов, REINFORCE/PPO и offline RL до моделей награды, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, инфраструктуры и evaluation. Курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами и ноутбуки. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Reinforcement Learning для LLM»Учеников на курсе 100
Сертификаты, выданные на курсе «Reinforcement Learning для LLM»Сертификатов выдано 0
Отзывы о курсе «Reinforcement Learning для LLM»Отзывов получено 1
Рейтинг курса «Reinforcement Learning для LLM»Рейтинг курса 5.000
Уроки в курсе «Reinforcement Learning для LLM»Количество уроков 114
Тесты в курсе «Reinforcement Learning для LLM»Количество квизов 136
Время прохождения курса «Reinforcement Learning для LLM»Время прохождения курса —
Обновления курса «Reinforcement Learning для LLM»Обновления курса — —
Дата публикации курса «Reinforcement Learning для LLM»Дата публикации курса — ———
Последнее обновление курса «Reinforcement Learning для LLM»Последнее обновление — ———
Сложность normal — ———

Содержание курса

Разделы в курсе «Reinforcement Learning для LLM» 13 разделов Уроки в курсе «Reinforcement Learning для LLM» 114 уроков Тесты в курсе «Reinforcement Learning для LLM» 136 тестов Время прохождения курса «Reinforcement Learning для LLM» 1 ч. Последнее обновление курса «Reinforcement Learning для LLM» обн. 15 августа 2026

Введение: Reinforcement Learning для LLM

8 уроков
1. Минимальный язык обучения с подкреплением ↗
2. Какую RL-постановку выбрать для LLM ↗
3. Современная карта дообучения LLM ↗
4. Практика и первые численные эксперименты ↗
5. Концептуальные задания ↗
6. Аналитические задания ↗
7. Программные задания ↗
8. Источники и дальнейшее чтение ↗

Состояние, ценность и уравнения Беллмана

8 уроков
1. От истории к состоянию, затем к ценности ↗
2. Уравнения Беллмана: оценивание и улучшение ↗
3. Оценивание без модели: от полной траектории к бутстрэппингу ↗
4. Управление: текущая и целевая политики ↗
5. Концептуальные задания ↗
6. Аналитические задания ↗
7. Программные задания ↗
8. Источники и дальнейшее чтение ↗

Бандиты, исследование и одношаговые решения

8 уроков
1. Одношаговое решение и цена незнания ↗
2. Исследование, направляемое неопределённостью ↗
3. Контекстные бандиты и оценивание по журналам ↗
4. Энтропия, температура и несколько кандидатов ↗
5. Концептуальные задания ↗
6. Аналитические задания ↗
7. Программные задания ↗
8. Источники и дальнейшее чтение ↗

Градиенты политики: от REINFORCE к PPO

9 уроков
1. Оценивание градиента политики и REINFORCE ↗
2. Опорные уровни и групповые оценки ↗
3. Актор–критик и обобщённое оценивание преимущества ↗
4. От старой политики к PPO ↗
5. Мост к обучению LLM ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

Фиксированные данные: имитация, глубокие Q-методы и офлайн-RL

9 уроков
1. Имитационное обучение и SFT ↗
2. DQN: Q-learning с нейросетью ↗
3. Офлайн-RL: что можно узнать из фиксированного журнала ↗
4. Decision Transformer: политика как условная модель траектории ↗
5. Карта фиксированных данных для дообучения LLM ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

LLM как политика: токены, логарифмы вероятностей и KL

9 уроков
1. Токеновый MDP без скрытых предположений ↗
2. Логиты, маски и логарифмы вероятностей ↗
3. KL относительно базовой политики ↗
4. Фактическая политика поведения при генерации ↗
5. Контракт роллаута для RL с проверяемыми наградами ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

Модели награды и данные о предпочтениях

9 уроков
1. Обратная связь как данные, а не как готовая истина ↗
2. Обучение скалярной модели награды ↗
3. Оценивание: порядок, вероятность, перенос и неопределённость ↗
4. Переоптимизация прокси-награды ↗
5. Современные системы вознаграждения ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

RLHF и прямые методы оптимизации предпочтений

9 уроков
1. От предпочтений к KL-регуляризованной политике ↗
2. DPO: вывод, функция потерь и градиент ↗
3. Где ломается простая картина ↗
4. Варианты прямой оптимизации предпочтений ↗
5. От формулы к воспроизводимому запуску ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

RLVR и GRPO: награды, групповые оценки и устойчивость

9 уроков
1. RLVR как контракт обратной связи ↗
2. Каноническая GRPO ↗
3. Нормировка и семейство вариантов ↗
4. Динамика обучения и диагностика ↗
5. От формулы к воспроизводимому запуску ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

Поиск, проверка и вычислительный бюджет на этапе генерации

9 уроков
1. Что именно масштабируется на этапе генерации ↗
2. Повторная генерация и агрегирование ↗
3. Проверяющие системы и Best-of-N ↗
4. Процессные оценки и структурированный поиск ↗
5. Адаптивный бюджет и экономика ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

RL для LLM-агентов: инструменты, среда и длинные траектории

9 уроков
1. От ответа к взаимодействию со средой ↗
2. Траектория, маска и функция потерь ↗
3. Распределение заслуги на длинном горизонте ↗
4. Исследование и оптимизация агентной политики ↗
5. Среда, безопасность и воспроизводимая практика ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

Инфраструктура RL для LLM: память, роллауты и асинхронность

9 уроков
1. RL-контур как поток данных ↗
2. Память и пропускная способность ↗
3. Конвейеры, очереди и медленные роллауты ↗
4. Несвежесть, рассогласование и синхронизация весов ↗
5. Восстановление, наблюдаемость и выбор стека ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗

Оценивание RL для LLM: статистика, взлом награды, безопасность

9 уроков
1. Оценивание как измерительная система ↗
2. pass@k, жизненный цикл бенчмарка и загрязнение ↗
3. Взлом награды и судья под давлением ↗
4. Безопасность и протокольный паспорт ↗
5. Минимальная система оценивания и финал курса ↗
6. Концептуальные задания ↗
7. Аналитические задания ↗
8. Программные задания ↗
9. Источники и дальнейшее чтение ↗