Содержание курса
Введение: Reinforcement Learning для LLM
8 уроков
1.
Минимальный язык обучения с подкреплением
↗
2.
Какую RL-постановку выбрать для LLM
↗
3.
Современная карта дообучения LLM
↗
4.
Практика и первые численные эксперименты
↗
5.
Концептуальные задания
↗
6.
Аналитические задания
↗
7.
Программные задания
↗
8.
Источники и дальнейшее чтение
↗
Состояние, ценность и уравнения Беллмана
8 уроков
1.
От истории к состоянию, затем к ценности
↗
2.
Уравнения Беллмана: оценивание и улучшение
↗
3.
Оценивание без модели: от полной траектории к бутстрэппингу
↗
4.
Управление: текущая и целевая политики
↗
5.
Концептуальные задания
↗
6.
Аналитические задания
↗
7.
Программные задания
↗
8.
Источники и дальнейшее чтение
↗
Бандиты, исследование и одношаговые решения
8 уроков
1.
Одношаговое решение и цена незнания
↗
2.
Исследование, направляемое неопределённостью
↗
3.
Контекстные бандиты и оценивание по журналам
↗
4.
Энтропия, температура и несколько кандидатов
↗
5.
Концептуальные задания
↗
6.
Аналитические задания
↗
7.
Программные задания
↗
8.
Источники и дальнейшее чтение
↗
Градиенты политики: от REINFORCE к PPO
9 уроков
1.
Оценивание градиента политики и REINFORCE
↗
2.
Опорные уровни и групповые оценки
↗
3.
Актор–критик и обобщённое оценивание преимущества
↗
4.
От старой политики к PPO
↗
5.
Мост к обучению LLM
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
Фиксированные данные: имитация, глубокие Q-методы и офлайн-RL
9 уроков
1.
Имитационное обучение и SFT
↗
2.
DQN: Q-learning с нейросетью
↗
3.
Офлайн-RL: что можно узнать из фиксированного журнала
↗
4.
Decision Transformer: политика как условная модель траектории
↗
5.
Карта фиксированных данных для дообучения LLM
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
LLM как политика: токены, логарифмы вероятностей и KL
9 уроков
1.
Токеновый MDP без скрытых предположений
↗
2.
Логиты, маски и логарифмы вероятностей
↗
3.
KL относительно базовой политики
↗
4.
Фактическая политика поведения при генерации
↗
5.
Контракт роллаута для RL с проверяемыми наградами
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
Модели награды и данные о предпочтениях
9 уроков
1.
Обратная связь как данные, а не как готовая истина
↗
2.
Обучение скалярной модели награды
↗
3.
Оценивание: порядок, вероятность, перенос и неопределённость
↗
4.
Переоптимизация прокси-награды
↗
5.
Современные системы вознаграждения
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
RLHF и прямые методы оптимизации предпочтений
9 уроков
1.
От предпочтений к KL-регуляризованной политике
↗
2.
DPO: вывод, функция потерь и градиент
↗
3.
Где ломается простая картина
↗
4.
Варианты прямой оптимизации предпочтений
↗
5.
От формулы к воспроизводимому запуску
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
RLVR и GRPO: награды, групповые оценки и устойчивость
9 уроков
1.
RLVR как контракт обратной связи
↗
2.
Каноническая GRPO
↗
3.
Нормировка и семейство вариантов
↗
4.
Динамика обучения и диагностика
↗
5.
От формулы к воспроизводимому запуску
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
Поиск, проверка и вычислительный бюджет на этапе генерации
9 уроков
1.
Что именно масштабируется на этапе генерации
↗
2.
Повторная генерация и агрегирование
↗
3.
Проверяющие системы и Best-of-N
↗
4.
Процессные оценки и структурированный поиск
↗
5.
Адаптивный бюджет и экономика
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
RL для LLM-агентов: инструменты, среда и длинные траектории
9 уроков
1.
От ответа к взаимодействию со средой
↗
2.
Траектория, маска и функция потерь
↗
3.
Распределение заслуги на длинном горизонте
↗
4.
Исследование и оптимизация агентной политики
↗
5.
Среда, безопасность и воспроизводимая практика
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
Инфраструктура RL для LLM: память, роллауты и асинхронность
9 уроков
1.
RL-контур как поток данных
↗
2.
Память и пропускная способность
↗
3.
Конвейеры, очереди и медленные роллауты
↗
4.
Несвежесть, рассогласование и синхронизация весов
↗
5.
Восстановление, наблюдаемость и выбор стека
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗
Оценивание RL для LLM: статистика, взлом награды, безопасность
9 уроков
1.
Оценивание как измерительная система
↗
2.
pass@k, жизненный цикл бенчмарка и загрязнение
↗
3.
Взлом награды и судья под давлением
↗
4.
Безопасность и протокольный паспорт
↗
5.
Минимальная система оценивания и финал курса
↗
6.
Концептуальные задания
↗
7.
Аналитические задания
↗
8.
Программные задания
↗
9.
Источники и дальнейшее чтение
↗