Курс на Stepik
Обложка курса «Reinforcement Learning for LLM» на Stepik
Бесплатно

Reinforcement Learning for LLM ★ 5.000

Открыть на
STEPIK.ORG

An engineering course on reinforcement learning for LLMs and agentic systems: from MDPs, bandits, REINFORCE/PPO, and offline RL to reward models, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, infrastructure, and evaluation. In addition to the open lectures, the Stepik course includes more than 500 tasks: auto-graded tests, exercises with solutions, self-check questions with answers, and notebooks. The course is part of an evolving series on ML and LLMs.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Reinforcement Learning for LLM»Учеников на курсе 30
Сертификаты, выданные на курсе «Reinforcement Learning for LLM»Сертификатов выдано 0
Отзывы о курсе «Reinforcement Learning for LLM»Отзывов получено 1
Рейтинг курса «Reinforcement Learning for LLM»Рейтинг курса 5.000
Уроки в курсе «Reinforcement Learning for LLM»Количество уроков 114
Тесты в курсе «Reinforcement Learning for LLM»Количество квизов 136
Время прохождения курса «Reinforcement Learning for LLM»Время прохождения курса —
Обновления курса «Reinforcement Learning for LLM»Обновления курса — —
Дата публикации курса «Reinforcement Learning for LLM»Дата публикации курса — ———
Последнее обновление курса «Reinforcement Learning for LLM»Последнее обновление — ———
Сложность normal — ———
5.000 ★
из 5
1 отзыв
★★★★★
1
★★★★★
0
★★★★★
0
★★★★★
0
★★★★★
0