Курс на Stepik
Обложка курса «Reinforcement Learning for LLM» на Stepik
Бесплатно

Reinforcement Learning for LLM ★ 5.000

Открыть на
STEPIK.ORG

An engineering course on reinforcement learning for LLMs and agentic systems: from MDPs, bandits, REINFORCE/PPO, and offline RL to reward models, RLHF/DPO, RLVR/GRPO, test-time search, agentic RL, infrastructure, and evaluation. In addition to the open lectures, the Stepik course includes more than 500 tasks: auto-graded tests, exercises with solutions, self-check questions with answers, and notebooks. The course is part of an evolving series on ML and LLMs.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Reinforcement Learning for LLM»Учеников на курсе 30
Сертификаты, выданные на курсе «Reinforcement Learning for LLM»Сертификатов выдано 0
Отзывы о курсе «Reinforcement Learning for LLM»Отзывов получено 1
Рейтинг курса «Reinforcement Learning for LLM»Рейтинг курса 5.000
Уроки в курсе «Reinforcement Learning for LLM»Количество уроков 114
Тесты в курсе «Reinforcement Learning for LLM»Количество квизов 136
Время прохождения курса «Reinforcement Learning for LLM»Время прохождения курса —
Обновления курса «Reinforcement Learning for LLM»Обновления курса — —
Дата публикации курса «Reinforcement Learning for LLM»Дата публикации курса — ———
Последнее обновление курса «Reinforcement Learning for LLM»Последнее обновление — ———
Сложность normal — ———

Команда курса

Аватар Влад(лен) Куликов — преподаватель курса Reinforcement Learning for LLM

Lead AI/ML (LLMs) в FinTech. В ML с 2017 года — R&D, разработка ML/GenAI систем, консультирование бизнеса по созданию и внедрению AI. Магистратура МФТИ — Modern State of AI. Диссертация и публикации...