Курс на Stepik
Обложка курса «Современные LLM» на Stepik
15 000 ₽

Современные LLM 0.000

Открыть на
STEPIK.ORG

Инженерный курс о современных LLM — от токенизации, RoPE, attention, MoE и альтернатив Transformer до pretraining, KV-кэшей, квантизации, SFT, RLHF/DPO/GRPO, reasoning, RAG, агентов и evaluation. Платный курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами, проверенные ноутбуки и собственную MiniLLM (dense S, M и L и их MoE-близнецы) от данных до абляций. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Современные LLM»Учеников на курсе 0
Сертификаты, выданные на курсе «Современные LLM»Сертификатов выдано 0
Отзывы о курсе «Современные LLM»Отзывов получено 0
Рейтинг курса «Современные LLM»Рейтинг курса 0.000
Уроки в курсе «Современные LLM»Количество уроков 368
Тесты в курсе «Современные LLM»Количество квизов 299
Стоимость курса «Современные LLM»Стоимость курса 15 000 ₽
Обновления курса «Современные LLM»Обновления курса
Дата публикации курса «Современные LLM»Дата публикации курса
Последнее обновление курса «Современные LLM»Последнее обновление
Сложность normal

Содержание курса

Разделы в курсе «Современные LLM» 19 разделов Уроки в курсе «Современные LLM» 368 уроков Тесты в курсе «Современные LLM» 299 тестов Последнее обновление курса «Современные LLM» обн. 9 августа 2026

Современный ландшафт LLM

23 урока
1. Зачем инженеру карта ландшафта
2. Как курс читает код и какие системы служат референсами
3. Девять лет за пятнадцать минут: 2017 → 2026
4. Мостик к классике: систематика вместо зоопарка
5. Два паспорта: модель и система
6. Ось I крупным планом: dense и MoE
7. Решённый пример: gpt-oss-120b и Llama 4 Scout
8. Ось II: контекст — число, качество и цена
9. Ось III: модальности — вход, выход и место соединения
10. Ось IV: reasoning — кто управляет вычислительным бюджетом
11. Ось V: доступ, лицензия и практическая открытость
12. Ось VI: экономика — цена токена и цена системы
13. Датированный справочник: закрытые и API-семейства
14. Датированный справочник: открытые веса и воспроизводимые…
15. От публичного сигнала к доказательству: как читать результаты…
16. openai/gpt-oss как оглавление курса
17. Код (уровень 1): паспорт из проверенного config.json
18. Уровень 2: что в ноутбуке модуля
19. Карта курса и развивающейся серии
20. Вопросы для самопроверки
21. Упражнения с решениями
22. Резюме-шпаргалка
23. Ноутбук и источники

Токенизация и эмбеддинги

17 уроков
1. Зачем инженеру токенизация
2. Историческая прогрессия: от слов к байтам
3. Мостик к классике: токенизация как дискретное сжатие
4. Формализм: предварительное разбиение, BPE и BBPE
5. Решённый пример: от строки до кривой компрессии
6. Код первого уровня: учебный BBPE
7. Что добавляет notebook
8. Реальная реализация: o200k_base, Harmony и специальные токены
9. Ландшафт словарей: как читать числа доказательно
10. Fertility, fairness и доменные различия
11. Embedding-матрицы: первый и последний слой
12. Мультимодальная проекция: где аналогия с токенизацией полезна
13. Карта связей
14. Вопросы для самопроверки
15. Упражнения с решениями
16. Ключевые выводы модуля
17. Notebook и источники

Позиционные кодировки: от синусоид к многомерному времени

18 уроков
1. Мотивация: self-attention не знает порядка
2. Историческая прогрессия: от абсолютного индекса к…
3. Мостик к классике: Фурье, комплексные числа и относительная фаза
4. Формализм: от синусоид к вращению query и key
5. Решённый пример: один и тот же относительный сдвиг
6. Спектр частот: что действительно выбирает rope_theta
7. Расширение контекста: PI, NTK-aware scaling, YaRN и другие ветви
8. ALiBi: линейное позиционное смещение
9. NoPE: позиция без явного позиционного кодирования
10. Разбор конфигурации: что говорит gpt-oss и чего она не говорит
11. Код первого уровня: RoPE и YaRN с явными контрактами
12. Второй уровень: что проверяет ноутбук
13. Мультимодальная позиция: M-RoPE и TMRoPE
14. Современный ландшафт: методы сосуществуют
15. Вопросы для самопроверки
16. Упражнения с решениями
17. Ключевые выводы модуля
18. Ноутбук и первоисточники

Современные механизмы внимания

20 уроков
1. Мотивация: один запрос и два растущих счёта
2. Историческая прогрессия: сжатие состояния и перестройка…
3. Мостик к классике: ядро, распределение и память
4. Формализм: SDPA, маски и масштаб логитов
5. Решённый пример: MHA, MQA, GQA, MLA и реальный гибрид
6. MQA и GQA: общий K/V не означает одинаковый query
7. MLA: кэшировать латент, а не развернутые ключи и значения
8. FlashAttention: та же плотная функция, другой IO-граф
9. Sliding-window и гибридное attention
10. Два разных attention sink
11. Разреженное внимание: выбирать позиции, а не только формат кэша
12. Код первого уровня: прозрачный SDPA, GQA и окно
13. Второй уровень: что проверяет notebook
14. Читаем реальную реализацию gpt-oss
15. Современный ландшафт: читать механизм вместе с основанием
16. Мультимодальность: где встречаются визуальные и текстовые токены
17. Вопросы для самопроверки
18. Упражнения
19. Ключевые выводы модуля
20. Notebook и источники

Нормализация, активации и анатомия блока

21 урок
1. Мотивация: почему «мелочи» блока определяют судьбу обучения
2. Историческая прогрессия: несколько ответов на одну проблему…
3. Мостик к классике: стандартизация, численное интегрирование и…
4. Формализм: residual-поток как общий носитель состояния
5. LayerNorm и RMSNorm: что сохраняется, а что отбрасывается
6. Где поставить норму: Post-LN, Pre-LN, Peri-LN и OLMo2
7. Query-Key Normalization: контролируем масштаб логитов attention
8. FFN: почему одна нелинейность уступила гейтованной паре
9. SwiGLU: три матрицы, правило паритета и вариант gpt-oss
10. Решённый пример: Llama-3.1-8B до последнего параметра
11. DyT и DyISRU: можно ли заменить редукцию поэлементной функцией
12. mHC: ограничиваем не скрытые состояния, а матрицы…
13. Код первого уровня: RMSNorm, SwiGLU и residual block
14. Что проверяет ноутбук
15. Читаем публичную реализацию gpt-oss
16. Современные блоки: не каталог победителей, а паспорт…
17. Мультимодальность: тот же блок, но не одна история происхождения
18. Вопросы для самопроверки
19. Упражнения с решениями
20. Ключевые выводы модуля
21. Ноутбук и первоисточники

Mixture of Experts

20 уроков
1. Мотивация: большая модель без полного вычисления на каждом…
2. Историческая линия: от локальных специалистов к триллионным…
3. Мост к классическим идеям: комитет, условные вычисления и…
4. Формализм: routed experts, shared experts и явная конвенция…
5. Решённый пример A: gpt-oss с параметрами смещения
6. Роутер крупным планом: числовая трассировка
7. Балансировка: от auxiliary objective к управлению маршрутом
8. Fine-grained и shared experts: больше комбинационной гибкости
9. Специализация: что можно и чего нельзя заключать из маршрутов
10. Инференс MoE: память, all-to-all и объединение экспертов по…
11. LatentMoE и адаптивная маршрутизация
12. Код первого уровня: прозрачный MoE с явными политиками
13. Второй уровень: что проверяет notebook
14. Чтение открытого кода gpt-oss
15. Современный ландшафт как паспорт свидетельств
16. Мультимодальность: общий роутер — один из вариантов, а не…
17. Вопросы для самопроверки
18. Упражнения с решениями
19. Ключевые выводы модуля
20. Notebook и источники

Альтернативы Transformer: SSM, Mamba и гибриды

21 урок
1. Мотивация: две разные цены длинного контекста
2. Историческая линия: от линейных систем к гибридным LLM
3. Три взгляда на одну рекуррентность
4. Формализм: дискретная SSM и Zero-Order Hold
5. Решённый пример A: когда приближение $\Delta B$ заметно…
6. Mamba: селективность и блок
7. Mamba-2 и State Space Duality
8. DeltaNet и Gated DeltaNet: память, которую можно исправлять
9. Фиксированное состояние и цена адресуемости
10. Арифметика сделки: полный cache и core FLOPs
11. Гибриды: три способа совместить сводку и адресацию
12. Код первого уровня: scan, delta rule и чанки
13. Что проверяет notebook
14. Как читать открытый код Mamba
15. Современный ландшафт: читать не название, а контракт
16. Аудио, видео и другие длинные потоки
17. Вопросы для самопроверки
18. Упражнения
19. Ключевые выводы модуля
20. Notebook и первоисточники
21. Доп.модуль 7b: Диффузионные LLM (dLLM)

Претрейн: данные, законы масштабирования, оптимизаторы

20 уроков
1. Мотивация: три вопроса одного забега
2. Историческая прогрессия: как менялся главный ограничивающий…
3. Мостик к классике: три знакомых сюжета
4. Формализм: бюджет, аппроксимирующая зависимость и…
5. Данные: как сырой веб становится обучающим корпусом
6. Решённый пример A: два бюджета и цена упрощённого правила
7. Геометрия isoFLOP — и решённое У1: цена долгого обучения…
8. За пределами Chinchilla: когда более долго обученная…
9. Стена данных: когда токены перестают быть взаимозаменяемыми
10. Оптимизаторы: зачем Muon выравнивает спектр обновления
11. MuonClip: почему иногда надо исправлять не логиты, а веса
12. Код (уровень 1): маленькие функции, которые не скрывают…
13. Уровень 2: как читать ноутбук модуля
14. µP и MetaP: как переносить гиперпараметры с малой…
15. Параллелизм: как разложить состояние модели по кластеру
16. Претрейн в 2026 году: не список приёмов, а четыре направления
17. Паспорта запусков: что можно узнать из технического отчёта
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы модуля, ноутбук и источники

KV-кэши и эффективный инференс

20 уроков
1. Мотивация: почему инференс становится задачей о памяти
2. Историческая прогрессия: от компактного KV-состояния к…
3. Мостик к классическим системам: страницы, иерархия и очереди
4. Формализм и решённый пример A: сколько памяти добавляет один…
5. Две фазы одного запроса: prefill и decode
6. Решённый пример B: как KV-кэш снижает верхнюю границу по…
7. Батч-экономика: где заканчивается амортизация весов
8. PagedAttention: отделить логический контекст от физического…
9. Кэширование префикса: не пересчитывать одинаковое начало
10. Многоуровневое размещение: когда одного уровня памяти…
11. Разделение prefill и decode: каждой фазе свой пул
12. Код (уровень 1): геометрия, верхняя граница по памяти и страницы
13. Уровень 2: что проверяет ноутбук модуля
14. Компрессия I: вытеснение — выбрать, какие позиции сохранить
15. Компрессия II: квантование, низкоранговое представление и…
16. Движки и контракты кэширования: карта стека на 3 августа 2026…
17. Как читать паспорт инференса модели
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы, ноутбук и источники

Спекулятивное декодирование и квантизация

20 уроков
1. Мотивация: два способа снизить стоимость токена
2. Как сложились два направления
3. Три классические идеи под современными названиями
4. Точный спекулятивный цикл
5. Решённый пример A: баланс на пяти токенах
6. Сколько токенов приносит один цикл
7. Цена цикла и выбор длины черновика
8. Откуда брать черновик
9. MTP как встроенный источник предложений
10. Почему проверка похожа на короткий prefill
11. Квантизация после обучения: что именно уменьшается
12. FP4, микромасштабирование и W4A4
13. Код: корректность раньше ускорения
14. Что проверяет ноутбук
15. Как сочетать квантизацию и спекулятивное декодирование
16. Движки и безопасный порядок развёртывания
17. Паспорт запуска: квантизация и спекулятивное декодирование
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы модуля, ноутбук и источники

SFT и работа с данными

20 уроков
1. Мотивация: от продолжения текста к управляемому поведению
2. Как сложился современный SFT
3. Три классические идеи за современной терминологией
4. Формат данных: шаблон является частью модели
5. Маскирование функции потерь и пример A: 21 токен из 56
6. Упаковка примеров и пример B: 24 последовательности → 5…
7. Гиперпараметры и стоимость этапа: пример C
8. Данные I: не каталог, а карта функций
9. Данные II: чему действительно учит LIMA
10. Синтетические данные и пример E: best-of-N с верификатором
11. SFT на решениях и пример F: что означают «девять минут»
12. SFT для работы с инструментами
13. Код первого уровня: метки и трассируемая упаковка
14. Второй уровень: что проверяет ноутбук
15. Дистилляция: что именно переносит учитель
16. PEFT и пример D: сколько действительно обучает LoRA
17. Как читать паспорт модели после SFT
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы модуля, ноутбук и источники

Обучение по обратной связи: RLHF, DPO, RLOO и GRPO

20 уроков
1. Мотивация: когда демонстрации уже недостаточно
2. Как менялся основной маршрут постобучения
3. Три классические идеи за современной терминологией
4. Классический RLHF: три стадии и четыре логические роли
5. Решённый пример A: читаем Bradley–Terry в обе стороны
6. DPO: как исключить явную модель вознаграждения
7. Решённый пример B: что именно делает коэффициент $\beta$
8. Семейство прямых методов: какую часть контракта они меняют
9. RLOO и GRPO: базовая линия из нескольких ответов
10. Решённый пример D: учебная анатомия памяти
11. Решённый пример E: почему сбор траекторий становится узким…
12. После GRPO: какие проблемы исправляют новые методы
13. Код первого уровня: три минимальных примитива
14. Второй уровень: что делает ноутбук
15. RLVR, Goodhart и взлом проверяющего сигнала
16. Constitutional AI, R1 и интерактивные среды
17. Как читать паспорт постобучения
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы, ноутбук и источники

Модели рассуждения и вычисления во время вывода (test-time…

20 уроков
1. Мотивация: вторая ось масштабирования
2. Историческая дуга: от длинной цепочки к управлению бюджетом
3. Мостик к классике: три знакомых предка
4. Анатомия модели рассуждения и карта режимов
5. Рецепт DeepSeek-R1 и феномен R1-Zero
6. Параллельное масштабирование: решённый пример A — сюрприз…
7. Решённый пример B: верификатор вместо голосования
8. Последовательное масштабирование и budget forcing
9. Когда думать дольше — хуже
10. Решённый пример C: учебная лестница бюджета в секундах и FLOPs
11. Решённый пример D: KV-цена мысли
12. Решённый пример E: зачем нужен адаптивный бюджет
13. Код, уровень 1: точный контракт отбора и цена токенов
14. Уровень 2: что находится в Jupyter-ноутбуке модуля
15. Кто проверяет решение: от точного правила до верификатора…
16. Дистилляция рассуждений: что переносится, а что нет
17. Как читать «паспорт рассуждения» модели
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы модуля, Jupyter-ноутбук и источники

Мультимодальные LLM: зрение, аудио и видео

20 уроков
1. Мотивация: новая модальность становится новым бюджетом
2. Историческая прогрессия: четыре семейства, которые продолжают…
3. Мостик к классике: метрическое обучение, ViT и сигнальные…
4. Базовый рецепт VLM: энкодер, коннектор и языковой декодер
5. CLIP, SigLIP и пример C: читаем InfoNCE числом
6. Решённый пример A: от разрешения к числу визуальных токенов
7. Решённый пример B: когда визуальные токены попадают в KV-кэш
8. Коннекторы и пример D: цена модульного рецепта
9. Динамическое разрешение, тайлинг и M-RoPE
10. Единое моделирование: общий интерфейс не требует одного…
11. Решённый пример E: почему видео требует выборки и сжатия
12. Thinker–Talker: совместное рассуждение и потоковая речь
13. Код первого уровня: геометрия до фреймворка
14. Второй уровень: что проверяет notebook
15. Аудио как временная модальность
16. Публично документированный ландшафт на 4 августа 2026 года
17. Как читать мультимодальный паспорт модели
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы, notebook и источники

Эмбеддинги, поиск и RAG

20 уроков
1. Мотивация: один вопрос и четыре потери информации
2. Историческая прогрессия: каждый новый метод возвращал…
3. Мостик к классике: три старых задачи внутри RAG
4. BM25 и обучаемые разреженные представления: ветка точных термов
5. Плотные bi-encoder-модели: как учат семантическое пространство
6. MRL (Matryoshka Representation Learning), квантизация и…
7. Один вектор, одна пара или матрица: где происходит…
8. Решённый пример B: точный поиск и арифметика ANN (Approximate…
9. ANN под капотом: три индекса для трёх ограничений
10. Гибридный поиск, RRF (Reciprocal Rank Fusion) и решённый…
11. Разбиение на фрагменты: что именно становится объектом поиска
12. Полный каскад и решённый пример D: где живёт задержка
13. Код первого уровня: гибридный поиск с явными контрактами
14. Второй уровень: что проверяет notebook
15. Эволюция RAG: каждый «продвинутый» метод исправляет…
16. Решённый пример E: RAG или длинный контекст
17. Оценка и паспорт эмбеддера
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы, notebook и источники

Агенты и работа с инструментами

20 уроков
1. Мотивация: ответ становится траекторией
2. Историческая прогрессия: расширялся не промпт, а контур…
3. Мостик к классике: планирование, обратная связь и…
4. Анатомия агентного цикла
5. Вызов функций и управляемая генерация: от текста к…
6. ReAct, CodeAct и Plan-and-Execute: три способа выразить…
7. Решённый пример A: история цикла и цена повторного prefill
8. Решённый пример B: из чего складывается один шаг
9. MCP: стандарт соединения, а не разрешение действовать
10. Производственный агент: исполняющая обвязка является частью…
11. Решённый пример C: надёжность длинной траектории
12. Параллельные субагенты и закон Амдала
13. Код первого уровня: ограниченный цикл с явным протоколом
14. Второй уровень: что проверяет ноутбук
15. Ландшафт систем: сравниваем интерфейсы, а не логотипы
16. Тестовые стенды: каждый измеряет другую пару «агент — среда»
17. Паспорт исполняющей обвязки агента
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы, ноутбук и источники

Оценка современных LLM: от бенчмарка к инженерному решению

20 уроков
1. Начинаем не со скора, а с решения
2. Историческая линия: каждый новый жанр исправлял старый
3. Три классических основания: психометрика, эксперимент и…
4. Жизненный цикл бенчмарка: как измеритель теряет силу
5. Карта оценки: сначала оси, затем названия наборов
6. Решённый пример A: различимы ли 95,5% и 95,0%?
7. Трудность бывает разной: HLE, FrontierMath и ARC-AGI
8. pass@k: способность найти решение и надёжность — не одно и то же
9. Парные предпочтения и композиты: полезные карты с чужой…
10. Модель-судья: как порядок создаёт фантомную победу
11. Мультимодальность, безопасность, правдивость и честность…
12. Длинный контекст: принимает миллион токенов — значит ли…
13. Собственная исполняющая обвязка: один вызов — один…
14. Что делает notebook второго уровня
15. Собственный золотой набор: семь шагов от продукта к CI
16. Восемь направлений оценки по состоянию на август 2026 года
17. Паспорт бенчмарка и результат оценки
18. Вопросы для самопроверки
19. Упражнения
20. Ключевые выводы, финал курса и источники

(справочный). Базовый Transformer

22 урока
1. Зачем Transformer вообще понадобился
2. Карта обозначений и форм тензоров
3. Шаг 1. Токены, эмбеддинги и позиции
4. Шаг 2. Scaled dot-product attention
5. Маски: кто имеет право кого видеть
6. Multi-head attention
7. FFN: нелинейное преобразование каждой позиции
8. Residual connection и LayerNorm
9. Encoder-слой и encoder-стек
10. Decoder-слой и cross-attention
11. Обучение: teacher forcing и cross-entropy
12. Генерация: тот же forward, другой цикл
13. Минимальная реализация scaled dot-product attention
14. Минимальный Transformer-блок
15. Полная трассировка форм на игрушечной модели
16. Оригинал 2017 и современная LLM: что сохранилось
17. Что часто путают
18. Самопроверка
19. Упражнения с решениями
20. Ноутбук модуля
21. Маршрут чтения и источники
22. Итоговая шпаргалка и возврат в основной курс

Capstone: собственная MiniLLM от данных до абляций

6 уроков
1. О проекте и рабочей среде
2. Претрейн: данные, tokenizer и обучение
3. Посттрейн: SFT и DPO
4. Инференс: кэш, speculative decoding и квантизация
5. Абляции и границы выводов
6. Итоговый отчёт и самооценка