Курс на Stepik
Обложка курса «Современные LLM — 2026» на Stepik
15 000₽ -20%
--:--:--
12 000 ₽

Современные LLM — 2026 ★ 0.000

Открыть на
STEPIK.ORG

Инженерный курс о современных LLM — от токенизации, RoPE, attention, MoE и альтернатив Transformer до pretraining, KV-кэшей, квантизации, SFT, RLHF/DPO/GRPO, reasoning, RAG, агентов и evaluation. Платный курс на Stepik дополнительно к открытым лекциям включает более 500 заданий: автопроверяемые тесты, упражнения с решениями и вопросы для самопроверки с ответами, проверенные ноутбуки и собственную MiniLLM (dense S, M и L и их MoE-близнецы) от данных до абляций. Курс входит в развивающуюся серию об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Современные LLM — 2026»Учеников на курсе 1
Сертификаты, выданные на курсе «Современные LLM — 2026»Сертификатов выдано 0
Отзывы о курсе «Современные LLM — 2026»Отзывов получено 0
Рейтинг курса «Современные LLM — 2026»Рейтинг курса 0.000
Уроки в курсе «Современные LLM — 2026»Количество уроков 368
Тесты в курсе «Современные LLM — 2026»Количество квизов 299
Стоимость курса «Современные LLM — 2026»Стоимость курса 15 000 ₽ —
Обновления курса «Современные LLM — 2026»Обновления курса — —
Дата публикации курса «Современные LLM — 2026»Дата публикации курса — ———
Последнее обновление курса «Современные LLM — 2026»Последнее обновление — ———
Сложность normal — ———

Содержание курса

Разделы в курсе «Современные LLM — 2026» 19 разделов Уроки в курсе «Современные LLM — 2026» 368 уроков Тесты в курсе «Современные LLM — 2026» 299 тестов Последнее обновление курса «Современные LLM — 2026» обн. 16 августа 2026

Современный ландшафт LLM

23 урока
1. Зачем инженеру карта ландшафта ↗
2. Как курс читает код и какие системы служат референсами ↗
3. Девять лет за пятнадцать минут: 2017 → 2026 ↗
4. Мостик к классике: систематика вместо зоопарка ↗
5. Два паспорта: модель и система ↗
6. Ось I крупным планом: dense и MoE ↗
7. Решённый пример: gpt-oss-120b и Llama 4 Scout ↗
8. Ось II: контекст — число, качество и цена ↗
9. Ось III: модальности — вход, выход и место соединения ↗
10. Ось IV: reasoning — кто управляет вычислительным бюджетом ↗
11. Ось V: доступ, лицензия и практическая открытость ↗
12. Ось VI: экономика — цена токена и цена системы ↗
13. Датированный справочник: закрытые и API-семейства ↗
14. Датированный справочник: открытые веса и воспроизводимые… ↗
15. От публичного сигнала к доказательству: как читать результаты… ↗
16. openai/gpt-oss как оглавление курса ↗
17. Код (уровень 1): паспорт из проверенного config.json ↗
18. Уровень 2: что в ноутбуке модуля ↗
19. Карта курса и развивающейся серии ↗
20. Вопросы для самопроверки ↗
21. Упражнения с решениями ↗
22. Резюме-шпаргалка ↗
23. Ноутбук и источники ↗

Токенизация и эмбеддинги

17 уроков
1. Зачем инженеру токенизация ↗
2. Историческая прогрессия: от слов к байтам ↗
3. Мостик к классике: токенизация как дискретное сжатие ↗
4. Формализм: предварительное разбиение, BPE и BBPE ↗
5. Решённый пример: от строки до кривой компрессии ↗
6. Код первого уровня: учебный BBPE ↗
7. Что добавляет notebook ↗
8. Реальная реализация: o200k_base, Harmony и специальные токены ↗
9. Ландшафт словарей: как читать числа доказательно ↗
10. Fertility, fairness и доменные различия ↗
11. Embedding-матрицы: первый и последний слой ↗
12. Мультимодальная проекция: где аналогия с токенизацией полезна ↗
13. Карта связей ↗
14. Вопросы для самопроверки ↗
15. Упражнения с решениями ↗
16. Ключевые выводы модуля ↗
17. Notebook и источники ↗

Позиционные кодировки: от синусоид к многомерному времени

18 уроков
1. Мотивация: self-attention не знает порядка ↗
2. Историческая прогрессия: от абсолютного индекса к… ↗
3. Мостик к классике: Фурье, комплексные числа и относительная фаза ↗
4. Формализм: от синусоид к вращению query и key ↗
5. Решённый пример: один и тот же относительный сдвиг ↗
6. Спектр частот: что действительно выбирает rope_theta ↗
7. Расширение контекста: PI, NTK-aware scaling, YaRN и другие ветви ↗
8. ALiBi: линейное позиционное смещение ↗
9. NoPE: позиция без явного позиционного кодирования ↗
10. Разбор конфигурации: что говорит gpt-oss и чего она не говорит ↗
11. Код первого уровня: RoPE и YaRN с явными контрактами ↗
12. Второй уровень: что проверяет ноутбук ↗
13. Мультимодальная позиция: M-RoPE и TMRoPE ↗
14. Современный ландшафт: методы сосуществуют ↗
15. Вопросы для самопроверки ↗
16. Упражнения с решениями ↗
17. Ключевые выводы модуля ↗
18. Ноутбук и первоисточники ↗

Современные механизмы внимания

20 уроков
1. Мотивация: один запрос и два растущих счёта ↗
2. Историческая прогрессия: сжатие состояния и перестройка… ↗
3. Мостик к классике: ядро, распределение и память ↗
4. Формализм: SDPA, маски и масштаб логитов ↗
5. Решённый пример: MHA, MQA, GQA, MLA и реальный гибрид ↗
6. MQA и GQA: общий K/V не означает одинаковый query ↗
7. MLA: кэшировать латент, а не развернутые ключи и значения ↗
8. FlashAttention: та же плотная функция, другой IO-граф ↗
9. Sliding-window и гибридное attention ↗
10. Два разных attention sink ↗
11. Разреженное внимание: выбирать позиции, а не только формат кэша ↗
12. Код первого уровня: прозрачный SDPA, GQA и окно ↗
13. Второй уровень: что проверяет notebook ↗
14. Читаем реальную реализацию gpt-oss ↗
15. Современный ландшафт: читать механизм вместе с основанием ↗
16. Мультимодальность: где встречаются визуальные и текстовые токены ↗
17. Вопросы для самопроверки ↗
18. Упражнения ↗
19. Ключевые выводы модуля ↗
20. Notebook и источники ↗

Нормализация, активации и анатомия блока

21 урок
1. Мотивация: почему «мелочи» блока определяют судьбу обучения ↗
2. Историческая прогрессия: несколько ответов на одну проблему… ↗
3. Мостик к классике: стандартизация, численное интегрирование и… ↗
4. Формализм: residual-поток как общий носитель состояния ↗
5. LayerNorm и RMSNorm: что сохраняется, а что отбрасывается ↗
6. Где поставить норму: Post-LN, Pre-LN, Peri-LN и OLMo2 ↗
7. Query-Key Normalization: контролируем масштаб логитов attention ↗
8. FFN: почему одна нелинейность уступила гейтованной паре ↗
9. SwiGLU: три матрицы, правило паритета и вариант gpt-oss ↗
10. Решённый пример: Llama-3.1-8B до последнего параметра ↗
11. DyT и DyISRU: можно ли заменить редукцию поэлементной функцией ↗
12. mHC: ограничиваем не скрытые состояния, а матрицы… ↗
13. Код первого уровня: RMSNorm, SwiGLU и residual block ↗
14. Что проверяет ноутбук ↗
15. Читаем публичную реализацию gpt-oss ↗
16. Современные блоки: не каталог победителей, а паспорт… ↗
17. Мультимодальность: тот же блок, но не одна история происхождения ↗
18. Вопросы для самопроверки ↗
19. Упражнения с решениями ↗
20. Ключевые выводы модуля ↗
21. Ноутбук и первоисточники ↗

Mixture of Experts

20 уроков
1. Мотивация: большая модель без полного вычисления на каждом… ↗
2. Историческая линия: от локальных специалистов к триллионным… ↗
3. Мост к классическим идеям: комитет, условные вычисления и… ↗
4. Формализм: routed experts, shared experts и явная конвенция… ↗
5. Решённый пример A: gpt-oss с параметрами смещения ↗
6. Роутер крупным планом: числовая трассировка ↗
7. Балансировка: от auxiliary objective к управлению маршрутом ↗
8. Fine-grained и shared experts: больше комбинационной гибкости ↗
9. Специализация: что можно и чего нельзя заключать из маршрутов ↗
10. Инференс MoE: память, all-to-all и объединение экспертов по… ↗
11. LatentMoE и адаптивная маршрутизация ↗
12. Код первого уровня: прозрачный MoE с явными политиками ↗
13. Второй уровень: что проверяет notebook ↗
14. Чтение открытого кода gpt-oss ↗
15. Современный ландшафт как паспорт свидетельств ↗
16. Мультимодальность: общий роутер — один из вариантов, а не… ↗
17. Вопросы для самопроверки ↗
18. Упражнения с решениями ↗
19. Ключевые выводы модуля ↗
20. Notebook и источники ↗

Альтернативы Transformer: SSM, Mamba и гибриды

21 урок
1. Мотивация: две разные цены длинного контекста ↗
2. Историческая линия: от линейных систем к гибридным LLM ↗
3. Три взгляда на одну рекуррентность ↗
4. Формализм: дискретная SSM и Zero-Order Hold ↗
5. Решённый пример A: когда приближение $\Delta B$ заметно… ↗
6. Mamba: селективность и блок ↗
7. Mamba-2 и State Space Duality ↗
8. DeltaNet и Gated DeltaNet: память, которую можно исправлять ↗
9. Фиксированное состояние и цена адресуемости ↗
10. Арифметика сделки: полный cache и core FLOPs ↗
11. Гибриды: три способа совместить сводку и адресацию ↗
12. Код первого уровня: scan, delta rule и чанки ↗
13. Что проверяет notebook ↗
14. Как читать открытый код Mamba ↗
15. Современный ландшафт: читать не название, а контракт ↗
16. Аудио, видео и другие длинные потоки ↗
17. Вопросы для самопроверки ↗
18. Упражнения ↗
19. Ключевые выводы модуля ↗
20. Notebook и первоисточники ↗
21. Доп.модуль 7b: Диффузионные LLM (dLLM) ↗

Претрейн: данные, законы масштабирования, оптимизаторы

20 уроков
1. Мотивация: три вопроса одного забега ↗
2. Историческая прогрессия: как менялся главный ограничивающий… ↗
3. Мостик к классике: три знакомых сюжета ↗
4. Формализм: бюджет, аппроксимирующая зависимость и… ↗
5. Данные: как сырой веб становится обучающим корпусом ↗
6. Решённый пример A: два бюджета и цена упрощённого правила ↗
7. Геометрия isoFLOP — и решённое У1: цена долгого обучения… ↗
8. За пределами Chinchilla: когда более долго обученная… ↗
9. Стена данных: когда токены перестают быть взаимозаменяемыми ↗
10. Оптимизаторы: зачем Muon выравнивает спектр обновления ↗
11. MuonClip: почему иногда надо исправлять не логиты, а веса ↗
12. Код (уровень 1): маленькие функции, которые не скрывают… ↗
13. Уровень 2: как читать ноутбук модуля ↗
14. µP и MetaP: как переносить гиперпараметры с малой… ↗
15. Параллелизм: как разложить состояние модели по кластеру ↗
16. Претрейн в 2026 году: не список приёмов, а четыре направления ↗
17. Паспорта запусков: что можно узнать из технического отчёта ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы модуля, ноутбук и источники ↗

KV-кэши и эффективный инференс

20 уроков
1. Мотивация: почему инференс становится задачей о памяти ↗
2. Историческая прогрессия: от компактного KV-состояния к… ↗
3. Мостик к классическим системам: страницы, иерархия и очереди ↗
4. Формализм и решённый пример A: сколько памяти добавляет один… ↗
5. Две фазы одного запроса: prefill и decode ↗
6. Решённый пример B: как KV-кэш снижает верхнюю границу по… ↗
7. Батч-экономика: где заканчивается амортизация весов ↗
8. PagedAttention: отделить логический контекст от физического… ↗
9. Кэширование префикса: не пересчитывать одинаковое начало ↗
10. Многоуровневое размещение: когда одного уровня памяти… ↗
11. Разделение prefill и decode: каждой фазе свой пул ↗
12. Код (уровень 1): геометрия, верхняя граница по памяти и страницы ↗
13. Уровень 2: что проверяет ноутбук модуля ↗
14. Компрессия I: вытеснение — выбрать, какие позиции сохранить ↗
15. Компрессия II: квантование, низкоранговое представление и… ↗
16. Движки и контракты кэширования: карта стека на 3 августа 2026… ↗
17. Как читать паспорт инференса модели ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы, ноутбук и источники ↗

Спекулятивное декодирование и квантизация

20 уроков
1. Мотивация: два способа снизить стоимость токена ↗
2. Как сложились два направления ↗
3. Три классические идеи под современными названиями ↗
4. Точный спекулятивный цикл ↗
5. Решённый пример A: баланс на пяти токенах ↗
6. Сколько токенов приносит один цикл ↗
7. Цена цикла и выбор длины черновика ↗
8. Откуда брать черновик ↗
9. MTP как встроенный источник предложений ↗
10. Почему проверка похожа на короткий prefill ↗
11. Квантизация после обучения: что именно уменьшается ↗
12. FP4, микромасштабирование и W4A4 ↗
13. Код: корректность раньше ускорения ↗
14. Что проверяет ноутбук ↗
15. Как сочетать квантизацию и спекулятивное декодирование ↗
16. Движки и безопасный порядок развёртывания ↗
17. Паспорт запуска: квантизация и спекулятивное декодирование ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы модуля, ноутбук и источники ↗

SFT и работа с данными

20 уроков
1. Мотивация: от продолжения текста к управляемому поведению ↗
2. Как сложился современный SFT ↗
3. Три классические идеи за современной терминологией ↗
4. Формат данных: шаблон является частью модели ↗
5. Маскирование функции потерь и пример A: 21 токен из 56 ↗
6. Упаковка примеров и пример B: 24 последовательности → 5… ↗
7. Гиперпараметры и стоимость этапа: пример C ↗
8. Данные I: не каталог, а карта функций ↗
9. Данные II: чему действительно учит LIMA ↗
10. Синтетические данные и пример E: best-of-N с верификатором ↗
11. SFT на решениях и пример F: что означают «девять минут» ↗
12. SFT для работы с инструментами ↗
13. Код первого уровня: метки и трассируемая упаковка ↗
14. Второй уровень: что проверяет ноутбук ↗
15. Дистилляция: что именно переносит учитель ↗
16. PEFT и пример D: сколько действительно обучает LoRA ↗
17. Как читать паспорт модели после SFT ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы модуля, ноутбук и источники ↗

Обучение по обратной связи: RLHF, DPO, RLOO и GRPO

20 уроков
1. Мотивация: когда демонстрации уже недостаточно ↗
2. Как менялся основной маршрут постобучения ↗
3. Три классические идеи за современной терминологией ↗
4. Классический RLHF: три стадии и четыре логические роли ↗
5. Решённый пример A: читаем Bradley–Terry в обе стороны ↗
6. DPO: как исключить явную модель вознаграждения ↗
7. Решённый пример B: что именно делает коэффициент $\beta$ ↗
8. Семейство прямых методов: какую часть контракта они меняют ↗
9. RLOO и GRPO: базовая линия из нескольких ответов ↗
10. Решённый пример D: учебная анатомия памяти ↗
11. Решённый пример E: почему сбор траекторий становится узким… ↗
12. После GRPO: какие проблемы исправляют новые методы ↗
13. Код первого уровня: три минимальных примитива ↗
14. Второй уровень: что делает ноутбук ↗
15. RLVR, Goodhart и взлом проверяющего сигнала ↗
16. Constitutional AI, R1 и интерактивные среды ↗
17. Как читать паспорт постобучения ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы, ноутбук и источники ↗

Модели рассуждения и вычисления во время вывода (test-time…

20 уроков
1. Мотивация: вторая ось масштабирования ↗
2. Историческая дуга: от длинной цепочки к управлению бюджетом ↗
3. Мостик к классике: три знакомых предка ↗
4. Анатомия модели рассуждения и карта режимов ↗
5. Рецепт DeepSeek-R1 и феномен R1-Zero ↗
6. Параллельное масштабирование: решённый пример A — сюрприз… ↗
7. Решённый пример B: верификатор вместо голосования ↗
8. Последовательное масштабирование и budget forcing ↗
9. Когда думать дольше — хуже ↗
10. Решённый пример C: учебная лестница бюджета в секундах и FLOPs ↗
11. Решённый пример D: KV-цена мысли ↗
12. Решённый пример E: зачем нужен адаптивный бюджет ↗
13. Код, уровень 1: точный контракт отбора и цена токенов ↗
14. Уровень 2: что находится в Jupyter-ноутбуке модуля ↗
15. Кто проверяет решение: от точного правила до верификатора… ↗
16. Дистилляция рассуждений: что переносится, а что нет ↗
17. Как читать «паспорт рассуждения» модели ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы модуля, Jupyter-ноутбук и источники ↗

Мультимодальные LLM: зрение, аудио и видео

20 уроков
1. Мотивация: новая модальность становится новым бюджетом ↗
2. Историческая прогрессия: четыре семейства, которые продолжают… ↗
3. Мостик к классике: метрическое обучение, ViT и сигнальные… ↗
4. Базовый рецепт VLM: энкодер, коннектор и языковой декодер ↗
5. CLIP, SigLIP и пример C: читаем InfoNCE числом ↗
6. Решённый пример A: от разрешения к числу визуальных токенов ↗
7. Решённый пример B: когда визуальные токены попадают в KV-кэш ↗
8. Коннекторы и пример D: цена модульного рецепта ↗
9. Динамическое разрешение, тайлинг и M-RoPE ↗
10. Единое моделирование: общий интерфейс не требует одного… ↗
11. Решённый пример E: почему видео требует выборки и сжатия ↗
12. Thinker–Talker: совместное рассуждение и потоковая речь ↗
13. Код первого уровня: геометрия до фреймворка ↗
14. Второй уровень: что проверяет notebook ↗
15. Аудио как временная модальность ↗
16. Публично документированный ландшафт на 4 августа 2026 года ↗
17. Как читать мультимодальный паспорт модели ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы, notebook и источники ↗

Эмбеддинги, поиск и RAG

20 уроков
1. Мотивация: один вопрос и четыре потери информации ↗
2. Историческая прогрессия: каждый новый метод возвращал… ↗
3. Мостик к классике: три старых задачи внутри RAG ↗
4. BM25 и обучаемые разреженные представления: ветка точных термов ↗
5. Плотные bi-encoder-модели: как учат семантическое пространство ↗
6. MRL (Matryoshka Representation Learning), квантизация и… ↗
7. Один вектор, одна пара или матрица: где происходит… ↗
8. Решённый пример B: точный поиск и арифметика ANN (Approximate… ↗
9. ANN под капотом: три индекса для трёх ограничений ↗
10. Гибридный поиск, RRF (Reciprocal Rank Fusion) и решённый… ↗
11. Разбиение на фрагменты: что именно становится объектом поиска ↗
12. Полный каскад и решённый пример D: где живёт задержка ↗
13. Код первого уровня: гибридный поиск с явными контрактами ↗
14. Второй уровень: что проверяет notebook ↗
15. Эволюция RAG: каждый «продвинутый» метод исправляет… ↗
16. Решённый пример E: RAG или длинный контекст ↗
17. Оценка и паспорт эмбеддера ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы, notebook и источники ↗

Агенты и работа с инструментами

20 уроков
1. Мотивация: ответ становится траекторией ↗
2. Историческая прогрессия: расширялся не промпт, а контур… ↗
3. Мостик к классике: планирование, обратная связь и… ↗
4. Анатомия агентного цикла ↗
5. Вызов функций и управляемая генерация: от текста к… ↗
6. ReAct, CodeAct и Plan-and-Execute: три способа выразить… ↗
7. Решённый пример A: история цикла и цена повторного prefill ↗
8. Решённый пример B: из чего складывается один шаг ↗
9. MCP: стандарт соединения, а не разрешение действовать ↗
10. Производственный агент: исполняющая обвязка является частью… ↗
11. Решённый пример C: надёжность длинной траектории ↗
12. Параллельные субагенты и закон Амдала ↗
13. Код первого уровня: ограниченный цикл с явным протоколом ↗
14. Второй уровень: что проверяет ноутбук ↗
15. Ландшафт систем: сравниваем интерфейсы, а не логотипы ↗
16. Тестовые стенды: каждый измеряет другую пару «агент — среда» ↗
17. Паспорт исполняющей обвязки агента ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы, ноутбук и источники ↗

Оценка современных LLM: от бенчмарка к инженерному решению

20 уроков
1. Начинаем не со скора, а с решения ↗
2. Историческая линия: каждый новый жанр исправлял старый ↗
3. Три классических основания: психометрика, эксперимент и… ↗
4. Жизненный цикл бенчмарка: как измеритель теряет силу ↗
5. Карта оценки: сначала оси, затем названия наборов ↗
6. Решённый пример A: различимы ли 95,5% и 95,0%? ↗
7. Трудность бывает разной: HLE, FrontierMath и ARC-AGI ↗
8. pass@k: способность найти решение и надёжность — не одно и то же ↗
9. Парные предпочтения и композиты: полезные карты с чужой… ↗
10. Модель-судья: как порядок создаёт фантомную победу ↗
11. Мультимодальность, безопасность, правдивость и честность… ↗
12. Длинный контекст: принимает миллион токенов — значит ли… ↗
13. Собственная исполняющая обвязка: один вызов — один… ↗
14. Что делает notebook второго уровня ↗
15. Собственный золотой набор: семь шагов от продукта к CI ↗
16. Восемь направлений оценки по состоянию на август 2026 года ↗
17. Паспорт бенчмарка и результат оценки ↗
18. Вопросы для самопроверки ↗
19. Упражнения ↗
20. Ключевые выводы, финал курса и источники ↗

(справочный). Базовый Transformer

22 урока
1. Зачем Transformer вообще понадобился ↗
2. Карта обозначений и форм тензоров ↗
3. Шаг 1. Токены, эмбеддинги и позиции ↗
4. Шаг 2. Scaled dot-product attention ↗
5. Маски: кто имеет право кого видеть ↗
6. Multi-head attention ↗
7. FFN: нелинейное преобразование каждой позиции ↗
8. Residual connection и LayerNorm ↗
9. Encoder-слой и encoder-стек ↗
10. Decoder-слой и cross-attention ↗
11. Обучение: teacher forcing и cross-entropy ↗
12. Генерация: тот же forward, другой цикл ↗
13. Минимальная реализация scaled dot-product attention ↗
14. Минимальный Transformer-блок ↗
15. Полная трассировка форм на игрушечной модели ↗
16. Оригинал 2017 и современная LLM: что сохранилось ↗
17. Что часто путают ↗
18. Самопроверка ↗
19. Упражнения с решениями ↗
20. Ноутбук модуля ↗
21. Маршрут чтения и источники ↗
22. Итоговая шпаргалка и возврат в основной курс ↗

Capstone: собственная MiniLLM от данных до абляций

6 уроков
1. О проекте и рабочей среде ↗
2. Претрейн: данные, tokenizer и обучение ↗
3. Посттрейн: SFT и DPO ↗
4. Инференс: кэш, speculative decoding и квантизация ↗
5. Абляции и границы выводов ↗
6. Итоговый отчёт и самооценка ↗