Содержание курса
Современный ландшафт LLM
23 урока
1.
Зачем инженеру карта ландшафта
↗
2.
Как курс читает код и какие системы служат референсами
↗
3.
Девять лет за пятнадцать минут: 2017 → 2026
↗
4.
Мостик к классике: систематика вместо зоопарка
↗
5.
Два паспорта: модель и система
↗
6.
Ось I крупным планом: dense и MoE
↗
7.
Решённый пример: gpt-oss-120b и Llama 4 Scout
↗
8.
Ось II: контекст — число, качество и цена
↗
9.
Ось III: модальности — вход, выход и место соединения
↗
10.
Ось IV: reasoning — кто управляет вычислительным бюджетом
↗
11.
Ось V: доступ, лицензия и практическая открытость
↗
12.
Ось VI: экономика — цена токена и цена системы
↗
13.
Датированный справочник: закрытые и API-семейства
↗
14.
Датированный справочник: открытые веса и воспроизводимые…
↗
15.
От публичного сигнала к доказательству: как читать результаты…
↗
16.
openai/gpt-oss как оглавление курса
↗
17.
Код (уровень 1): паспорт из проверенного config.json
↗
18.
Уровень 2: что в ноутбуке модуля
↗
19.
Карта курса и развивающейся серии
↗
20.
Вопросы для самопроверки
↗
21.
Упражнения с решениями
↗
22.
Резюме-шпаргалка
↗
23.
Ноутбук и источники
↗
Токенизация и эмбеддинги
17 уроков
1.
Зачем инженеру токенизация
↗
2.
Историческая прогрессия: от слов к байтам
↗
3.
Мостик к классике: токенизация как дискретное сжатие
↗
4.
Формализм: предварительное разбиение, BPE и BBPE
↗
5.
Решённый пример: от строки до кривой компрессии
↗
6.
Код первого уровня: учебный BBPE
↗
7.
Что добавляет notebook
↗
8.
Реальная реализация: o200k_base, Harmony и специальные токены
↗
9.
Ландшафт словарей: как читать числа доказательно
↗
10.
Fertility, fairness и доменные различия
↗
11.
Embedding-матрицы: первый и последний слой
↗
12.
Мультимодальная проекция: где аналогия с токенизацией полезна
↗
13.
Карта связей
↗
14.
Вопросы для самопроверки
↗
15.
Упражнения с решениями
↗
16.
Ключевые выводы модуля
↗
17.
Notebook и источники
↗
Позиционные кодировки: от синусоид к многомерному времени
18 уроков
1.
Мотивация: self-attention не знает порядка
↗
2.
Историческая прогрессия: от абсолютного индекса к…
↗
3.
Мостик к классике: Фурье, комплексные числа и относительная фаза
↗
4.
Формализм: от синусоид к вращению query и key
↗
5.
Решённый пример: один и тот же относительный сдвиг
↗
6.
Спектр частот: что действительно выбирает rope_theta
↗
7.
Расширение контекста: PI, NTK-aware scaling, YaRN и другие ветви
↗
8.
ALiBi: линейное позиционное смещение
↗
9.
NoPE: позиция без явного позиционного кодирования
↗
10.
Разбор конфигурации: что говорит gpt-oss и чего она не говорит
↗
11.
Код первого уровня: RoPE и YaRN с явными контрактами
↗
12.
Второй уровень: что проверяет ноутбук
↗
13.
Мультимодальная позиция: M-RoPE и TMRoPE
↗
14.
Современный ландшафт: методы сосуществуют
↗
15.
Вопросы для самопроверки
↗
16.
Упражнения с решениями
↗
17.
Ключевые выводы модуля
↗
18.
Ноутбук и первоисточники
↗
Современные механизмы внимания
20 уроков
1.
Мотивация: один запрос и два растущих счёта
↗
2.
Историческая прогрессия: сжатие состояния и перестройка…
↗
3.
Мостик к классике: ядро, распределение и память
↗
4.
Формализм: SDPA, маски и масштаб логитов
↗
5.
Решённый пример: MHA, MQA, GQA, MLA и реальный гибрид
↗
6.
MQA и GQA: общий K/V не означает одинаковый query
↗
7.
MLA: кэшировать латент, а не развернутые ключи и значения
↗
8.
FlashAttention: та же плотная функция, другой IO-граф
↗
9.
Sliding-window и гибридное attention
↗
10.
Два разных attention sink
↗
11.
Разреженное внимание: выбирать позиции, а не только формат кэша
↗
12.
Код первого уровня: прозрачный SDPA, GQA и окно
↗
13.
Второй уровень: что проверяет notebook
↗
14.
Читаем реальную реализацию gpt-oss
↗
15.
Современный ландшафт: читать механизм вместе с основанием
↗
16.
Мультимодальность: где встречаются визуальные и текстовые токены
↗
17.
Вопросы для самопроверки
↗
18.
Упражнения
↗
19.
Ключевые выводы модуля
↗
20.
Notebook и источники
↗
Нормализация, активации и анатомия блока
21 урок
1.
Мотивация: почему «мелочи» блока определяют судьбу обучения
↗
2.
Историческая прогрессия: несколько ответов на одну проблему…
↗
3.
Мостик к классике: стандартизация, численное интегрирование и…
↗
4.
Формализм: residual-поток как общий носитель состояния
↗
5.
LayerNorm и RMSNorm: что сохраняется, а что отбрасывается
↗
6.
Где поставить норму: Post-LN, Pre-LN, Peri-LN и OLMo2
↗
7.
Query-Key Normalization: контролируем масштаб логитов attention
↗
8.
FFN: почему одна нелинейность уступила гейтованной паре
↗
9.
SwiGLU: три матрицы, правило паритета и вариант gpt-oss
↗
10.
Решённый пример: Llama-3.1-8B до последнего параметра
↗
11.
DyT и DyISRU: можно ли заменить редукцию поэлементной функцией
↗
12.
mHC: ограничиваем не скрытые состояния, а матрицы…
↗
13.
Код первого уровня: RMSNorm, SwiGLU и residual block
↗
14.
Что проверяет ноутбук
↗
15.
Читаем публичную реализацию gpt-oss
↗
16.
Современные блоки: не каталог победителей, а паспорт…
↗
17.
Мультимодальность: тот же блок, но не одна история происхождения
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения с решениями
↗
20.
Ключевые выводы модуля
↗
21.
Ноутбук и первоисточники
↗
Mixture of Experts
20 уроков
1.
Мотивация: большая модель без полного вычисления на каждом…
↗
2.
Историческая линия: от локальных специалистов к триллионным…
↗
3.
Мост к классическим идеям: комитет, условные вычисления и…
↗
4.
Формализм: routed experts, shared experts и явная конвенция…
↗
5.
Решённый пример A: gpt-oss с параметрами смещения
↗
6.
Роутер крупным планом: числовая трассировка
↗
7.
Балансировка: от auxiliary objective к управлению маршрутом
↗
8.
Fine-grained и shared experts: больше комбинационной гибкости
↗
9.
Специализация: что можно и чего нельзя заключать из маршрутов
↗
10.
Инференс MoE: память, all-to-all и объединение экспертов по…
↗
11.
LatentMoE и адаптивная маршрутизация
↗
12.
Код первого уровня: прозрачный MoE с явными политиками
↗
13.
Второй уровень: что проверяет notebook
↗
14.
Чтение открытого кода gpt-oss
↗
15.
Современный ландшафт как паспорт свидетельств
↗
16.
Мультимодальность: общий роутер — один из вариантов, а не…
↗
17.
Вопросы для самопроверки
↗
18.
Упражнения с решениями
↗
19.
Ключевые выводы модуля
↗
20.
Notebook и источники
↗
Альтернативы Transformer: SSM, Mamba и гибриды
21 урок
1.
Мотивация: две разные цены длинного контекста
↗
2.
Историческая линия: от линейных систем к гибридным LLM
↗
3.
Три взгляда на одну рекуррентность
↗
4.
Формализм: дискретная SSM и Zero-Order Hold
↗
5.
Решённый пример A: когда приближение $\Delta B$ заметно…
↗
6.
Mamba: селективность и блок
↗
7.
Mamba-2 и State Space Duality
↗
8.
DeltaNet и Gated DeltaNet: память, которую можно исправлять
↗
9.
Фиксированное состояние и цена адресуемости
↗
10.
Арифметика сделки: полный cache и core FLOPs
↗
11.
Гибриды: три способа совместить сводку и адресацию
↗
12.
Код первого уровня: scan, delta rule и чанки
↗
13.
Что проверяет notebook
↗
14.
Как читать открытый код Mamba
↗
15.
Современный ландшафт: читать не название, а контракт
↗
16.
Аудио, видео и другие длинные потоки
↗
17.
Вопросы для самопроверки
↗
18.
Упражнения
↗
19.
Ключевые выводы модуля
↗
20.
Notebook и первоисточники
↗
21.
Доп.модуль 7b: Диффузионные LLM (dLLM)
↗
Претрейн: данные, законы масштабирования, оптимизаторы
20 уроков
1.
Мотивация: три вопроса одного забега
↗
2.
Историческая прогрессия: как менялся главный ограничивающий…
↗
3.
Мостик к классике: три знакомых сюжета
↗
4.
Формализм: бюджет, аппроксимирующая зависимость и…
↗
5.
Данные: как сырой веб становится обучающим корпусом
↗
6.
Решённый пример A: два бюджета и цена упрощённого правила
↗
7.
Геометрия isoFLOP — и решённое У1: цена долгого обучения…
↗
8.
За пределами Chinchilla: когда более долго обученная…
↗
9.
Стена данных: когда токены перестают быть взаимозаменяемыми
↗
10.
Оптимизаторы: зачем Muon выравнивает спектр обновления
↗
11.
MuonClip: почему иногда надо исправлять не логиты, а веса
↗
12.
Код (уровень 1): маленькие функции, которые не скрывают…
↗
13.
Уровень 2: как читать ноутбук модуля
↗
14.
µP и MetaP: как переносить гиперпараметры с малой…
↗
15.
Параллелизм: как разложить состояние модели по кластеру
↗
16.
Претрейн в 2026 году: не список приёмов, а четыре направления
↗
17.
Паспорта запусков: что можно узнать из технического отчёта
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы модуля, ноутбук и источники
↗
KV-кэши и эффективный инференс
20 уроков
1.
Мотивация: почему инференс становится задачей о памяти
↗
2.
Историческая прогрессия: от компактного KV-состояния к…
↗
3.
Мостик к классическим системам: страницы, иерархия и очереди
↗
4.
Формализм и решённый пример A: сколько памяти добавляет один…
↗
5.
Две фазы одного запроса: prefill и decode
↗
6.
Решённый пример B: как KV-кэш снижает верхнюю границу по…
↗
7.
Батч-экономика: где заканчивается амортизация весов
↗
8.
PagedAttention: отделить логический контекст от физического…
↗
9.
Кэширование префикса: не пересчитывать одинаковое начало
↗
10.
Многоуровневое размещение: когда одного уровня памяти…
↗
11.
Разделение prefill и decode: каждой фазе свой пул
↗
12.
Код (уровень 1): геометрия, верхняя граница по памяти и страницы
↗
13.
Уровень 2: что проверяет ноутбук модуля
↗
14.
Компрессия I: вытеснение — выбрать, какие позиции сохранить
↗
15.
Компрессия II: квантование, низкоранговое представление и…
↗
16.
Движки и контракты кэширования: карта стека на 3 августа 2026…
↗
17.
Как читать паспорт инференса модели
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы, ноутбук и источники
↗
Спекулятивное декодирование и квантизация
20 уроков
1.
Мотивация: два способа снизить стоимость токена
↗
2.
Как сложились два направления
↗
3.
Три классические идеи под современными названиями
↗
4.
Точный спекулятивный цикл
↗
5.
Решённый пример A: баланс на пяти токенах
↗
6.
Сколько токенов приносит один цикл
↗
7.
Цена цикла и выбор длины черновика
↗
8.
Откуда брать черновик
↗
9.
MTP как встроенный источник предложений
↗
10.
Почему проверка похожа на короткий prefill
↗
11.
Квантизация после обучения: что именно уменьшается
↗
12.
FP4, микромасштабирование и W4A4
↗
13.
Код: корректность раньше ускорения
↗
14.
Что проверяет ноутбук
↗
15.
Как сочетать квантизацию и спекулятивное декодирование
↗
16.
Движки и безопасный порядок развёртывания
↗
17.
Паспорт запуска: квантизация и спекулятивное декодирование
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы модуля, ноутбук и источники
↗
SFT и работа с данными
20 уроков
1.
Мотивация: от продолжения текста к управляемому поведению
↗
2.
Как сложился современный SFT
↗
3.
Три классические идеи за современной терминологией
↗
4.
Формат данных: шаблон является частью модели
↗
5.
Маскирование функции потерь и пример A: 21 токен из 56
↗
6.
Упаковка примеров и пример B: 24 последовательности → 5…
↗
7.
Гиперпараметры и стоимость этапа: пример C
↗
8.
Данные I: не каталог, а карта функций
↗
9.
Данные II: чему действительно учит LIMA
↗
10.
Синтетические данные и пример E: best-of-N с верификатором
↗
11.
SFT на решениях и пример F: что означают «девять минут»
↗
12.
SFT для работы с инструментами
↗
13.
Код первого уровня: метки и трассируемая упаковка
↗
14.
Второй уровень: что проверяет ноутбук
↗
15.
Дистилляция: что именно переносит учитель
↗
16.
PEFT и пример D: сколько действительно обучает LoRA
↗
17.
Как читать паспорт модели после SFT
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы модуля, ноутбук и источники
↗
Обучение по обратной связи: RLHF, DPO, RLOO и GRPO
20 уроков
1.
Мотивация: когда демонстрации уже недостаточно
↗
2.
Как менялся основной маршрут постобучения
↗
3.
Три классические идеи за современной терминологией
↗
4.
Классический RLHF: три стадии и четыре логические роли
↗
5.
Решённый пример A: читаем Bradley–Terry в обе стороны
↗
6.
DPO: как исключить явную модель вознаграждения
↗
7.
Решённый пример B: что именно делает коэффициент $\beta$
↗
8.
Семейство прямых методов: какую часть контракта они меняют
↗
9.
RLOO и GRPO: базовая линия из нескольких ответов
↗
10.
Решённый пример D: учебная анатомия памяти
↗
11.
Решённый пример E: почему сбор траекторий становится узким…
↗
12.
После GRPO: какие проблемы исправляют новые методы
↗
13.
Код первого уровня: три минимальных примитива
↗
14.
Второй уровень: что делает ноутбук
↗
15.
RLVR, Goodhart и взлом проверяющего сигнала
↗
16.
Constitutional AI, R1 и интерактивные среды
↗
17.
Как читать паспорт постобучения
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы, ноутбук и источники
↗
Модели рассуждения и вычисления во время вывода (test-time…
20 уроков
1.
Мотивация: вторая ось масштабирования
↗
2.
Историческая дуга: от длинной цепочки к управлению бюджетом
↗
3.
Мостик к классике: три знакомых предка
↗
4.
Анатомия модели рассуждения и карта режимов
↗
5.
Рецепт DeepSeek-R1 и феномен R1-Zero
↗
6.
Параллельное масштабирование: решённый пример A — сюрприз…
↗
7.
Решённый пример B: верификатор вместо голосования
↗
8.
Последовательное масштабирование и budget forcing
↗
9.
Когда думать дольше — хуже
↗
10.
Решённый пример C: учебная лестница бюджета в секундах и FLOPs
↗
11.
Решённый пример D: KV-цена мысли
↗
12.
Решённый пример E: зачем нужен адаптивный бюджет
↗
13.
Код, уровень 1: точный контракт отбора и цена токенов
↗
14.
Уровень 2: что находится в Jupyter-ноутбуке модуля
↗
15.
Кто проверяет решение: от точного правила до верификатора…
↗
16.
Дистилляция рассуждений: что переносится, а что нет
↗
17.
Как читать «паспорт рассуждения» модели
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы модуля, Jupyter-ноутбук и источники
↗
Мультимодальные LLM: зрение, аудио и видео
20 уроков
1.
Мотивация: новая модальность становится новым бюджетом
↗
2.
Историческая прогрессия: четыре семейства, которые продолжают…
↗
3.
Мостик к классике: метрическое обучение, ViT и сигнальные…
↗
4.
Базовый рецепт VLM: энкодер, коннектор и языковой декодер
↗
5.
CLIP, SigLIP и пример C: читаем InfoNCE числом
↗
6.
Решённый пример A: от разрешения к числу визуальных токенов
↗
7.
Решённый пример B: когда визуальные токены попадают в KV-кэш
↗
8.
Коннекторы и пример D: цена модульного рецепта
↗
9.
Динамическое разрешение, тайлинг и M-RoPE
↗
10.
Единое моделирование: общий интерфейс не требует одного…
↗
11.
Решённый пример E: почему видео требует выборки и сжатия
↗
12.
Thinker–Talker: совместное рассуждение и потоковая речь
↗
13.
Код первого уровня: геометрия до фреймворка
↗
14.
Второй уровень: что проверяет notebook
↗
15.
Аудио как временная модальность
↗
16.
Публично документированный ландшафт на 4 августа 2026 года
↗
17.
Как читать мультимодальный паспорт модели
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы, notebook и источники
↗
Эмбеддинги, поиск и RAG
20 уроков
1.
Мотивация: один вопрос и четыре потери информации
↗
2.
Историческая прогрессия: каждый новый метод возвращал…
↗
3.
Мостик к классике: три старых задачи внутри RAG
↗
4.
BM25 и обучаемые разреженные представления: ветка точных термов
↗
5.
Плотные bi-encoder-модели: как учат семантическое пространство
↗
6.
MRL (Matryoshka Representation Learning), квантизация и…
↗
7.
Один вектор, одна пара или матрица: где происходит…
↗
8.
Решённый пример B: точный поиск и арифметика ANN (Approximate…
↗
9.
ANN под капотом: три индекса для трёх ограничений
↗
10.
Гибридный поиск, RRF (Reciprocal Rank Fusion) и решённый…
↗
11.
Разбиение на фрагменты: что именно становится объектом поиска
↗
12.
Полный каскад и решённый пример D: где живёт задержка
↗
13.
Код первого уровня: гибридный поиск с явными контрактами
↗
14.
Второй уровень: что проверяет notebook
↗
15.
Эволюция RAG: каждый «продвинутый» метод исправляет…
↗
16.
Решённый пример E: RAG или длинный контекст
↗
17.
Оценка и паспорт эмбеддера
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы, notebook и источники
↗
Агенты и работа с инструментами
20 уроков
1.
Мотивация: ответ становится траекторией
↗
2.
Историческая прогрессия: расширялся не промпт, а контур…
↗
3.
Мостик к классике: планирование, обратная связь и…
↗
4.
Анатомия агентного цикла
↗
5.
Вызов функций и управляемая генерация: от текста к…
↗
6.
ReAct, CodeAct и Plan-and-Execute: три способа выразить…
↗
7.
Решённый пример A: история цикла и цена повторного prefill
↗
8.
Решённый пример B: из чего складывается один шаг
↗
9.
MCP: стандарт соединения, а не разрешение действовать
↗
10.
Производственный агент: исполняющая обвязка является частью…
↗
11.
Решённый пример C: надёжность длинной траектории
↗
12.
Параллельные субагенты и закон Амдала
↗
13.
Код первого уровня: ограниченный цикл с явным протоколом
↗
14.
Второй уровень: что проверяет ноутбук
↗
15.
Ландшафт систем: сравниваем интерфейсы, а не логотипы
↗
16.
Тестовые стенды: каждый измеряет другую пару «агент — среда»
↗
17.
Паспорт исполняющей обвязки агента
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы, ноутбук и источники
↗
Оценка современных LLM: от бенчмарка к инженерному решению
20 уроков
1.
Начинаем не со скора, а с решения
↗
2.
Историческая линия: каждый новый жанр исправлял старый
↗
3.
Три классических основания: психометрика, эксперимент и…
↗
4.
Жизненный цикл бенчмарка: как измеритель теряет силу
↗
5.
Карта оценки: сначала оси, затем названия наборов
↗
6.
Решённый пример A: различимы ли 95,5% и 95,0%?
↗
7.
Трудность бывает разной: HLE, FrontierMath и ARC-AGI
↗
8.
pass@k: способность найти решение и надёжность — не одно и то же
↗
9.
Парные предпочтения и композиты: полезные карты с чужой…
↗
10.
Модель-судья: как порядок создаёт фантомную победу
↗
11.
Мультимодальность, безопасность, правдивость и честность…
↗
12.
Длинный контекст: принимает миллион токенов — значит ли…
↗
13.
Собственная исполняющая обвязка: один вызов — один…
↗
14.
Что делает notebook второго уровня
↗
15.
Собственный золотой набор: семь шагов от продукта к CI
↗
16.
Восемь направлений оценки по состоянию на август 2026 года
↗
17.
Паспорт бенчмарка и результат оценки
↗
18.
Вопросы для самопроверки
↗
19.
Упражнения
↗
20.
Ключевые выводы, финал курса и источники
↗
(справочный). Базовый Transformer
22 урока
1.
Зачем Transformer вообще понадобился
↗
2.
Карта обозначений и форм тензоров
↗
3.
Шаг 1. Токены, эмбеддинги и позиции
↗
4.
Шаг 2. Scaled dot-product attention
↗
5.
Маски: кто имеет право кого видеть
↗
6.
Multi-head attention
↗
7.
FFN: нелинейное преобразование каждой позиции
↗
8.
Residual connection и LayerNorm
↗
9.
Encoder-слой и encoder-стек
↗
10.
Decoder-слой и cross-attention
↗
11.
Обучение: teacher forcing и cross-entropy
↗
12.
Генерация: тот же forward, другой цикл
↗
13.
Минимальная реализация scaled dot-product attention
↗
14.
Минимальный Transformer-блок
↗
15.
Полная трассировка форм на игрушечной модели
↗
16.
Оригинал 2017 и современная LLM: что сохранилось
↗
17.
Что часто путают
↗
18.
Самопроверка
↗
19.
Упражнения с решениями
↗
20.
Ноутбук модуля
↗
21.
Маршрут чтения и источники
↗
22.
Итоговая шпаргалка и возврат в основной курс
↗
Capstone: собственная MiniLLM от данных до абляций
6 уроков
1.
О проекте и рабочей среде
↗
2.
Претрейн: данные, tokenizer и обучение
↗
3.
Посттрейн: SFT и DPO
↗
4.
Инференс: кэш, speculative decoding и квантизация
↗
5.
Абляции и границы выводов
↗
6.
Итоговый отчёт и самооценка
↗