Содержание курса
Введение
12 уроков
1.
Информация и смысл: почему это не одно и то же
↗
2.
Шенноновский фрейм: сила и ограничения
↗
3.
Почему появляется логарифм: короткий мост к энтропии
↗
4.
Как устроен курс и как его читать
↗
5.
Обзор программы курса
↗
6.
Литература: с чего начинать
↗
7.
Справочная заметка: convex / concave (выпуклая / вогнутая…
↗
8.
Справочник: подробная программа курса
↗
9.
Справочник: полный аннотированный список литературы
↗
10.
Факультативное математическое углубление I: равномерный источник
↗
11.
Факультативное математическое углубление II: от группировки к…
↗
12.
Вычислительный блок
↗
Энтропия
8 уроков
1.
Энтропия: средний счёт за неопределённость
↗
2.
Цепное правило: как разбить один счёт на токены
↗
3.
От монеты к языку: энтропийная скорость
↗
4.
Как читать энтропию языковой модели
↗
5.
Упражнения
↗
6.
Литература и первоисточники
↗
7.
Вычислительный блок
↗
8.
Решения упражнений
↗
Кросс-энтропия и KL-дивергенция
13 уроков
1.
Модель отвечает распределением, мир — одним исходом
↗
2.
Кросс-энтропия: средний счёт по вероятностям модели
↗
3.
KL-дивергенция: часть потери, за которую отвечает модель
↗
4.
Чужой код: как KL превращается в лишние биты
↗
5.
Одна формула для классификации и языковой модели
↗
6.
Почему CrossEntropyLoss так удобно оптимизировать
↗
7.
Перплексия: возврат из логарифмической шкалы
↗
8.
Математическое углубление: почему направление KL меняет ответ
↗
9.
Карта KL-целевых функций в ML
↗
10.
Упражнения
↗
11.
Литература и первоисточники
↗
12.
Вычислительный блок
↗
13.
Решения упражнений
↗
Неравенство Йенсена: когда среднее встречает нелинейность
11 уроков
1.
Сначала усреднить или сначала посчитать функцию потерь?
↗
2.
Неравенство Йенсена: направление задаёт кривизна
↗
3.
Ансамбли: точная гарантия для log-loss
↗
4.
ELBO: логарифм стоит снаружи скрытых объяснений
↗
5.
Log-sum inequality: что теряется при объединении состояний
↗
6.
Одна теорема — четыре рабочих механизма
↗
7.
Ключевые выводы модуля
↗
8.
Упражнения
↗
9.
Литература и первоисточники
↗
10.
Вычислительный блок
↗
11.
Решения упражнений
↗
Взаимная информация: сколько один объект говорит о другом
16 уроков
1.
Признак полезен не сам по себе
↗
2.
Одна величина — три чтения
↗
3.
PMI: локальный логарифм связи
↗
4.
Условная MI: что новый признак добавляет сверх известных
↗
5.
DPI: энкодер может перепаковать информацию, но не напечатать…
↗
6.
MI, корреляция и причинность отвечают на разные вопросы
↗
7.
Шумные метки: когда 100% ошибок всё ещё несут один бит
↗
8.
Отбор признаков: полезный фильтр, но не оракул
↗
9.
InfoNCE: найти согласованную пару среди случайных
↗
10.
Почему число MI трудно получить из выборки
↗
11.
Энтропия attention — не взаимная информация
↗
12.
Ключевые выводы модуля
↗
13.
Упражнения
↗
14.
Источники и дальнейшее чтение
↗
15.
Вычислительный блок
↗
16.
Решения упражнений
↗
Кодирование источника: от энтропии к реальным битам
16 уроков
1.
Инженерная постановка: вероятностная модель и энтропийный кодер
↗
2.
Префиксные коды и неравенство Крафта—Макмиллана
↗
3.
Односимвольная теорема кодирования
↗
4.
Хаффман, арифметическое кодирование и кодирование диапазонов
↗
5.
Длинные последовательности: блочное кодирование, AEP и…
↗
6.
Метрики языковой модели: PPL, BPC и BPB
↗
7.
Языковая модель как часть компрессора
↗
8.
Размер модели, законы масштабирования и полная длина описания
↗
9.
Математическое углубление: универсальное кодирование…
↗
10.
Связь качества сжатия и возможностей модели
↗
11.
Практический протокол оценки LLM как компрессора
↗
12.
Упражнения
↗
13.
Заключение
↗
14.
Основные источники
↗
15.
Вычислительный блок
↗
16.
Решения упражнений
↗
Канал и пропускная способность
16 уроков
1.
Надёжная передача через шум
↗
2.
Дискретный канал без памяти и блочный код
↗
3.
Пропускная способность дискретного канала
↗
4.
BSC, BEC и Z-канал
↗
5.
Гауссовский канал и ограничение мощности
↗
6.
Почему случайное кодирование достигает \(R<I(X;Y)\)
↗
7.
Обратная теорема и конечная длина блока
↗
8.
Шумные метки как канал
↗
9.
Канальное кодирование в ML: ECOC и DeepJSCC
↗
10.
LLM как канал: точная постановка и границы аналогии
↗
11.
Как формализовать канал в ML-системе
↗
12.
Упражнения
↗
13.
Заключение
↗
14.
Основные источники
↗
15.
Вычислительный блок
↗
16.
Решения упражнений
↗
Максимальная энтропия, экспоненциальные модели и…
15 уроков
1.
От неполного знания к распределению
↗
2.
Экспоненциальный наклон и информационная проекция
↗
3.
Пространство состояний и базовая мера
↗
4.
Классические MaxEnt-распределения и AWGN-канал
↗
5.
Условный MaxEnt и лог-линейные модели
↗
6.
Softmax как решение задачи «оценка + энтропия»
↗
7.
Энергетические модели и нормировочная константа
↗
8.
KL-регуляризованная политика и Gibbs-оптимум
↗
9.
Переоптимизация награды и роль KL
↗
10.
Математическое углубление: экспоненциальные семейства и…
↗
11.
Упражнения
↗
12.
Заключение
↗
13.
Основные источники
↗
14.
Вычислительный блок
↗
15.
Решения упражнений
↗
Скорость–искажение и Information Bottleneck: как управлять…
14 уроков
1.
Зачем модели забывать
↗
2.
Теория скорости–искажения: сколько информации нужно сохранить
↗
3.
Information Bottleneck: сохранить то, что важно для \(Y\)
↗
4.
Variational Information Bottleneck: как сделать IB обучаемым
↗
5.
VAE как система скорость–искажение
↗
6.
Когда скорость становится реальными битами
↗
7.
Как построить честную кривую скорость–искажение
↗
8.
Информационная плоскость: цель обучения или описание динамики?
↗
9.
Математическое углубление: I–MMSE и гауссовское зашумление
↗
10.
Упражнения
↗
11.
Ключевые выводы модуля
↗
12.
Основные источники
↗
13.
Вычислительный блок
↗
14.
Решения упражнений
↗
Алгоритмическая теория информации: кратчайшие описания, MDL и…
14 уроков
1.
От распределения к одному конкретному объекту
↗
2.
Колмогоровская сложность и язык описания
↗
3.
Несжимаемость, невычислимость и реальные компрессоры
↗
4.
Связь с энтропией Шеннона
↗
5.
Алгоритмическая вероятность и универсальное предсказание
↗
6.
MDL в машинном обучении
↗
7.
Сходство через совместное сжатие
↗
8.
LLM и универсальное предсказание
↗
9.
Математическое углубление: AIXI
↗
10.
Факультативный физический мост: принцип Ландауэра
↗
11.
Упражнения
↗
12.
Ключевые выводы модуля
↗
13.
Основные источники
↗
14.
Решения упражнений
↗
Сравнение распределений: f-дивергенции, вариационные критики…
14 уроков
1.
От двух выборок к задаче сравнения распределений
↗
2.
f-дивергенции: одна схема, разные штрафы
↗
3.
Какие различия видят f-дивергенции
↗
4.
Классификатор оценивает отношение плотностей
↗
5.
Вариационная форма: как сделать расхождение обучаемым
↗
6.
GAN и f-GAN
↗
7.
MINE и InfoNCE
↗
8.
Интегральные вероятностные метрики: расстояние Вассерштейна и…
↗
9.
Выбор расхождения в практической задаче
↗
10.
Математическое углубление: общая мера и точная двойственность
↗
11.
Упражнения
↗
12.
Заключение
↗
13.
Основные источники
↗
14.
Решения упражнений
↗
Информационные границы обобщения: PAC-Bayes и взаимная…
14 уроков
1.
Почему лучшая обучающая ошибка почти неизбежно слишком хороша
↗
2.
От фиксированной модели к адаптивному выбору
↗
3.
PAC-Bayes: распределение до данных и распределение после…
↗
4.
PAC-Bayes-kl: сертификат для конкретной выборки
↗
5.
От сертификата к обучаемому распределению
↗
6.
MI-границы: обучение как канал от выборки к модели
↗
7.
Точное разложение, связывающее PAC-Bayes и MI
↗
8.
Связи с MDL, Information Bottleneck и KL-регуляризованными…
↗
9.
Как построить практический PAC-Bayes-сертификат
↗
10.
Математическое углубление: более локальные информационные цены
↗
11.
Упражнения
↗
12.
Ключевые выводы модуля
↗
13.
Основные источники
↗
14.
Решения упражнений
↗
Рассуждение в LLM: вычисление, поиск и информация
15 уроков
1.
Что меняется, когда модель «думает дольше»
↗
2.
Амортизация, рабочий черновик и поиск
↗
3.
Почему промежуточные токены могут помогать
↗
4.
Новая информация или новое вычисление?
↗
5.
Что можно измерять по шагам
↗
6.
Одна длинная траектория или много кандидатов?
↗
7.
In-context learning: когда контекст действительно приносит…
↗
8.
Как модели учатся рассуждать
↗
9.
Как оценивать систему рассуждения
↗
10.
Что доказано, что наблюдается и что пока служит гипотезой
↗
11.
Математическое углубление: пошаговый информационный прирост
↗
12.
Упражнения
↗
13.
Заключение: информация не заменяет вычисление
↗
14.
Основные источники
↗
15.
Решения упражнений
↗
Компьютерное зрение через теорию информации
13 уроков
1.
Почему компьютерное зрение — хороший полигон для теории…
↗
2.
Нейронное сжатие изображений: энтропийная модель и реальный…
↗
3.
Искажение и перцептивное качество
↗
4.
Диффузионные модели: гауссовское зашумление, денойзинг и I–MMSE
↗
5.
CLIP и контрастивное выравнивание изображений с текстом
↗
6.
Самообучение визуальных представлений: инвариантности и…
↗
7.
Сжатие CV-модели: квантизация, pruning и distillation
↗
8.
Один CV-пайплайн, четыре разных информационных бюджета
↗
9.
Математическое углубление: два точных расчёта
↗
10.
Упражнения
↗
11.
Заключение
↗
12.
Основные источники
↗
13.
Решения упражнений
↗
Информационная геометрия: Fisher, естественный градиент и…
13 уроков
1.
Что значит «маленький шаг» для вероятностной модели
↗
2.
Информация Фишера и локальная форма KL
↗
3.
Естественный градиент: наискорейший спуск при малом изменении…
↗
4.
Что именно называют «кривизной» в глубокой сети
↗
5.
Геометрия политик: NPG, TRPO, PPO и KL в RLHF
↗
6.
Wasserstein-геометрия и потоки распределений
↗
7.
Экспоненциальные семейства, двойственные координаты и…
↗
8.
Практическая карта: сначала выберите объект, затем геометрию
↗
9.
Математическое углубление: α-геометрия и точные примеры
↗
10.
Упражнения
↗
11.
Заключение
↗
12.
Основные источники
↗
13.
Решения упражнений
↗
Памятка по курсу
1 урок
1.
Памятка по курсу: ключевые идеи и формулы
↗