Курс на Stepik
Обложка курса «Теория информации для машинного обучения от NLP и LLM до CV и RL» на Stepik
Бесплатно

Теория информации для машинного обучения от NLP и LLM до CV и RL ★ 5.000

Открыть на
STEPIK.ORG

Полностью бесплатный курс о том, как теория информации работает внутри современного ML: от энтропии, кросс-энтропии, KL и взаимной информации до кодирования, MaxEnt, Information Bottleneck, PAC-Bayes, LLM, CV и информационной геометрии. Математика вводится через функции потерь, вероятностные модели, представления, сжатие и инженерные компромиссы. Курс представляет информационно-теоретическую часть математического направления развивающейся серии курсов об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL»Учеников на курсе 107
Сертификаты, выданные на курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL»Сертификатов выдано 0
Отзывы о курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL»Отзывов получено 1
Рейтинг курса «Теория информации для машинного обучения от NLP и LLM до CV и RL»Рейтинг курса 5.000
Уроки в курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL»Количество уроков 205
Тесты в курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL»Количество квизов 377
Время прохождения курса «Теория информации для машинного обучения от NLP и LLM до CV и RL»Время прохождения курса —
Обновления курса «Теория информации для машинного обучения от NLP и LLM до CV и RL»Обновления курса — —
Дата публикации курса «Теория информации для машинного обучения от NLP и LLM до CV и RL»Дата публикации курса — ———
Последнее обновление курса «Теория информации для машинного обучения от NLP и LLM до CV и RL»Последнее обновление — ———
Сложность normal — ———

Содержание курса

Разделы в курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL» 16 разделов Уроки в курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL» 205 уроков Тесты в курсе «Теория информации для машинного обучения от NLP и LLM до CV и RL» 377 тестов Время прохождения курса «Теория информации для машинного обучения от NLP и LLM до CV и RL» 1 ч. Последнее обновление курса «Теория информации для машинного обучения от NLP и LLM до CV и RL» обн. 15 августа 2026

Введение

12 уроков
1. Информация и смысл: почему это не одно и то же ↗
2. Шенноновский фрейм: сила и ограничения ↗
3. Почему появляется логарифм: короткий мост к энтропии ↗
4. Как устроен курс и как его читать ↗
5. Обзор программы курса ↗
6. Литература: с чего начинать ↗
7. Справочная заметка: convex / concave (выпуклая / вогнутая… ↗
8. Справочник: подробная программа курса ↗
9. Справочник: полный аннотированный список литературы ↗
10. Факультативное математическое углубление I: равномерный источник ↗
11. Факультативное математическое углубление II: от группировки к… ↗
12. Вычислительный блок ↗

Энтропия

8 уроков
1. Энтропия: средний счёт за неопределённость ↗
2. Цепное правило: как разбить один счёт на токены ↗
3. От монеты к языку: энтропийная скорость ↗
4. Как читать энтропию языковой модели ↗
5. Упражнения ↗
6. Литература и первоисточники ↗
7. Вычислительный блок ↗
8. Решения упражнений ↗

Кросс-энтропия и KL-дивергенция

13 уроков
1. Модель отвечает распределением, мир — одним исходом ↗
2. Кросс-энтропия: средний счёт по вероятностям модели ↗
3. KL-дивергенция: часть потери, за которую отвечает модель ↗
4. Чужой код: как KL превращается в лишние биты ↗
5. Одна формула для классификации и языковой модели ↗
6. Почему CrossEntropyLoss так удобно оптимизировать ↗
7. Перплексия: возврат из логарифмической шкалы ↗
8. Математическое углубление: почему направление KL меняет ответ ↗
9. Карта KL-целевых функций в ML ↗
10. Упражнения ↗
11. Литература и первоисточники ↗
12. Вычислительный блок ↗
13. Решения упражнений ↗

Неравенство Йенсена: когда среднее встречает нелинейность

11 уроков
1. Сначала усреднить или сначала посчитать функцию потерь? ↗
2. Неравенство Йенсена: направление задаёт кривизна ↗
3. Ансамбли: точная гарантия для log-loss ↗
4. ELBO: логарифм стоит снаружи скрытых объяснений ↗
5. Log-sum inequality: что теряется при объединении состояний ↗
6. Одна теорема — четыре рабочих механизма ↗
7. Ключевые выводы модуля ↗
8. Упражнения ↗
9. Литература и первоисточники ↗
10. Вычислительный блок ↗
11. Решения упражнений ↗

Взаимная информация: сколько один объект говорит о другом

16 уроков
1. Признак полезен не сам по себе ↗
2. Одна величина — три чтения ↗
3. PMI: локальный логарифм связи ↗
4. Условная MI: что новый признак добавляет сверх известных ↗
5. DPI: энкодер может перепаковать информацию, но не напечатать… ↗
6. MI, корреляция и причинность отвечают на разные вопросы ↗
7. Шумные метки: когда 100% ошибок всё ещё несут один бит ↗
8. Отбор признаков: полезный фильтр, но не оракул ↗
9. InfoNCE: найти согласованную пару среди случайных ↗
10. Почему число MI трудно получить из выборки ↗
11. Энтропия attention — не взаимная информация ↗
12. Ключевые выводы модуля ↗
13. Упражнения ↗
14. Источники и дальнейшее чтение ↗
15. Вычислительный блок ↗
16. Решения упражнений ↗

Кодирование источника: от энтропии к реальным битам

16 уроков
1. Инженерная постановка: вероятностная модель и энтропийный кодер ↗
2. Префиксные коды и неравенство Крафта—Макмиллана ↗
3. Односимвольная теорема кодирования ↗
4. Хаффман, арифметическое кодирование и кодирование диапазонов ↗
5. Длинные последовательности: блочное кодирование, AEP и… ↗
6. Метрики языковой модели: PPL, BPC и BPB ↗
7. Языковая модель как часть компрессора ↗
8. Размер модели, законы масштабирования и полная длина описания ↗
9. Математическое углубление: универсальное кодирование… ↗
10. Связь качества сжатия и возможностей модели ↗
11. Практический протокол оценки LLM как компрессора ↗
12. Упражнения ↗
13. Заключение ↗
14. Основные источники ↗
15. Вычислительный блок ↗
16. Решения упражнений ↗

Канал и пропускная способность

16 уроков
1. Надёжная передача через шум ↗
2. Дискретный канал без памяти и блочный код ↗
3. Пропускная способность дискретного канала ↗
4. BSC, BEC и Z-канал ↗
5. Гауссовский канал и ограничение мощности ↗
6. Почему случайное кодирование достигает \(R<I(X;Y)\) ↗
7. Обратная теорема и конечная длина блока ↗
8. Шумные метки как канал ↗
9. Канальное кодирование в ML: ECOC и DeepJSCC ↗
10. LLM как канал: точная постановка и границы аналогии ↗
11. Как формализовать канал в ML-системе ↗
12. Упражнения ↗
13. Заключение ↗
14. Основные источники ↗
15. Вычислительный блок ↗
16. Решения упражнений ↗

Максимальная энтропия, экспоненциальные модели и…

15 уроков
1. От неполного знания к распределению ↗
2. Экспоненциальный наклон и информационная проекция ↗
3. Пространство состояний и базовая мера ↗
4. Классические MaxEnt-распределения и AWGN-канал ↗
5. Условный MaxEnt и лог-линейные модели ↗
6. Softmax как решение задачи «оценка + энтропия» ↗
7. Энергетические модели и нормировочная константа ↗
8. KL-регуляризованная политика и Gibbs-оптимум ↗
9. Переоптимизация награды и роль KL ↗
10. Математическое углубление: экспоненциальные семейства и… ↗
11. Упражнения ↗
12. Заключение ↗
13. Основные источники ↗
14. Вычислительный блок ↗
15. Решения упражнений ↗

Скорость–искажение и Information Bottleneck: как управлять…

14 уроков
1. Зачем модели забывать ↗
2. Теория скорости–искажения: сколько информации нужно сохранить ↗
3. Information Bottleneck: сохранить то, что важно для \(Y\) ↗
4. Variational Information Bottleneck: как сделать IB обучаемым ↗
5. VAE как система скорость–искажение ↗
6. Когда скорость становится реальными битами ↗
7. Как построить честную кривую скорость–искажение ↗
8. Информационная плоскость: цель обучения или описание динамики? ↗
9. Математическое углубление: I–MMSE и гауссовское зашумление ↗
10. Упражнения ↗
11. Ключевые выводы модуля ↗
12. Основные источники ↗
13. Вычислительный блок ↗
14. Решения упражнений ↗

Алгоритмическая теория информации: кратчайшие описания, MDL и…

14 уроков
1. От распределения к одному конкретному объекту ↗
2. Колмогоровская сложность и язык описания ↗
3. Несжимаемость, невычислимость и реальные компрессоры ↗
4. Связь с энтропией Шеннона ↗
5. Алгоритмическая вероятность и универсальное предсказание ↗
6. MDL в машинном обучении ↗
7. Сходство через совместное сжатие ↗
8. LLM и универсальное предсказание ↗
9. Математическое углубление: AIXI ↗
10. Факультативный физический мост: принцип Ландауэра ↗
11. Упражнения ↗
12. Ключевые выводы модуля ↗
13. Основные источники ↗
14. Решения упражнений ↗

Сравнение распределений: f-дивергенции, вариационные критики…

14 уроков
1. От двух выборок к задаче сравнения распределений ↗
2. f-дивергенции: одна схема, разные штрафы ↗
3. Какие различия видят f-дивергенции ↗
4. Классификатор оценивает отношение плотностей ↗
5. Вариационная форма: как сделать расхождение обучаемым ↗
6. GAN и f-GAN ↗
7. MINE и InfoNCE ↗
8. Интегральные вероятностные метрики: расстояние Вассерштейна и… ↗
9. Выбор расхождения в практической задаче ↗
10. Математическое углубление: общая мера и точная двойственность ↗
11. Упражнения ↗
12. Заключение ↗
13. Основные источники ↗
14. Решения упражнений ↗

Информационные границы обобщения: PAC-Bayes и взаимная…

14 уроков
1. Почему лучшая обучающая ошибка почти неизбежно слишком хороша ↗
2. От фиксированной модели к адаптивному выбору ↗
3. PAC-Bayes: распределение до данных и распределение после… ↗
4. PAC-Bayes-kl: сертификат для конкретной выборки ↗
5. От сертификата к обучаемому распределению ↗
6. MI-границы: обучение как канал от выборки к модели ↗
7. Точное разложение, связывающее PAC-Bayes и MI ↗
8. Связи с MDL, Information Bottleneck и KL-регуляризованными… ↗
9. Как построить практический PAC-Bayes-сертификат ↗
10. Математическое углубление: более локальные информационные цены ↗
11. Упражнения ↗
12. Ключевые выводы модуля ↗
13. Основные источники ↗
14. Решения упражнений ↗

Рассуждение в LLM: вычисление, поиск и информация

15 уроков
1. Что меняется, когда модель «думает дольше» ↗
2. Амортизация, рабочий черновик и поиск ↗
3. Почему промежуточные токены могут помогать ↗
4. Новая информация или новое вычисление? ↗
5. Что можно измерять по шагам ↗
6. Одна длинная траектория или много кандидатов? ↗
7. In-context learning: когда контекст действительно приносит… ↗
8. Как модели учатся рассуждать ↗
9. Как оценивать систему рассуждения ↗
10. Что доказано, что наблюдается и что пока служит гипотезой ↗
11. Математическое углубление: пошаговый информационный прирост ↗
12. Упражнения ↗
13. Заключение: информация не заменяет вычисление ↗
14. Основные источники ↗
15. Решения упражнений ↗

Компьютерное зрение через теорию информации

13 уроков
1. Почему компьютерное зрение — хороший полигон для теории… ↗
2. Нейронное сжатие изображений: энтропийная модель и реальный… ↗
3. Искажение и перцептивное качество ↗
4. Диффузионные модели: гауссовское зашумление, денойзинг и I–MMSE ↗
5. CLIP и контрастивное выравнивание изображений с текстом ↗
6. Самообучение визуальных представлений: инвариантности и… ↗
7. Сжатие CV-модели: квантизация, pruning и distillation ↗
8. Один CV-пайплайн, четыре разных информационных бюджета ↗
9. Математическое углубление: два точных расчёта ↗
10. Упражнения ↗
11. Заключение ↗
12. Основные источники ↗
13. Решения упражнений ↗

Информационная геометрия: Fisher, естественный градиент и…

13 уроков
1. Что значит «маленький шаг» для вероятностной модели ↗
2. Информация Фишера и локальная форма KL ↗
3. Естественный градиент: наискорейший спуск при малом изменении… ↗
4. Что именно называют «кривизной» в глубокой сети ↗
5. Геометрия политик: NPG, TRPO, PPO и KL в RLHF ↗
6. Wasserstein-геометрия и потоки распределений ↗
7. Экспоненциальные семейства, двойственные координаты и… ↗
8. Практическая карта: сначала выберите объект, затем геометрию ↗
9. Математическое углубление: α-геометрия и точные примеры ↗
10. Упражнения ↗
11. Заключение ↗
12. Основные источники ↗
13. Решения упражнений ↗

Памятка по курсу

1 урок
1. Памятка по курсу: ключевые идеи и формулы ↗