Курс на Stepik
Обложка курса «Теория информации для машинного обучения от NLP и LLM до CV» на Stepik
Бесплатно

Теория информации для машинного обучения от NLP и LLM до CV 0.000

Открыть на
STEPIK.ORG

Полностью бесплатный курс о том, как теория информации работает внутри современного ML: от энтропии, кросс-энтропии, KL и взаимной информации до кодирования, MaxEnt, Information Bottleneck, PAC-Bayes, LLM, CV и информационной геометрии. Математика вводится через функции потерь, вероятностные модели, представления, сжатие и инженерные компромиссы. Курс представляет информационно-теоретическую часть математического направления развивающейся серии курсов об ML и LLM.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Теория информации для машинного обучения от NLP и LLM до CV»Учеников на курсе 0
Сертификаты, выданные на курсе «Теория информации для машинного обучения от NLP и LLM до CV»Сертификатов выдано 0
Отзывы о курсе «Теория информации для машинного обучения от NLP и LLM до CV»Отзывов получено 0
Рейтинг курса «Теория информации для машинного обучения от NLP и LLM до CV»Рейтинг курса 0.000
Уроки в курсе «Теория информации для машинного обучения от NLP и LLM до CV»Количество уроков 205
Тесты в курсе «Теория информации для машинного обучения от NLP и LLM до CV»Количество квизов 377
Обновления курса «Теория информации для машинного обучения от NLP и LLM до CV»Обновления курса
Дата публикации курса «Теория информации для машинного обучения от NLP и LLM до CV»Дата публикации курса
Последнее обновление курса «Теория информации для машинного обучения от NLP и LLM до CV»Последнее обновление
Сложность normal

Содержание курса

Разделы в курсе «Теория информации для машинного обучения от NLP и LLM до CV» 16 разделов Уроки в курсе «Теория информации для машинного обучения от NLP и LLM до CV» 205 уроков Тесты в курсе «Теория информации для машинного обучения от NLP и LLM до CV» 377 тестов Последнее обновление курса «Теория информации для машинного обучения от NLP и LLM до CV» обн. 9 августа 2026

Введение

12 уроков
1. Информация и смысл: почему это не одно и то же
2. Шенноновский фрейм: сила и ограничения
3. Почему появляется логарифм: короткий мост к энтропии
4. Как устроен курс и как его читать
5. Обзор программы курса
6. Литература: с чего начинать
7. Справочная заметка: convex / concave (выпуклая / вогнутая…
8. Справочник: подробная программа курса
9. Справочник: полный аннотированный список литературы
10. Факультативное математическое углубление I: равномерный источник
11. Факультативное математическое углубление II: от группировки к…
12. Вычислительный блок

Энтропия

8 уроков
1. Энтропия: средний счёт за неопределённость
2. Цепное правило: как разбить один счёт на токены
3. От монеты к языку: энтропийная скорость
4. Как читать энтропию языковой модели
5. Упражнения
6. Литература и первоисточники
7. Вычислительный блок
8. Решения упражнений

Кросс-энтропия и KL-дивергенция

13 уроков
1. Модель отвечает распределением, мир — одним исходом
2. Кросс-энтропия: средний счёт по вероятностям модели
3. KL-дивергенция: часть потери, за которую отвечает модель
4. Чужой код: как KL превращается в лишние биты
5. Одна формула для классификации и языковой модели
6. Почему CrossEntropyLoss так удобно оптимизировать
7. Перплексия: возврат из логарифмической шкалы
8. Математическое углубление: почему направление KL меняет ответ
9. Карта KL-целевых функций в ML
10. Упражнения
11. Литература и первоисточники
12. Вычислительный блок
13. Решения упражнений

Неравенство Йенсена: когда среднее встречает нелинейность

11 уроков
1. Сначала усреднить или сначала посчитать функцию потерь?
2. Неравенство Йенсена: направление задаёт кривизна
3. Ансамбли: точная гарантия для log-loss
4. ELBO: логарифм стоит снаружи скрытых объяснений
5. Log-sum inequality: что теряется при объединении состояний
6. Одна теорема — четыре рабочих механизма
7. Ключевые выводы модуля
8. Упражнения
9. Литература и первоисточники
10. Вычислительный блок
11. Решения упражнений

Взаимная информация: сколько один объект говорит о другом

16 уроков
1. Признак полезен не сам по себе
2. Одна величина — три чтения
3. PMI: локальный логарифм связи
4. Условная MI: что новый признак добавляет сверх известных
5. DPI: энкодер может перепаковать информацию, но не напечатать…
6. MI, корреляция и причинность отвечают на разные вопросы
7. Шумные метки: когда 100% ошибок всё ещё несут один бит
8. Отбор признаков: полезный фильтр, но не оракул
9. InfoNCE: найти согласованную пару среди случайных
10. Почему число MI трудно получить из выборки
11. Энтропия attention — не взаимная информация
12. Ключевые выводы модуля
13. Упражнения
14. Источники и дальнейшее чтение
15. Вычислительный блок
16. Решения упражнений

Кодирование источника: от энтропии к реальным битам

16 уроков
1. Инженерная постановка: вероятностная модель и энтропийный кодер
2. Префиксные коды и неравенство Крафта—Макмиллана
3. Односимвольная теорема кодирования
4. Хаффман, арифметическое кодирование и кодирование диапазонов
5. Длинные последовательности: блочное кодирование, AEP и…
6. Метрики языковой модели: PPL, BPC и BPB
7. Языковая модель как часть компрессора
8. Размер модели, законы масштабирования и полная длина описания
9. Математическое углубление: универсальное кодирование…
10. Связь качества сжатия и возможностей модели
11. Практический протокол оценки LLM как компрессора
12. Упражнения
13. Заключение
14. Основные источники
15. Вычислительный блок
16. Решения упражнений

Канал и пропускная способность

16 уроков
1. Надёжная передача через шум
2. Дискретный канал без памяти и блочный код
3. Пропускная способность дискретного канала
4. BSC, BEC и Z-канал
5. Гауссовский канал и ограничение мощности
6. Почему случайное кодирование достигает \(R<I(X;Y)\)
7. Обратная теорема и конечная длина блока
8. Шумные метки как канал
9. Канальное кодирование в ML: ECOC и DeepJSCC
10. LLM как канал: точная постановка и границы аналогии
11. Как формализовать канал в ML-системе
12. Упражнения
13. Заключение
14. Основные источники
15. Вычислительный блок
16. Решения упражнений

Максимальная энтропия, экспоненциальные модели и…

15 уроков
1. От неполного знания к распределению
2. Экспоненциальный наклон и информационная проекция
3. Пространство состояний и базовая мера
4. Классические MaxEnt-распределения и AWGN-канал
5. Условный MaxEnt и лог-линейные модели
6. Softmax как решение задачи «оценка + энтропия»
7. Энергетические модели и нормировочная константа
8. KL-регуляризованная политика и Gibbs-оптимум
9. Переоптимизация награды и роль KL
10. Математическое углубление: экспоненциальные семейства и…
11. Упражнения
12. Заключение
13. Основные источники
14. Вычислительный блок
15. Решения упражнений

Скорость–искажение и Information Bottleneck: как управлять…

14 уроков
1. Зачем модели забывать
2. Теория скорости–искажения: сколько информации нужно сохранить
3. Information Bottleneck: сохранить то, что важно для \(Y\)
4. Variational Information Bottleneck: как сделать IB обучаемым
5. VAE как система скорость–искажение
6. Когда скорость становится реальными битами
7. Как построить честную кривую скорость–искажение
8. Информационная плоскость: цель обучения или описание динамики?
9. Математическое углубление: I–MMSE и гауссовское зашумление
10. Упражнения
11. Ключевые выводы модуля
12. Основные источники
13. Вычислительный блок
14. Решения упражнений

Алгоритмическая теория информации: кратчайшие описания, MDL и…

14 уроков
1. От распределения к одному конкретному объекту
2. Колмогоровская сложность и язык описания
3. Несжимаемость, невычислимость и реальные компрессоры
4. Связь с энтропией Шеннона
5. Алгоритмическая вероятность и универсальное предсказание
6. MDL в машинном обучении
7. Сходство через совместное сжатие
8. LLM и универсальное предсказание
9. Математическое углубление: AIXI
10. Факультативный физический мост: принцип Ландауэра
11. Упражнения
12. Ключевые выводы модуля
13. Основные источники
14. Решения упражнений

Сравнение распределений: f-дивергенции, вариационные критики…

14 уроков
1. От двух выборок к задаче сравнения распределений
2. f-дивергенции: одна схема, разные штрафы
3. Какие различия видят f-дивергенции
4. Классификатор оценивает отношение плотностей
5. Вариационная форма: как сделать расхождение обучаемым
6. GAN и f-GAN
7. MINE и InfoNCE
8. Интегральные вероятностные метрики: расстояние Вассерштейна и…
9. Выбор расхождения в практической задаче
10. Математическое углубление: общая мера и точная двойственность
11. Упражнения
12. Заключение
13. Основные источники
14. Решения упражнений

Информационные границы обобщения: PAC-Bayes и взаимная…

14 уроков
1. Почему лучшая обучающая ошибка почти неизбежно слишком хороша
2. От фиксированной модели к адаптивному выбору
3. PAC-Bayes: распределение до данных и распределение после…
4. PAC-Bayes-kl: сертификат для конкретной выборки
5. От сертификата к обучаемому распределению
6. MI-границы: обучение как канал от выборки к модели
7. Точное разложение, связывающее PAC-Bayes и MI
8. Связи с MDL, Information Bottleneck и KL-регуляризованными…
9. Как построить практический PAC-Bayes-сертификат
10. Математическое углубление: более локальные информационные цены
11. Упражнения
12. Ключевые выводы модуля
13. Основные источники
14. Решения упражнений

Рассуждение в LLM: вычисление, поиск и информация

15 уроков
1. Что меняется, когда модель «думает дольше»
2. Амортизация, рабочий черновик и поиск
3. Почему промежуточные токены могут помогать
4. Новая информация или новое вычисление?
5. Что можно измерять по шагам
6. Одна длинная траектория или много кандидатов?
7. In-context learning: когда контекст действительно приносит…
8. Как модели учатся рассуждать
9. Как оценивать систему рассуждения
10. Что доказано, что наблюдается и что пока служит гипотезой
11. Математическое углубление: пошаговый информационный прирост
12. Упражнения
13. Заключение: информация не заменяет вычисление
14. Основные источники
15. Решения упражнений

Компьютерное зрение через теорию информации

13 уроков
1. Почему компьютерное зрение — хороший полигон для теории…
2. Нейронное сжатие изображений: энтропийная модель и реальный…
3. Искажение и перцептивное качество
4. Диффузионные модели: гауссовское зашумление, денойзинг и I–MMSE
5. CLIP и контрастивное выравнивание изображений с текстом
6. Самообучение визуальных представлений: инвариантности и…
7. Сжатие CV-модели: квантизация, pruning и distillation
8. Один CV-пайплайн, четыре разных информационных бюджета
9. Математическое углубление: два точных расчёта
10. Упражнения
11. Заключение
12. Основные источники
13. Решения упражнений

Информационная геометрия: Fisher, естественный градиент и…

13 уроков
1. Что значит «маленький шаг» для вероятностной модели
2. Информация Фишера и локальная форма KL
3. Естественный градиент: наискорейший спуск при малом изменении…
4. Что именно называют «кривизной» в глубокой сети
5. Геометрия политик: NPG, TRPO, PPO и KL в RLHF
6. Wasserstein-геометрия и потоки распределений
7. Экспоненциальные семейства, двойственные координаты и…
8. Практическая карта: сначала выберите объект, затем геометрию
9. Математическое углубление: α-геометрия и точные примеры
10. Упражнения
11. Заключение
12. Основные источники
13. Решения упражнений

Памятка по курсу

1 урок
1. Памятка по курсу: ключевые идеи и формулы