Содержание пакета (5 курсов)
1. Мастерство ML: выбор, тюнинг и оптимизация моделей
Базовые принципы выбора моделей
3 урока
1.
Bias-Variance trade-off
↗
2.
Метрики качества: MAE, RMSE, R², Accuracy, ROC AUC, F1
↗
3.
Практика: выбор подходящей модели для реального датасета
↗
Линейные модели и их тюнинг
4 урока
1.
Linear Regression, Logistic Regression - принципы, ограничения
↗
2.
L1, L2, ElasticNet: зачем регуляризация и как она работает
↗
3.
Feature scaling, подбор гиперпараметров (alpha, C)
↗
4.
Практика:настройка регуляризации GridSearchCV и RandomizedSearch
↗
Деревья решений и ансамбли
4 урока
1.
DecisionTreeClassifier/Regressor — как работает дерево
↗
2.
Проблемы переобучения и глубины дерева
↗
3.
Как сделать деревья устойчивыми: методы ансамблирования
↗
4.
Практика: сравнение ансамблей по качеству и интерпретируемости
↗
Градиентный бустинг и его настройка
4 урока
1.
Идея бустинга: как слабые модели становятся сильными
↗
2.
XGBoost, LightGBM, CatBoost — обзор различий
↗
3.
Подбор гиперпараметров (learning_rate, n_estimators, depth)
↗
4.
Практика: тюнинг CatBoost и визуализация важности признаков
↗
Оптимизация гиперпараметров
4 урока
1.
GridSearchCV, RandomizedSearchCV — теория и применение
↗
2.
Bayesian Optimization (Optuna, Hyperopt)
↗
3.
Cross-validation и nested CV для честной оценки
↗
4.
Практика: поиск оптимальной модели под Kaggle-задачу
↗
Отбор и инженерия признаков
5 уроков
1.
Feature importance, permutation importance
↗
2.
Recursive Feature Elimination (RFE)
↗
3.
Взаимодействия признаков (interaction features)
↗
4.
PCA, t-SNE, UMAP для сокращения размерности
↗
5.
Практика: улучшение модели за счёт правильных признаков
↗
Интерпретация моделей
3 урока
1.
SHAP, LIME, Partial Dependence Plots
↗
2.
Практика: анализ SHAP-графиков
↗
3.
Обратная связь
↗
2. Нейросети в PyTorch: быстрый старт с нуля 5.00
Введение и настройка
2 урока
1.
Что такое PyTorch и зачем он нужен
↗
2.
Установка и настройка (локально и в Google Colab)
↗
Основы тензоров и автодифференцирование
2 урока
1.
torch.Tensor: создание, типы, shape, операции
↗
2.
Автоматическое дифференцирование: requires_grad, backward() и др
↗
Линейные модели и градиентный спуск
4 урока
1.
Ручной градиентный спуск
↗
2.
Линейная регрессия с PyTorch
↗
3.
Функции потерь и оптимизаторы (MSELoss, SGD)
↗
4.
Тренировка и визуализация лосса
↗
Нейронные сети
4 урока
1.
Что такое нейросети
↗
2.
Многослойный перцептрон (nn.Sequential, nn.Module)
↗
3.
Активации: ReLU, Sigmoid, Softmax
↗
4.
Модель классификации + обучение
↗
Работа с данными
3 урока
1.
Dataset и DataLoader
↗
2.
Работа с CSV и изображениями
↗
3.
Аугментации и трансформации (torchvision.transforms)
↗
Компьютерное зрение
3 урока
1.
Введение в сверточные сети (CNN)
↗
2.
Conv2d, MaxPool2d, Flatten
↗
3.
Классификация на MNIST / CIFAR-10
↗
Оценка и сохранение моделей
3 урока
1.
model.eval(), torch.no_grad()
↗
2.
torch.save, torch.load
↗
3.
Обратная связь
↗
3. Погружение в NLP: от эмбеддингов до трансформеров
Введение в NLP
4 урока
1.
Что такое NLP и где применяется
↗
2.
Основные задачи NLP: классификация текста, генерация текста и тд
↗
3.
Основные библиотеки в NLP: nltk, spacy, transformers и др.
↗
4.
Основные этапы предобработки текста
↗
Предобработка текста
4 урока
1.
Токенизация, стемминг и лемматизация (nltk, spacy)
↗
2.
Удаление стоп-слов и очистка текста
↗
3.
Векторизация текста: Bag-of-Words
↗
4.
Векторизация текста: TF-IDF
↗
Классификация текста
3 урока
1.
Методы ML для текста: Naive Bayes, Logistic Regression, SVM
↗
2.
Метрики качества: Accuracy, F1-score, ROC AUC
↗
3.
Практика: классификация отзывов
↗
Эмбеддинги и семантика слов
4 урока
1.
Введение в эмбеддинги: Word2Vec, GloVe, FastText
↗
2.
Практика: Word2Vec, GloVe, FastText
↗
3.
Косинусное сходство и поиск похожих слов
↗
4.
Практика: эмбеддинги, синонимы и аналогии
↗
Современные трансформеры
5 уроков
1.
Архитектура Transformer и механизм Attention
↗
2.
Предобученные модели: BERT, RoBERTa, GPT
↗
3.
Тонкая настройка (fine-tuning) моделей
↗
4.
Практика: классификация текста с помощью BERT
↗
5.
Практика: Named Entity Recognition (NER)
↗
Генерация и суммаризация текста
3 урока
1.
Методы генерации: greedy search, beam search, sampling
↗
2.
Автоматическая суммаризация текстов
↗
3.
Практика: генерация описаний и кратких аннотаций к текстам
↗
NLP для русского языка
3 урока
1.
Специфика русского языка: морфология, падежи
↗
2.
Работа с русскими предобученными моделями(RuBERT и Hugging Face)
↗
3.
Практика: NER для русскоязычных текстов
↗
Проектная работа
2 урока
1.
Проектная работа
↗
2.
Обратная связь
↗
4. Практический Machine Learning
Введение в машинное обучение
4 урока
1.
Основные понятия ML
↗
2.
Типы задач: регрессия, классификация, кластеризация
↗
3.
Этапы ML-проекта
↗
4.
Оценка качества моделей
↗
Анализ и подготовка данных
4 урока
1.
Разведочный анализ данных (EDA)
↗
2.
Обработка пропусков
↗
3.
Нормализация и масштабирование
↗
4.
Кодирование категориальных признаков
↗
Линейные модели
4 урока
1.
Линейная регрессия
↗
2.
Регуляризация (L1, L2)
↗
3.
Градиентный спуск
↗
4.
Логистическая регрессия
↗
Метрики и оценка моделей
3 урока
1.
Метрики регрессии
↗
2.
Метрики классификации
↗
3.
Кросс-валидация
↗
Базовые алгоритмы
2 урока
1.
K-ближайших соседей (KNN)
↗
2.
Метод опорных векторов (SVM)
↗
Деревья решений и ансамбли
3 урока
1.
Решающие деревья
↗
2.
Случайный лес
↗
3.
Градиентный бустинг
↗
Современные реализации бустинга
3 урока
1.
LightBoost
↗
2.
XGBoost
↗
3.
CatBoost
↗
Снижение размерности
2 урока
1.
Метод главных компонент (PCA)
↗
2.
Визуализация данных
↗
Кластеризация
3 урока
1.
K-means
↗
2.
Иерархическая кластеризация
↗
3.
DBSCAN
↗
Итоговый проект
2 урока
1.
Финальный проект
↗
2.
Обратная связь
↗
5. Статистика для собеседований 5.00
Введение в прикладную статистику
5 уроков
1.
Основные понятия: генеральная совокупность, выборка, параметры
↗
2.
Виды данных: категориальные, числовые, дискретные
↗
3.
Мера центральной тенденции: среднее, медиана, мода
↗
4.
Разброс: дисперсия, стандартное отклонение, IQR
↗
5.
Практика: Вычислить ключевые статистики вручную
↗
Распределения вероятностей
7 уроков
1.
Что такое распределение и зачем оно нужно
↗
2.
Нормальное распределение: свойства, Z-оценки
↗
3.
Биномиальное, Бернулли, Пуассон
↗
4.
Равномерное, экспоненциальное
↗
5.
ЦПТ: как объяснить интервьюеру
↗
6.
Практика: Определить распределение по графику/описанию
↗
7.
Типичные вопросы с собеседований
↗
Оценивание и доверительные интервалы
2 урока
1.
Доверительный интервал для среднего, для доли
↗
2.
Понятие Bootstrap в статистике
↗
Гипотезы и статистические тесты
9 уроков
1.
Что такое гипотеза: H0 и H1
↗
2.
Ошибки 1 и 2 рода, уровень значимости, power
↗
3.
p-value: как правильно объяснять
↗
4.
t-тест: для чего нужен и как применять
↗
5.
Z-тест, χ²-тест, F-тест
↗
6.
A/B-тестирование: полный разбор
↗
7.
Практика: провести A/B-тест в Python
↗
8.
Типичные вопросы интервью: часть 1
↗
9.
Типичные вопросы интервью: часть 2
↗
Корреляция и регрессия
5 уроков
1.
Корреляция Пирсона, Спирмена, Кендалла
↗
2.
Ковариация и как её объяснять
↗
3.
Линейная регрессия: базовые идеи
↗
4.
Линейная регрессия: мультиколлинеарность, VIF
↗
5.
Вопросы интервью по корреляции и регрессии
↗
Итоговая практика
4 урока
1.
Мини-собеседование: 30 типичных вопросов (часть 1)
↗
2.
Мини-собеседование: 30 типичных вопросов (часть 2)
↗
3.
Практическое задание: провести A/B тест
↗
4.
Обратная связь
↗