Чему вы научитесь
Курс для аналитиков, которые уже считают метрики, но хотят перестать гадать при разборе эксперимента. После него вы можете спроектировать тест, защитить его дизайн, разобрать чужой результат и назвать вслух, где в нём дырка.
Как устроено обучение
Каждый урок собран по одной схеме:
- Теория с формулами. Формула не даётся как заклинание: разбирается, что означает числитель, что знаменатель и что произойдёт, если каждый член вырастет.
- Симуляция. К большинству утверждений есть график или анимация, посчитанные кодом. Числа в тексте берутся из результата симуляции.
- Проверка. Тесты с выбором, сопоставление, сортировка, числовой ответ и задачи на код. У каждой — подробный разбор, который открывается после ответа.
Задачи на код
Вы своими руками пишете t-тест, z-тест для долей, критерий хи-квадрат для
SRM, расчёт размера выборки, CUPED, дельта-метод, линеаризацию, поправки
Холма и Бенджамини–Хохберга. Решения проверяются автоматически на случайных
тестах. Нормальная функция распределения считается через math.erf —
scipy не нужен, и это осознанно: полезнее один раз собрать критерий из
кирпичиков, чем вызвать готовую функцию.
Ноутбуки
К модулям приложены Jupyter-ноутбуки. Они запускаются сверху вниз и
воспроизводят те же числа, что стоят в уроках. Из зависимостей — только
numpy и matplotlib. В конце каждого раздела есть
задание с пустой ячейкой.
Программа
- Причинность, ошибки первого и второго рода, мощность, MDE
- Дизайн: гипотеза, метрика решения, guardrail, единица рандомизации, длительность
- Сплитование и валидация: хеширование и соль, A/A-тест, SRM, боты, дубли
- Критерии: t-тест, Welch, z-тест долей, хи-квадрат, бутстрап
- Ratio-метрики: дельта-метод, линеаризация, уровень агрегации
- Выбросы: как один крупный клиент съедает чувствительность
- Чувствительность: стратификация, CUPED, CUPAC
- Подглядывание, последовательные тесты, множественные сравнения
- Сетевые эффекты, кластерная рандомизация, switchback
- Реальные проблемы: novelty, парадокс Симпсона, конфликт метрик, раскатка 1/10/50/100
- Пять больших кейсов и итоговый экзамен
Чем этот курс отличается
Курс заканчивается не значением p-value, а решением. В каждом кейсе нужно ответить на семь вопросов: что произошло, насколько мы уверены, значим ли эффект для бизнеса, какие есть риски, запускать ли изменение, нужен ли повторный эксперимент, какие данные ещё проверить. Это ближе к тому, что спрашивают на собеседовании и на ревью эксперимента.
Примеры взяты из маркетплейса и рекламы: GMV, заказы, средний чек, конверсия, доставка, ставки, подписки, продавцы.
Что нужно знать заранее
- Python на уровне циклов, списков и функций
- Базовая статистика: среднее, дисперсия, нормальное распределение
- Полезно, но не обязательно: опыт работы с продуктовыми метриками
Матанализ не нужен. Все формулы выводятся по шагам.
Организация
- Проходить можно в своём темпе, доступ не ограничен по времени
- Первый модуль открыт бесплатно — посмотрите формат до покупки
- Сертификат выдаётся автоматически при наборе нужного числа баллов; за каждое задание даётся один балл
- Вопросы можно задавать в комментариях к шагам
Чего в курсе нет
Здесь нет байесовских A/B-тестов, многоруких бандитов и причинного вывода на наблюдательных данных. Это отдельные большие темы, и честнее не трогать их вскользь.
Об авторе
Курс сделан командой zasqlpython.ru — там же лежат разборы по SQL, Python и продуктовой аналитике, тренажёры и материалы к собеседованиям.