Содержание курса
1. Введение и настройка
5 уроков
6
5
0м
0
Открытый
1.1
Что такое парсинг и где он нужен
↗
2
1
-
0
Открытый
1.2
Легально ли это
↗
1
1
-
0
Открытый
1.3
Как устроен веб: клиент, сервер, HTTP
↗
1
1
-
0
Открытый
1.4
Готовим окружение
↗
1
1
-
0
Открытый
1.5
DevTools
↗
1
1
-
0
2. HTML и DOM — фундамент
5 уроков
5
2
0м
0
Открытый
2.1
DOM-дерево: теги, узлы, вложенность
↗
3
1
-
0
Открытый
2.2
Атрибуты, классы, id
↗
1
1
-
0
Открытый
2.3
CSS-селекторы от и до
↗
1
0
-
0
Открытый
2.4
XPath: когда он сильнее CSS
↗
0
0
-
0
Открытый
2.5
Практика: находим элементы
↗
0
0
-
0
3. Requests
7 уроков
3
2
0м
0
Открытый
3.1
GET-запрос, Response, кодировки
↗
1
1
-
0
Открытый
3.2
Статус-коды и их обработка
↗
0
0
-
0
Открытый
3.3
Заголовки, User-Agent, query-параметры
↗
1
0
-
0
Открытый
3.4
POST, формы, передача данных
↗
0
0
-
0
Открытый
3.5
Sessions, cookies, авторизация
↗
0
0
-
0
Открытый
3.6
Тайм-ауты, ретраи, бэк-офф
↗
1
1
-
0
Открытый
3.7
Httpx как современная альтернатива
↗
0
0
-
0
4. BeautifulSoup — разбираем HTML
6 уроков
3
1
0м
0
Открытый
4.1
Установка и парсеры (lxml vs html.parser)
↗
1
0
-
0
Открытый
4.2
Find / find_all, навигация по дереву
↗
0
0
-
0
Открытый
4.3
Поиск по селекторам: select / select_one
↗
0
0
-
0
Открытый
4.4
Извлечение текста и атрибутов
↗
1
0
-
0
Открытый
4.5
Пагинация: проходим все страницы
↗
0
0
-
0
Открытый
4.6
Parsel/lxml для скорости (бонус)
↗
1
1
-
0
5. Парсинг скрытых API
6 уроков
1
0
0м
0
Открытый
5.1
Как на самом деле работают сайты с JavaScript
↗
0
0
-
0
Открытый
5.2
Ловим запросы в Network, читаем XHR/fetch
↗
0
0
-
0
Открытый
5.3
Воспроизводим запрос к JSON-API
↗
1
0
-
0
Открытый
5.4
Токены, подписи, заголовки авторизации
↗
0
0
-
0
Открытый
5.5
Пагинация и курсоры в API
↗
0
0
-
0
Открытый
5.6
Когда API быстрее и надёжнее парсинга HTML
↗
0
0
-
0
6. Данные: чистим, валидируем, храним
6 уроков
0
0
0м
0
Открытый
6.1
Нормализация: строки, числа, даты
↗
0
0
-
0
Открытый
6.2
Валидация: dataclasses / pydantic
↗
0
0
-
0
Открытый
6.3
Сохраняем в CSV, JSON, Excel
↗
0
0
-
0
Открытый
6.4
Pandas для обработки и анализа
↗
0
0
-
0
Открытый
6.5
SQLite: хранение и дедупликация
↗
0
0
-
0
Открытый
6.6
Инкрементальный парсинг
↗
0
0
-
0
7. Динамические сайты: Playwright
7 уроков
0
0
0м
0
Открытый
7.1
Когда без браузера никак
↗
0
0
-
0
Открытый
7.2
Установка Playwright, первый запуск
↗
0
0
-
0
Открытый
7.3
Поиск элементов, клики, ввод, ожидания
↗
0
0
-
0
Открытый
7.4
Скроллинг, бесконечная лента, ленивая загрузка
↗
0
0
-
0
Открытый
7.5
Перехват сетевых запросов в Playwright
↗
0
0
-
0
Открытый
7.6
Cookies, авторизация, сохранение сессии
↗
0
0
-
0
Открытый
7.7
Selenium кратко: чем отличается, как мигрировать
↗
0
0
-
0
8. Защита от блокировок (антибан)
6 уроков
3
2
0м
0
Открытый
8.1
Почему банят: rate limit, фингерпринт, поведение
↗
1
1
-
0
Открытый
8.2
Ротация User-Agent и заголовков
↗
1
0
-
0
Открытый
8.3
Прокси: типы, ротация, пулы
↗
0
0
-
0
Открытый
8.4
Задержки, джиттер, вежливый парсинг
↗
0
0
-
0
Открытый
8.5
CAPTCHA: виды и обзор сервисов распознавания
↗
1
1
-
0
Открытый
8.6
Этика и нагрузка: как не положить чужой сайт
↗
0
0
-
0
9. Асинхронный парсинг
6 уроков
2
2
0м
0
Открытый
9.1
Зачем async: блокирующий vs неблокирующий код
↗
1
1
-
0
Открытый
9.2
Async/await, event loop на пальцах
↗
1
1
-
0
Открытый
9.3
Aiohttp / httpx async: десятки запросов разом
↗
0
0
-
0
Открытый
9.4
Ограничиваем параллелизм (Semaphore)
↗
0
0
-
0
Открытый
9.5
Асинхронный BeautifulSoup-пайплайн
↗
0
0
-
0
Открытый
9.6
Aiofiles: пишем результаты не блокируя
↗
0
0
-
0
10. Scrapy — промышленный фреймворк
6 уроков
1
1
0м
0
Открытый
10.1
Зачем фреймворк, когда есть requests
↗
1
1
-
0
Открытый
10.2
Архитектура: Spider, Item, Pipeline
↗
0
0
-
0
Открытый
10.3
Первый паук, селекторы в Scrapy
↗
0
0
-
0
Открытый
10.4
Пагинация и follow ссылок
↗
0
0
-
0
Открытый
10.5
Item Pipelines: чистка и сохранение
↗
0
0
-
0
Открытый
10.6
Настройки: задержки, autothrottle, прокси
↗
0
0
-
0
11. Парсинг Telegram
3 урока
2
0
0м
0
Открытый
11.1
Telethon: авторизация, сессии
↗
0
0
-
0
Открытый
11.2
Сбор сообщений и участников чата
↗
0
0
-
0
Открытый
11.3
Мониторинг по ключевым словам
↗
2
0
-
0
12. Автоматизация и запуск
4 урока
0
0
0м
0
Открытый
12.1
Логирование и обработка ошибок в продакшене
↗
0
0
-
0
Открытый
12.2
Запуск по расписанию: cron / планировщики
↗
0
0
-
0
Открытый
12.3
Запуск на сервере (VPS), переменные окружения
↗
0
0
-
0
Открытый
12.4
Уведомления о результатах (Telegram-бот / email)
↗
0
0
-
0
13. Капстоун-проект
4 урока
3
2
0м
0
Открытый
13.1
Постановка: собираем реальный датасет
↗
1
0
-
0
Открытый
13.2
Сбор, очистка, хранение, мини-анализ
↗
1
1
-
0
Открытый
13.3
Чек-лист качества
↗
0
0
-
0
Открытый
13.4
Куда расти
↗
1
1
-
0