Курс на Stepik
Обложка курса «Python-парсинг: извлечение и обработка веб-данных» на Stepik
3 500 ₽

Python-парсинг: извлечение и обработка веб-данных 0.000

Открыть на
STEPIK.ORG

Практический курс по сбору данных с помощью Python. Вы научитесь автоматически извлекать информацию с сайтов и превращать её в структурированные данные для анализа и работы.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Python-парсинг: извлечение и обработка веб-данных»Учеников на курсе 3
Сертификаты, выданные на курсе «Python-парсинг: извлечение и обработка веб-данных»Сертификатов выдано 1
Отзывы о курсе «Python-парсинг: извлечение и обработка веб-данных»Отзывов получено 0
Рейтинг курса «Python-парсинг: извлечение и обработка веб-данных»Рейтинг курса 0.000
Уроки в курсе «Python-парсинг: извлечение и обработка веб-данных»Количество уроков 71
Тесты в курсе «Python-парсинг: извлечение и обработка веб-данных»Количество квизов 711
Стоимость курса «Python-парсинг: извлечение и обработка веб-данных»Стоимость курса 3 500 ₽
Обновления курса «Python-парсинг: извлечение и обработка веб-данных»Обновления курса
Дата публикации курса «Python-парсинг: извлечение и обработка веб-данных»Дата публикации курса
Последнее обновление курса «Python-парсинг: извлечение и обработка веб-данных»Последнее обновление
Сложность easy

Содержание курса

Разделы в курсе «Python-парсинг: извлечение и обработка веб-данных» 13 разделов Уроки в курсе «Python-парсинг: извлечение и обработка веб-данных» 71 урок Тесты в курсе «Python-парсинг: извлечение и обработка веб-данных» 711 тестов Последнее обновление курса «Python-парсинг: извлечение и обработка веб-данных» обн. 17 июля 2026

1. Введение и настройка

5 уроков
Открытый
1.1 Что такое парсинг и где он нужен
2
1
-
0
Открытый
1.2 Легально ли это
1
1
-
0
Открытый
1.3 Как устроен веб: клиент, сервер, HTTP
1
1
-
0
Открытый
1.4 Готовим окружение
1
1
-
0
Открытый
1.5 DevTools
1
1
-
0

2. HTML и DOM — фундамент

5 уроков
Открытый
2.1 DOM-дерево: теги, узлы, вложенность
3
1
-
0
Открытый
2.2 Атрибуты, классы, id
1
1
-
0
Открытый
2.3 CSS-селекторы от и до
1
0
-
0
Открытый
2.4 XPath: когда он сильнее CSS
0
0
-
0
Открытый
2.5 Практика: находим элементы
0
0
-
0

3. Requests

7 уроков
Открытый
3.1 GET-запрос, Response, кодировки
1
1
-
0
Открытый
3.2 Статус-коды и их обработка
0
0
-
0
Открытый
3.3 Заголовки, User-Agent, query-параметры
1
0
-
0
Открытый
3.4 POST, формы, передача данных
0
0
-
0
Открытый
3.5 Sessions, cookies, авторизация
0
0
-
0
Открытый
3.6 Тайм-ауты, ретраи, бэк-офф
1
1
-
0
Открытый
3.7 Httpx как современная альтернатива
0
0
-
0

4. BeautifulSoup — разбираем HTML

6 уроков
Открытый
4.1 Установка и парсеры (lxml vs html.parser)
1
0
-
0
Открытый
4.2 Find / find_all, навигация по дереву
0
0
-
0
Открытый
4.3 Поиск по селекторам: select / select_one
0
0
-
0
Открытый
4.4 Извлечение текста и атрибутов
1
0
-
0
Открытый
4.5 Пагинация: проходим все страницы
0
0
-
0
Открытый
4.6 Parsel/lxml для скорости (бонус)
1
1
-
0

5. Парсинг скрытых API

6 уроков
Открытый
5.1 Как на самом деле работают сайты с JavaScript
0
0
-
0
Открытый
5.2 Ловим запросы в Network, читаем XHR/fetch
0
0
-
0
Открытый
5.3 Воспроизводим запрос к JSON-API
1
0
-
0
Открытый
5.4 Токены, подписи, заголовки авторизации
0
0
-
0
Открытый
5.5 Пагинация и курсоры в API
0
0
-
0
Открытый
5.6 Когда API быстрее и надёжнее парсинга HTML
0
0
-
0

6. Данные: чистим, валидируем, храним

6 уроков
Открытый
6.1 Нормализация: строки, числа, даты
0
0
-
0
Открытый
6.2 Валидация: dataclasses / pydantic
0
0
-
0
Открытый
6.3 Сохраняем в CSV, JSON, Excel
0
0
-
0
Открытый
6.4 Pandas для обработки и анализа
0
0
-
0
Открытый
6.5 SQLite: хранение и дедупликация
0
0
-
0
Открытый
6.6 Инкрементальный парсинг
0
0
-
0

7. Динамические сайты: Playwright

7 уроков
Открытый
7.1 Когда без браузера никак
0
0
-
0
Открытый
7.2 Установка Playwright, первый запуск
0
0
-
0
Открытый
7.3 Поиск элементов, клики, ввод, ожидания
0
0
-
0
Открытый
7.4 Скроллинг, бесконечная лента, ленивая загрузка
0
0
-
0
Открытый
7.5 Перехват сетевых запросов в Playwright
0
0
-
0
Открытый
7.6 Cookies, авторизация, сохранение сессии
0
0
-
0
Открытый
7.7 Selenium кратко: чем отличается, как мигрировать
0
0
-
0

8. Защита от блокировок (антибан)

6 уроков
Открытый
8.1 Почему банят: rate limit, фингерпринт, поведение
1
1
-
0
Открытый
8.2 Ротация User-Agent и заголовков
1
0
-
0
Открытый
8.3 Прокси: типы, ротация, пулы
0
0
-
0
Открытый
8.4 Задержки, джиттер, вежливый парсинг
0
0
-
0
Открытый
8.5 CAPTCHA: виды и обзор сервисов распознавания
1
1
-
0
Открытый
8.6 Этика и нагрузка: как не положить чужой сайт
0
0
-
0

9. Асинхронный парсинг

6 уроков
Открытый
9.1 Зачем async: блокирующий vs неблокирующий код
1
1
-
0
Открытый
9.2 Async/await, event loop на пальцах
1
1
-
0
Открытый
9.3 Aiohttp / httpx async: десятки запросов разом
0
0
-
0
Открытый
9.4 Ограничиваем параллелизм (Semaphore)
0
0
-
0
Открытый
9.5 Асинхронный BeautifulSoup-пайплайн
0
0
-
0
Открытый
9.6 Aiofiles: пишем результаты не блокируя
0
0
-
0

10. Scrapy — промышленный фреймворк

6 уроков
Открытый
10.1 Зачем фреймворк, когда есть requests
1
1
-
0
Открытый
10.2 Архитектура: Spider, Item, Pipeline
0
0
-
0
Открытый
10.3 Первый паук, селекторы в Scrapy
0
0
-
0
Открытый
10.4 Пагинация и follow ссылок
0
0
-
0
Открытый
10.5 Item Pipelines: чистка и сохранение
0
0
-
0
Открытый
10.6 Настройки: задержки, autothrottle, прокси
0
0
-
0

11. Парсинг Telegram

3 урока
Открытый
11.1 Telethon: авторизация, сессии
0
0
-
0
Открытый
11.2 Сбор сообщений и участников чата
0
0
-
0
Открытый
11.3 Мониторинг по ключевым словам
2
0
-
0

12. Автоматизация и запуск

4 урока
Открытый
12.1 Логирование и обработка ошибок в продакшене
0
0
-
0
Открытый
12.2 Запуск по расписанию: cron / планировщики
0
0
-
0
Открытый
12.3 Запуск на сервере (VPS), переменные окружения
0
0
-
0
Открытый
12.4 Уведомления о результатах (Telegram-бот / email)
0
0
-
0

13. Капстоун-проект

4 урока
Открытый
13.1 Постановка: собираем реальный датасет
1
0
-
0
Открытый
13.2 Сбор, очистка, хранение, мини-анализ
1
1
-
0
Открытый
13.3 Чек-лист качества
0
0
-
0
Открытый
13.4 Куда расти
1
1
-
0