Курс на Stepik
Обложка курса «Python-парсинг: извлечение и обработка веб-данных» на Stepik
3 500 ₽

Python-парсинг: извлечение и обработка веб-данных 0.000

Открыть на
STEPIK.ORG

Практический курс по сбору данных с помощью Python. Вы научитесь автоматически извлекать информацию с сайтов и превращать её в структурированные данные для анализа и работы.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Python-парсинг: извлечение и обработка веб-данных»Учеников на курсе 3
Сертификаты, выданные на курсе «Python-парсинг: извлечение и обработка веб-данных»Сертификатов выдано 1
Отзывы о курсе «Python-парсинг: извлечение и обработка веб-данных»Отзывов получено 0
Рейтинг курса «Python-парсинг: извлечение и обработка веб-данных»Рейтинг курса 0.000
Уроки в курсе «Python-парсинг: извлечение и обработка веб-данных»Количество уроков 71
Тесты в курсе «Python-парсинг: извлечение и обработка веб-данных»Количество квизов 711
Стоимость курса «Python-парсинг: извлечение и обработка веб-данных»Стоимость курса 3 500 ₽
Обновления курса «Python-парсинг: извлечение и обработка веб-данных»Обновления курса
Дата публикации курса «Python-парсинг: извлечение и обработка веб-данных»Дата публикации курса
Последнее обновление курса «Python-парсинг: извлечение и обработка веб-данных»Последнее обновление
Сложность easy

Содержание курса

Разделы в курсе «Python-парсинг: извлечение и обработка веб-данных» 13 разделов Уроки в курсе «Python-парсинг: извлечение и обработка веб-данных» 71 урок Тесты в курсе «Python-парсинг: извлечение и обработка веб-данных» 711 тестов Последнее обновление курса «Python-парсинг: извлечение и обработка веб-данных» обн. 17 июля 2026

Введение и настройка

5 уроков
1. Что такое парсинг и где он нужен
2. Легально ли это
3. Как устроен веб: клиент, сервер, HTTP
4. Готовим окружение
5. DevTools

HTML и DOM — фундамент

5 уроков
1. DOM-дерево: теги, узлы, вложенность
2. Атрибуты, классы, id
3. CSS-селекторы от и до
4. XPath: когда он сильнее CSS
5. Практика: находим элементы

Requests

7 уроков
1. GET-запрос, Response, кодировки
2. Статус-коды и их обработка
3. Заголовки, User-Agent, query-параметры
4. POST, формы, передача данных
5. Sessions, cookies, авторизация
6. Тайм-ауты, ретраи, бэк-офф
7. Httpx как современная альтернатива

BeautifulSoup — разбираем HTML

6 уроков
1. Установка и парсеры (lxml vs html.parser)
2. Find / find_all, навигация по дереву
3. Поиск по селекторам: select / select_one
4. Извлечение текста и атрибутов
5. Пагинация: проходим все страницы
6. Parsel/lxml для скорости (бонус)

Парсинг скрытых API

6 уроков
1. Как на самом деле работают сайты с JavaScript
2. Ловим запросы в Network, читаем XHR/fetch
3. Воспроизводим запрос к JSON-API
4. Токены, подписи, заголовки авторизации
5. Пагинация и курсоры в API
6. Когда API быстрее и надёжнее парсинга HTML

Данные: чистим, валидируем, храним

6 уроков
1. Нормализация: строки, числа, даты
2. Валидация: dataclasses / pydantic
3. Сохраняем в CSV, JSON, Excel
4. Pandas для обработки и анализа
5. SQLite: хранение и дедупликация
6. Инкрементальный парсинг

Динамические сайты: Playwright

7 уроков
1. Когда без браузера никак
2. Установка Playwright, первый запуск
3. Поиск элементов, клики, ввод, ожидания
4. Скроллинг, бесконечная лента, ленивая загрузка
5. Перехват сетевых запросов в Playwright
6. Cookies, авторизация, сохранение сессии
7. Selenium кратко: чем отличается, как мигрировать

Защита от блокировок (антибан)

6 уроков
1. Почему банят: rate limit, фингерпринт, поведение
2. Ротация User-Agent и заголовков
3. Прокси: типы, ротация, пулы
4. Задержки, джиттер, вежливый парсинг
5. CAPTCHA: виды и обзор сервисов распознавания
6. Этика и нагрузка: как не положить чужой сайт

Асинхронный парсинг

6 уроков
1. Зачем async: блокирующий vs неблокирующий код
2. Async/await, event loop на пальцах
3. Aiohttp / httpx async: десятки запросов разом
4. Ограничиваем параллелизм (Semaphore)
5. Асинхронный BeautifulSoup-пайплайн
6. Aiofiles: пишем результаты не блокируя

Scrapy — промышленный фреймворк

6 уроков
1. Зачем фреймворк, когда есть requests
2. Архитектура: Spider, Item, Pipeline
3. Первый паук, селекторы в Scrapy
4. Пагинация и follow ссылок
5. Item Pipelines: чистка и сохранение
6. Настройки: задержки, autothrottle, прокси

Парсинг Telegram

3 урока
1. Telethon: авторизация, сессии
2. Сбор сообщений и участников чата
3. Мониторинг по ключевым словам

Автоматизация и запуск

4 урока
1. Логирование и обработка ошибок в продакшене
2. Запуск по расписанию: cron / планировщики
3. Запуск на сервере (VPS), переменные окружения
4. Уведомления о результатах (Telegram-бот / email)

Капстоун-проект

4 урока
1. Постановка: собираем реальный датасет
2. Сбор, очистка, хранение, мини-анализ
3. Чек-лист качества
4. Куда расти