Чему вы научитесь
- Построение production-пайплайнов парсинга документов (PDF, HTML, DOCX)
- Настройка OCR для сканированных документов и таблиц
- Нормализация, дедупликация и санитизация данных перед индексированием
- Асинхронная и потоковая обработка ingestion-нагрузок
- Восстановление после сбоев: идемпотентность, retry, dead-letter queue
- Мониторинг качества данных и метрик пайплайна поглощения
О курсе
Полный курс по проектированию production-пайплайнов поглощения данных (штпуыешщт): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.
Для кого этот курс
Python-разработчики и AI-инженеры, отвечающие за пайплайны обработки документов для RAG и поисковых систем. Рекомендуется пройти Курс 2 (Проектирование RAG-систем) или иметь эквивалентный опыт работы с векторными индексами.
Начальные требования
- Опыт коммерческой разработки на Python
- Понимание async/await в Python
- Базовое знакомство с RAG-системами и векторными БД (рекомендуется Курс 2) или эквивалентный опыт
- Базовое знакомство с Docker и контейнерами
Преподаватели курса
Как проходит обучение
Каждый модуль: история production-инцидента → архитектура → реализация
Практические задания в репозитории enterprise-ai-assistant
Failure-first подход: сначала показываем, как ломается, потом как чинить
Оценка качества встроена в практику с первого урока
Формат курса
Видео-лекции + архитектурные диаграммы + практические задания в Python
Что вы получите
- Модуль app/ingestion/ для enterprise-ai-assistant (git tag v3.0-ingestion)
- Библиотека парсеров под разные форматы документов (PDF, HTML, Markdown)
- OCR-пайплайн с диагностикой качества распознавания
- Набор инструментов дедупликации и нормализации документов
- Пайплайн метрик качества данных для регрессионного контроля
Нагрузка
21 час видео + практические задания