Курс на Stepik
Обложка курса «Поглощение данных для production AI-систем» на Stepik
Бесплатно

Поглощение данных для production AI-систем 0.000

Открыть на
STEPIK.ORG

Полный курс по проектированию production-пайплайнов поглощения данных (штпуыешщт): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Поглощение данных для production AI-систем»Учеников на курсе 0
Сертификаты, выданные на курсе «Поглощение данных для production AI-систем»Сертификатов выдано 0
Отзывы о курсе «Поглощение данных для production AI-систем»Отзывов получено 0
Рейтинг курса «Поглощение данных для production AI-систем»Рейтинг курса 0.000
Уроки в курсе «Поглощение данных для production AI-систем»Количество уроков 28
Тесты в курсе «Поглощение данных для production AI-систем»Количество квизов 136
Обновления курса «Поглощение данных для production AI-систем»Обновления курса
Дата публикации курса «Поглощение данных для production AI-систем»Дата публикации курса
Последнее обновление курса «Поглощение данных для production AI-систем»Последнее обновление

Содержание курса

Разделы в курсе «Поглощение данных для production AI-систем» 7 разделов Уроки в курсе «Поглощение данных для production AI-систем» 28 уроков Тесты в курсе «Поглощение данных для production AI-систем» 136 тестов Последнее обновление курса «Поглощение данных для production AI-систем» обн. 25 августа 2026

Тихие сбои поглощения данных: истории и архитектура

4 урока
1. Скрытое дублирование данных в пайплайне поглощения
2. OCR-ошибки, которые незаметно испортили базу знаний
3. Анатомия production-пайплайна поглощения данных
4. Первый рабочий пайплайн поглощения: реализация с нуля

Парсинг документов: от файла к структурированному тексту

4 урока
1. Форматы документов и ловушки парсинга
2. Парсинг PDF: текстовые слои, таблицы и layout
3. Парсинг HTML и веб-контента: борьба с шумом
4. Единый интерфейс парсинга: адаптер под любой формат

OCR и обработка сканированных документов

4 урока
1. Когда документу нужен OCR
2. Production OCR-пайплайн на Tesseract
3. Диагностика OCR-ошибок: как тихий шум портит retrieval
4. Гибридный OCR: layout-анализ таблиц и многоколоночного текста

Нормализация и очистка данных

4 урока
1. Нормализация текста: невидимый фундамент качества индекса
2. Юникод и кодировки: скрытые источники ошибок
3. Дедупликация документов: точное и приблизительное сравнение
4. PII и санитизация данных перед индексированием

Асинхронные и потоковые пайплайны поглощения

4 урока
1. Почему синхронное поглощение не масштабируется
2. Асинхронная обработка документов: очереди и воркеры
3. Потоковое поглощение: обработка событий изменения документов
4. Батчинг и backpressure в пайплайнах поглощения

Индексирование и восстановление после сбоев

4 урока
1. От документа к индексу: полный путь данных
2. Идемпотентность и повторная доставка событий
3. Восстановление после сбоев: retry и dead-letter queue
4. Инкрементальное переиндексирование без даунтайма

Инжиниринг качества данных и production-пайплайн поглощения

4 урока
1. Метрики качества данных для пайплайна поглощения
2. Мониторинг и алерты для пайплайна поглощения
3. Data contracts: валидация документов на входе
4. Финальный проект: процесс поглощения для enterprise-ai-assistant