Курс на Stepik
Обложка курса «Поглощение данных для production AI-систем» на Stepik
1 890 ₽

Поглощение данных для production AI-систем ★ 5.000

Открыть на
STEPIK.ORG

Полный курс по проектированию production-пайплайнов поглощения данных (ingestion): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Поглощение данных для production AI-систем»Учеников на курсе 28
Сертификаты, выданные на курсе «Поглощение данных для production AI-систем»Сертификатов выдано 2
Отзывы о курсе «Поглощение данных для production AI-систем»Отзывов получено 1
Рейтинг курса «Поглощение данных для production AI-систем»Рейтинг курса 5.000
Уроки в курсе «Поглощение данных для production AI-систем»Количество уроков 28
Тесты в курсе «Поглощение данных для production AI-систем»Количество квизов 136
Время прохождения курса «Поглощение данных для production AI-систем»Время прохождения курса —
Стоимость курса «Поглощение данных для production AI-систем»Стоимость курса 1 890 ₽ —
Обновления курса «Поглощение данных для production AI-систем»Обновления курса — —
Дата публикации курса «Поглощение данных для production AI-систем»Дата публикации курса — ———
Последнее обновление курса «Поглощение данных для production AI-систем»Последнее обновление — ———
Сложность normal — ———

Содержание курса

Разделы в курсе «Поглощение данных для production AI-систем» 7 разделов Уроки в курсе «Поглощение данных для production AI-систем» 28 уроков Тесты в курсе «Поглощение данных для production AI-систем» 136 тестов Время прохождения курса «Поглощение данных для production AI-систем» 0 ч. Последнее обновление курса «Поглощение данных для production AI-систем» обн. 18 сентября 2026

Тихие сбои поглощения данных: истории и архитектура

4 урока
1. Скрытое дублирование данных в пайплайне поглощения ↗
2. OCR-ошибки, которые незаметно испортили базу знаний ↗
3. Анатомия production-пайплайна поглощения данных ↗
4. Первый рабочий пайплайн поглощения: реализация с нуля ↗

Парсинг документов: от файла к структурированному тексту

4 урока
1. Форматы документов и ловушки парсинга ↗
2. Парсинг PDF: текстовые слои, таблицы и layout ↗
3. Парсинг HTML и веб-контента: борьба с шумом ↗
4. Единый интерфейс парсинга: адаптер под любой формат ↗

OCR и обработка сканированных документов

4 урока
1. Когда документу нужен OCR ↗
2. Production OCR-пайплайн на Tesseract ↗
3. Диагностика OCR-ошибок: как тихий шум портит retrieval ↗
4. Гибридный OCR: layout-анализ таблиц и многоколоночного текста ↗

Нормализация и очистка данных

4 урока
1. Нормализация текста: невидимый фундамент качества индекса ↗
2. Юникод и кодировки: скрытые источники ошибок ↗
3. Дедупликация документов: точное и приблизительное сравнение ↗
4. PII и санитизация данных перед индексированием ↗

Асинхронные и потоковые пайплайны поглощения

4 урока
1. Почему синхронное поглощение не масштабируется ↗
2. Асинхронная обработка документов: очереди и воркеры ↗
3. Потоковое поглощение: обработка событий изменения документов ↗
4. Батчинг и backpressure в пайплайнах поглощения ↗

Индексирование и восстановление после сбоев

4 урока
1. От документа к индексу: полный путь данных ↗
2. Идемпотентность и повторная доставка событий ↗
3. Восстановление после сбоев: retry и dead-letter queue ↗
4. Инкрементальное переиндексирование без даунтайма ↗

Инжиниринг качества данных и production-пайплайн поглощения

4 урока
1. Метрики качества данных для пайплайна поглощения ↗
2. Мониторинг и алерты для пайплайна поглощения ↗
3. Data contracts: валидация документов на входе ↗
4. Финальный проект: процесс поглощения для enterprise-ai-assistant ↗