Курс на Stepik
Обложка курса «Поглощение данных для production AI-систем» на Stepik
Бесплатно

Поглощение данных для production AI-систем 0.000

Открыть на
STEPIK.ORG

Полный курс по проектированию production-пайплайнов поглощения данных (штпуыешщт): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Поглощение данных для production AI-систем»Учеников на курсе 3
Сертификаты, выданные на курсе «Поглощение данных для production AI-систем»Сертификатов выдано 0
Отзывы о курсе «Поглощение данных для production AI-систем»Отзывов получено 0
Рейтинг курса «Поглощение данных для production AI-систем»Рейтинг курса 0.000
Уроки в курсе «Поглощение данных для production AI-систем»Количество уроков 28
Тесты в курсе «Поглощение данных для production AI-систем»Количество квизов 136
Обновления курса «Поглощение данных для production AI-систем»Обновления курса
Дата публикации курса «Поглощение данных для production AI-систем»Дата публикации курса
Последнее обновление курса «Поглощение данных для production AI-систем»Последнее обновление

Чему вы научитесь

  • Построение production-пайплайнов парсинга документов (PDF, HTML, DOCX)
  • Настройка OCR для сканированных документов и таблиц
  • Нормализация, дедупликация и санитизация данных перед индексированием
  • Асинхронная и потоковая обработка ingestion-нагрузок
  • Восстановление после сбоев: идемпотентность, retry, dead-letter queue
  • Мониторинг качества данных и метрик пайплайна поглощения

О курсе

Полный курс по проектированию production-пайплайнов поглощения данных (штпуыешщт): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.

Для кого этот курс

Python-разработчики и AI-инженеры, отвечающие за пайплайны обработки документов для RAG и поисковых систем. Рекомендуется пройти Курс 2 (Проектирование RAG-систем) или иметь эквивалентный опыт работы с векторными индексами.

Начальные требования

  • Опыт коммерческой разработки на Python
  • Понимание async/await в Python
  • Базовое знакомство с RAG-системами и векторными БД (рекомендуется Курс 2) или эквивалентный опыт
  • Базовое знакомство с Docker и контейнерами

Преподаватели курса

Как проходит обучение

Каждый модуль: история production-инцидента → архитектура → реализация

Практические задания в репозитории enterprise-ai-assistant

Failure-first подход: сначала показываем, как ломается, потом как чинить

Оценка качества встроена в практику с первого урока

Формат курса

Видео-лекции + архитектурные диаграммы + практические задания в Python

Что вы получите

  • Модуль app/ingestion/ для enterprise-ai-assistant (git tag v3.0-ingestion)
  • Библиотека парсеров под разные форматы документов (PDF, HTML, Markdown)
  • OCR-пайплайн с диагностикой качества распознавания
  • Набор инструментов дедупликации и нормализации документов
  • Пайплайн метрик качества данных для регрессионного контроля

Нагрузка

21 час видео + практические задания

Расскажите о курсе друзьям