Курс на Stepik
Обложка курса «Поглощение данных для production AI-систем» на Stepik
1 890 ₽

Поглощение данных для production AI-систем ★ 5.000

Открыть на
STEPIK.ORG

Полный курс по проектированию production-пайплайнов поглощения данных (ingestion): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Поглощение данных для production AI-систем»Учеников на курсе 28
Сертификаты, выданные на курсе «Поглощение данных для production AI-систем»Сертификатов выдано 2
Отзывы о курсе «Поглощение данных для production AI-систем»Отзывов получено 1
Рейтинг курса «Поглощение данных для production AI-систем»Рейтинг курса 5.000
Уроки в курсе «Поглощение данных для production AI-систем»Количество уроков 28
Тесты в курсе «Поглощение данных для production AI-систем»Количество квизов 136
Время прохождения курса «Поглощение данных для production AI-систем»Время прохождения курса —
Стоимость курса «Поглощение данных для production AI-систем»Стоимость курса 1 890 ₽ —
Обновления курса «Поглощение данных для production AI-систем»Обновления курса — —
Дата публикации курса «Поглощение данных для production AI-систем»Дата публикации курса — ———
Последнее обновление курса «Поглощение данных для production AI-систем»Последнее обновление — ———
Сложность normal — ———

Чему вы научитесь

  • Построение production-пайплайнов парсинга документов (PDF, HTML, DOCX)
  • Настройка OCR для сканированных документов и таблиц
  • Нормализация, дедупликация и санитизация данных перед индексированием
  • Асинхронная и потоковая обработка ingestion-нагрузок
  • Восстановление после сбоев: идемпотентность, retry, dead-letter queue
  • Мониторинг качества данных и метрик пайплайна поглощения

О курсе

Полный курс по проектированию production-пайплайнов поглощения данных (ingestion): от парсинга и OCR до нормализации, асинхронной обработки и восстановления после сбоев. Каждый модуль начинается с реального production-инцидента и строит слой `app/ingestion/` нашей enterprise-AI-системы.

Для кого этот курс

Python-разработчики и AI-инженеры, отвечающие за пайплайны обработки документов для RAG и поисковых систем. Рекомендуется пройти Курс 2 (Проектирование RAG-систем) или иметь эквивалентный опыт работы с векторными индексами.

Начальные требования

  • Опыт коммерческой разработки на Python
  • Понимание async/await в Python
  • Базовое знакомство с RAG-системами и векторными БД (рекомендуется Курс 2) или эквивалентный опыт
  • Базовое знакомство с Docker и контейнерами

Преподаватели курса

Как проходит обучение

Каждый модуль: история production-инцидента → архитектура → реализация

Практические задания в репозитории enterprise-ai-assistant

Failure-first подход: сначала показываем, как ломается, потом как чинить

Оценка качества встроена в практику с первого урока

Формат курса

Видео-лекции + архитектурные диаграммы + практические задания в Python
Сертификат курса Поглощение данных для production AI-систем

Сертификат

Успешно завершив курс, вы получите сертификат от платформы Stepik. Уже 2 учеников получили сертификат.

Что вы получите

  • Модуль app/ingestion/ для enterprise-ai-assistant (git tag v3.0-ingestion)
  • Библиотека парсеров под разные форматы документов (PDF, HTML, Markdown)
  • OCR-пайплайн с диагностикой качества распознавания
  • Набор инструментов дедупликации и нормализации документов
  • Пайплайн метрик качества данных для регрессионного контроля

Нагрузка

21 час видео + практические задания

Расскажите о курсе друзьям