Чему вы научитесь
- Научитесь системно оценивать качество LLM, RAG и AI-агентов.
- Создавать evaluation dataset и находить ошибки до выхода в production.
- Выбирать подходящие метрики, evaluators и использовать LLM-as-Judge.
- Проверять retrieval, tool calling, trajectory, безопасность и high-risk сценарии.
- Сравнивать версии, находить регрессии и принимать решения о релизе.
- Спроектируете полноценный evaluation-контур для реального AI-продукта.
О курсе
Для кого этот курс
Начальные требования
✅ Базовое понимание, что такое LLM и как работают AI-ассистенты.
✅ Желательно иметь опыт в QA, аналитике, разработке или работе с digital-продуктами.
✅ Интерес к RAG, AI-агентам и оценке качества AI-систем.
❌ Глубокие знания Machine Learning и математики не требуются.
❌ Опыт разработки собственных LLM-моделей не нужен.
❌ Продвинутый Python не обязателен.
Преподаватели курса
Как проходит обучение
Короткая теория без перегруза — только то, что действительно нужно для работы с LLM Evaluation.
Практические задания после ключевых тем: от оценки отдельных ответов до RAG, AI-агентов и production-сценариев.
Реальные кейсы и traces, где нужно не угадывать термин, а находить ошибки, риски и причины ухудшений.
Работа с evaluation dataset, метриками, evaluators, LLM-as-Judge, regression testing и release gates.
В финале — сквозной проект, где вы самостоятельно спроектируете evaluation-контур для реального AI-продукта.
Что вы получите
- Структурированную систему знаний по LLM Evaluation — от базовых принципов до production-подходов.
- Практические шаблоны и подходы, которые можно использовать в своих AI-проектах.
- Финальный проект для портфолио и обсуждения на собеседованиях.
- Набор реальных кейсов, примеров ошибок и production-ситуаций, к которым можно возвращаться после курса.
- Более уверенное понимание того, как устроено качество современных AI-продуктов и как о нём говорить с разработчиками, аналитиками и бизнесом.