Курс на Stepik
Обложка курса «Ваш AI готов к продакшену? LLM, RAG и AI-агенты» на Stepik
1 490 ₽

Ваш AI готов к продакшену? LLM, RAG и AI-агенты 5.000

Открыть на
STEPIK.ORG

Практический курс по LLM Evaluation и тестированию AI-систем. Оценка качества LLM, RAG и AI-агентов: evaluation dataset, метрики, evaluators, LLM-as-Judge, hallucinations, retrieval, tool calling, регрессии и QA. Научитесь сравнивать версии, принимать решения о релизе и строить production evaluation для реальных LLM-продуктов.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Учеников на курсе 4
Сертификаты, выданные на курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Сертификатов выдано 1
Отзывы о курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Отзывов получено 1
Рейтинг курса «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Рейтинг курса 5.000
Уроки в курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Количество уроков 65
Тесты в курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Количество квизов 204
Стоимость курса «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Стоимость курса 1 490 ₽
Обновления курса «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Обновления курса
Дата публикации курса «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Дата публикации курса
Последнее обновление курса «Ваш AI готов к продакшену? LLM, RAG и AI-агенты»Последнее обновление
Сложность normal

Содержание курса

Разделы в курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты» 8 разделов Уроки в курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты» 65 уроков Тесты в курсе «Ваш AI готов к продакшену? LLM, RAG и AI-агенты» 204 теста Последнее обновление курса «Ваш AI готов к продакшену? LLM, RAG и AI-агенты» обн. 27 августа 2026

Основы LLM Eval

9 уроков
1. От базовых принципов к Production Evaluation
2. Как LLM генерирует ответ
3. Промпт лишь часть системы
4. Почему exact match недостаточно?
5. Что остается от обычного QA?
6. Модель,RAG,Agent
7. Недетермированность
8. Типология ошибок
9. Evaluation Map

Критерии качества и Eval Specification

8 уроков
1. Бизнес-задача и пользовательский сценарий
2. Correctness, completeness, relevance и faithfulness
3. Reference-based и reference-free evaluation
4. Rubric
5. Severity
6. Метрики продукта и бизнеса
7. Проектирование release gates
8. Написать Eval Specification

Test design и evaluation dataset

9 уроков
1. Risk-based testing
2. Позитивные, негативные и граничные сценарии
3. Adversarial cases
4. Unanswerable cases
5. Golden dataset
6. Expected behavior
7. Разделение и версионирование датасета
8. Исходная конфигурация для сравнения
9. Собрать evaluation dataset

Методы оценки и автоматические evaluators

8 уроков
1. Human evaluation
2. Exact match, регулярные выражения и правила
3. BLEU, ROUGE и semantic similarity
4. Structured output evaluators
5. Tool evaluators
6. LLM-as-a-Judge
7. Bias и калибровка judge
8. Инструменты оценки

Evaluation RAG-систем

7 уроков
1. Архитектура RAG и диагностические точки
2. Retrieval metrics
3. Качество сформированного контекста
4. Проверка citations
5. Достаточность корпуса и отказ от ответа
6. End-to-end evaluation RAG
7. Сравнение конфигураций RAG

Evaluation AI-агентов и безопасность

10 уроков
1. Capability-based evaluation
2. Выбор и выполнение действий агентом
3. Evaluation trajectory и восстановление после ошибок
4. Состояние, память и multi-turn
5. Human-in-the-loop и эскалация
6. Threat model агента и trust boundaries
7. Direct и indirect prompt injection
8. Организация red-team evaluation
9. Авторизация опасных действий
10. Утечки данных и обход защитных механизмов

Регрессии, сравнение версий и CI/CD

7 уроков
1. Статистическое сравнение недетерминированных систем
2. Сегментный анализ
3. Error analysis и локализация регрессий
4. Quality–cost–latency
5. Репортинг недетерминированных дефектов
6. Поддержание regression suite
7. Evaluation и release gates в CI/CD

Production Evaluation и финальный проект

7 уроков
1. Production traces как источник evaluation-данных
2. Online evals и sampling
3. Production observability
4. Drift
5. Alerts и расследование ухудшений
6. Production feedback loop
7. Сквозной evaluation-контур