Курс на Stepik
Обложка курса «LLM Evaluation: оценка качества RAG и AI-агентов» на Stepik
1 490 ₽

LLM Evaluation: оценка качества RAG и AI-агентов 0.000

Открыть на
STEPIK.ORG

Практический курс по LLM Evaluation и тестированию AI-систем. Оценка качества LLM, RAG и AI-агентов: evaluation dataset, метрики, evaluators, LLM-as-Judge, hallucinations, retrieval, tool calling, регрессии и QA. Научитесь сравнивать версии, принимать решения о релизе и строить production evaluation для реальных LLM-продуктов.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «LLM Evaluation: оценка качества RAG и AI-агентов»Учеников на курсе 2
Сертификаты, выданные на курсе «LLM Evaluation: оценка качества RAG и AI-агентов»Сертификатов выдано 0
Отзывы о курсе «LLM Evaluation: оценка качества RAG и AI-агентов»Отзывов получено 0
Рейтинг курса «LLM Evaluation: оценка качества RAG и AI-агентов»Рейтинг курса 0.000
Уроки в курсе «LLM Evaluation: оценка качества RAG и AI-агентов»Количество уроков 65
Тесты в курсе «LLM Evaluation: оценка качества RAG и AI-агентов»Количество квизов 204
Стоимость курса «LLM Evaluation: оценка качества RAG и AI-агентов»Стоимость курса 1 490 ₽
Обновления курса «LLM Evaluation: оценка качества RAG и AI-агентов»Обновления курса
Дата публикации курса «LLM Evaluation: оценка качества RAG и AI-агентов»Дата публикации курса
Последнее обновление курса «LLM Evaluation: оценка качества RAG и AI-агентов»Последнее обновление
Сложность normal

Содержание курса

Разделы в курсе «LLM Evaluation: оценка качества RAG и AI-агентов» 8 разделов Уроки в курсе «LLM Evaluation: оценка качества RAG и AI-агентов» 65 уроков Тесты в курсе «LLM Evaluation: оценка качества RAG и AI-агентов» 204 теста Последнее обновление курса «LLM Evaluation: оценка качества RAG и AI-агентов» обн. 18 августа 2026

Основы LLM Eval

9 уроков
1. От базовых принципов к Production Evaluation
2. Как LLM генерирует ответ
3. Промпт лишь часть системы
4. Почему exact match недостаточно?
5. Что остается от обычного QA?
6. Модель,RAG,Agent
7. Недетермированность
8. Типология ошибок
9. Evaluation Map

Критерии качества и Eval Specification

8 уроков
1. Бизнес-задача и пользовательский сценарий
2. Correctness, completeness, relevance и faithfulness
3. Reference-based и reference-free evaluation
4. Rubric
5. Severity
6. Метрики продукта и бизнеса
7. Проектирование release gates
8. Написать Eval Specification

Test design и evaluation dataset

9 уроков
1. Risk-based testing
2. Позитивные, негативные и граничные сценарии
3. Adversarial cases
4. Unanswerable cases
5. Golden dataset
6. Expected behavior
7. Разделение и версионирование датасета
8. Исходная конфигурация для сравнения
9. Собрать evaluation dataset

Методы оценки и автоматические evaluators

8 уроков
1. Human evaluation
2. Exact match, регулярные выражения и правила
3. BLEU, ROUGE и semantic similarity
4. Structured output evaluators
5. Tool evaluators
6. LLM-as-a-Judge
7. Bias и калибровка judge
8. Инструменты оценки

Evaluation RAG-систем

7 уроков
1. Архитектура RAG и диагностические точки
2. Retrieval metrics
3. Качество сформированного контекста
4. Проверка citations
5. Достаточность корпуса и отказ от ответа
6. End-to-end evaluation RAG
7. Сравнение конфигураций RAG

Evaluation AI-агентов и безопасность

10 уроков
1. Capability-based evaluation
2. Выбор и выполнение действий агентом
3. Evaluation trajectory и восстановление после ошибок
4. Состояние, память и multi-turn
5. Human-in-the-loop и эскалация
6. Threat model агента и trust boundaries
7. Direct и indirect prompt injection
8. Организация red-team evaluation
9. Авторизация опасных действий
10. Утечки данных и обход защитных механизмов

Регрессии, сравнение версий и CI/CD

7 уроков
1. Статистическое сравнение недетерминированных систем
2. Сегментный анализ
3. Error analysis и локализация регрессий
4. Quality–cost–latency
5. Репортинг недетерминированных дефектов
6. Поддержание regression suite
7. Evaluation и release gates в CI/CD

Production Evaluation и финальный проект

7 уроков
1. Production traces как источник evaluation-данных
2. Online evals и sampling
3. Production observability
4. Drift
5. Alerts и расследование ухудшений
6. Production feedback loop
7. Сквозной evaluation-контур