Курс на Stepik
Обложка курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов» на Stepik
690 ₽

LLM Evaluation на практике | Тестирование RAG и AI-агентов ★ 5.000

Открыть на
STEPIK.ORG

Практический курс по LLM Evaluation и тестированию AI-систем. Оценка качества LLM, RAG и AI-агентов: evaluation dataset, метрики, evaluators, LLM-as-Judge, hallucinations, retrieval, tool calling, регрессии и QA. Научитесь сравнивать версии, принимать решения о релизе и строить production evaluation для реальных LLM-продуктов.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Учеников на курсе 11
Сертификаты, выданные на курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Сертификатов выдано 1
Отзывы о курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Отзывов получено 1
Рейтинг курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Рейтинг курса 5.000
Уроки в курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Количество уроков 65
Тесты в курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Количество квизов 204
Время прохождения курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Время прохождения курса —
Стоимость курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Стоимость курса 690 ₽ —
Обновления курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Обновления курса — —
Дата публикации курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Дата публикации курса — ———
Последнее обновление курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов»Последнее обновление — ———
Сложность easy — ———

Содержание курса

Разделы в курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов» 8 разделов Уроки в курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов» 65 уроков Тесты в курсе «LLM Evaluation на практике | Тестирование RAG и AI-агентов» 204 теста Время прохождения курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов» 0 ч. Последнее обновление курса «LLM Evaluation на практике | Тестирование RAG и AI-агентов» обн. 28 сентября 2026

Основы LLM Eval

9 уроков
1. От базовых принципов к Production Evaluation ↗
2. Как LLM генерирует ответ ↗
3. Промпт лишь часть системы ↗
4. Почему exact match недостаточно? ↗
5. Что остается от обычного QA? ↗
6. Модель,RAG,Agent ↗
7. Недетермированность ↗
8. Типология ошибок ↗
9. Evaluation Map ↗

Критерии качества и Eval Specification

8 уроков
1. Бизнес-задача и пользовательский сценарий ↗
2. Correctness, completeness, relevance и faithfulness ↗
3. Reference-based и reference-free evaluation ↗
4. Rubric ↗
5. Severity ↗
6. Метрики продукта и бизнеса ↗
7. Проектирование release gates ↗
8. Написать Eval Specification ↗

Test design и evaluation dataset

9 уроков
1. Risk-based testing ↗
2. Позитивные, негативные и граничные сценарии ↗
3. Adversarial cases ↗
4. Unanswerable cases ↗
5. Golden dataset ↗
6. Expected behavior ↗
7. Разделение и версионирование датасета ↗
8. Исходная конфигурация для сравнения ↗
9. Собрать evaluation dataset ↗

Методы оценки и автоматические evaluators

8 уроков
1. Human evaluation ↗
2. Exact match, регулярные выражения и правила ↗
3. BLEU, ROUGE и semantic similarity ↗
4. Structured output evaluators ↗
5. Tool evaluators ↗
6. LLM-as-a-Judge ↗
7. Bias и калибровка judge ↗
8. Инструменты оценки ↗

Evaluation RAG-систем

7 уроков
1. Архитектура RAG и диагностические точки ↗
2. Retrieval metrics ↗
3. Качество сформированного контекста ↗
4. Проверка citations ↗
5. Достаточность корпуса и отказ от ответа ↗
6. End-to-end evaluation RAG ↗
7. Сравнение конфигураций RAG ↗

Evaluation AI-агентов и безопасность

10 уроков
1. Capability-based evaluation ↗
2. Выбор и выполнение действий агентом ↗
3. Evaluation trajectory и восстановление после ошибок ↗
4. Состояние, память и multi-turn ↗
5. Human-in-the-loop и эскалация ↗
6. Threat model агента и trust boundaries ↗
7. Direct и indirect prompt injection ↗
8. Организация red-team evaluation ↗
9. Авторизация опасных действий ↗
10. Утечки данных и обход защитных механизмов ↗

Регрессии, сравнение версий и CI/CD

7 уроков
1. Статистическое сравнение недетерминированных систем ↗
2. Сегментный анализ ↗
3. Error analysis и локализация регрессий ↗
4. Quality–cost–latency ↗
5. Репортинг недетерминированных дефектов ↗
6. Поддержание regression suite ↗
7. Evaluation и release gates в CI/CD ↗

Production Evaluation и финальный проект

7 уроков
1. Production traces как источник evaluation-данных ↗
2. Online evals и sampling ↗
3. Production observability ↗
4. Drift ↗
5. Alerts и расследование ухудшений ↗
6. Production feedback loop ↗
7. Сквозной evaluation-контур ↗