Курс на Stepik
Обложка курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров» на Stepik
690 ₽

Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров 5.000

Открыть на
STEPIK.ORG

Практический курс по LLM Evaluation и тестированию AI-систем. Оценка качества LLM, RAG и AI-агентов: evaluation dataset, метрики, evaluators, LLM-as-Judge, hallucinations, retrieval, tool calling, регрессии и QA. Научитесь сравнивать версии, принимать решения о релизе и строить production evaluation для реальных LLM-продуктов.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Учеников на курсе 11
Сертификаты, выданные на курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Сертификатов выдано 1
Отзывы о курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Отзывов получено 1
Рейтинг курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Рейтинг курса 5.000
Уроки в курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Количество уроков 65
Тесты в курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Количество квизов 204
Время прохождения курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Время прохождения курса
Стоимость курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Стоимость курса 690 ₽
Обновления курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Обновления курса
Дата публикации курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Дата публикации курса
Последнее обновление курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров»Последнее обновление
Сложность normal

Содержание курса

Разделы в курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров» 8 разделов Уроки в курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров» 65 уроков Тесты в курсе «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров» 204 теста Время прохождения курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров» 0 ч. Последнее обновление курса «Проверяй свой AI-продукт | LLM Evaluation для вайбкодеров» обн. 23 сентября 2026

Основы LLM Eval

9 уроков
1. От базовых принципов к Production Evaluation
2. Как LLM генерирует ответ
3. Промпт лишь часть системы
4. Почему exact match недостаточно?
5. Что остается от обычного QA?
6. Модель,RAG,Agent
7. Недетермированность
8. Типология ошибок
9. Evaluation Map

Критерии качества и Eval Specification

8 уроков
1. Бизнес-задача и пользовательский сценарий
2. Correctness, completeness, relevance и faithfulness
3. Reference-based и reference-free evaluation
4. Rubric
5. Severity
6. Метрики продукта и бизнеса
7. Проектирование release gates
8. Написать Eval Specification

Test design и evaluation dataset

9 уроков
1. Risk-based testing
2. Позитивные, негативные и граничные сценарии
3. Adversarial cases
4. Unanswerable cases
5. Golden dataset
6. Expected behavior
7. Разделение и версионирование датасета
8. Исходная конфигурация для сравнения
9. Собрать evaluation dataset

Методы оценки и автоматические evaluators

8 уроков
1. Human evaluation
2. Exact match, регулярные выражения и правила
3. BLEU, ROUGE и semantic similarity
4. Structured output evaluators
5. Tool evaluators
6. LLM-as-a-Judge
7. Bias и калибровка judge
8. Инструменты оценки

Evaluation RAG-систем

7 уроков
1. Архитектура RAG и диагностические точки
2. Retrieval metrics
3. Качество сформированного контекста
4. Проверка citations
5. Достаточность корпуса и отказ от ответа
6. End-to-end evaluation RAG
7. Сравнение конфигураций RAG

Evaluation AI-агентов и безопасность

10 уроков
1. Capability-based evaluation
2. Выбор и выполнение действий агентом
3. Evaluation trajectory и восстановление после ошибок
4. Состояние, память и multi-turn
5. Human-in-the-loop и эскалация
6. Threat model агента и trust boundaries
7. Direct и indirect prompt injection
8. Организация red-team evaluation
9. Авторизация опасных действий
10. Утечки данных и обход защитных механизмов

Регрессии, сравнение версий и CI/CD

7 уроков
1. Статистическое сравнение недетерминированных систем
2. Сегментный анализ
3. Error analysis и локализация регрессий
4. Quality–cost–latency
5. Репортинг недетерминированных дефектов
6. Поддержание regression suite
7. Evaluation и release gates в CI/CD

Production Evaluation и финальный проект

7 уроков
1. Production traces как источник evaluation-данных
2. Online evals и sampling
3. Production observability
4. Drift
5. Alerts и расследование ухудшений
6. Production feedback loop
7. Сквозной evaluation-контур