Курс на Stepik
Обложка курса «Оценка LLM-систем: от разметки до гейта в CI» на Stepik
3 500 ₽

Оценка LLM-систем: от разметки до гейта в CI ★ 0.000

Открыть на
STEPIK.ORG

Практикум по оценке LLM-систем: вы собираете свой стенд оценки и сами измеряете числа, от согласия своей разметки и мусора в golden-наборе до смещений LLM-судьи и гейта в CI, который роняет сборку на просадке метрики. Без ключа к API курс проходится на сохранённых данных.

Показатель Текущие показатели Рост
Значение 🏆 Рейтинг 3 дн 7 дн 30 дн
Количество учеников на курсе «Оценка LLM-систем: от разметки до гейта в CI»Учеников на курсе 0
Сертификаты, выданные на курсе «Оценка LLM-систем: от разметки до гейта в CI»Сертификатов выдано 1
Отзывы о курсе «Оценка LLM-систем: от разметки до гейта в CI»Отзывов получено 0
Рейтинг курса «Оценка LLM-систем: от разметки до гейта в CI»Рейтинг курса 0.000
Уроки в курсе «Оценка LLM-систем: от разметки до гейта в CI»Количество уроков 13
Тесты в курсе «Оценка LLM-систем: от разметки до гейта в CI»Количество квизов 49
Задачи с кодом в курсе «Оценка LLM-систем: от разметки до гейта в CI»Количество задач с кодом 10
Стоимость курса «Оценка LLM-систем: от разметки до гейта в CI»Стоимость курса 3 500 ₽ —
Обновления курса «Оценка LLM-систем: от разметки до гейта в CI»Обновления курса — —
Дата публикации курса «Оценка LLM-систем: от разметки до гейта в CI»Дата публикации курса — ———
Последнее обновление курса «Оценка LLM-систем: от разметки до гейта в CI»Последнее обновление — ———
Сложность normal — ———

Чему вы научитесь

  • Размечать ответы LLM-системы по рубрике и считать kappa против эталона и против себя же через день
  • Чистить golden-набор от дублей, перефразировок и утечки вопросов в индекс и мерить, на сколько пунктов мусор завышал метрику
  • Составлять рубрику с якорями и граничными примерами и считать взвешенную kappa между разметчиками
  • Писать скрипт прогона с кэшем вызовов модели и манифестом и сравнивать два прогона по каждому примеру
  • Настраивать LLM-судью в трёх режимах и отдельно считать вердикты, которые парсер не разобрал
  • Мерить долю переворотов вердикта у своего судьи при перестановке ответов местами
  • Считать интервалы вокруг своих чисел: Уилсона для долей, бутстрап для средних и парный бутстрап для разницы двух систем
  • Прикидывать, сколько примеров нужно разметить, чтобы отличить одну долю от другой, и решать, окупится ли такая разметка
  • Собирать гейт в CI с порогом по нижней границе интервала и мерить, как часто он краснеет на неизменённой системе
  • Готовить отчёт о смещениях судьи, числа в котором пересчитываются из сырых вердиктов одной командой

О курсе

Практикум по оценке LLM-систем: вы собираете свой стенд оценки и сами измеряете числа, от согласия своей разметки и мусора в golden-наборе до смещений LLM-судьи и гейта в CI, который роняет сборку на просадке метрики. Без ключа к API курс проходится на сохранённых данных.

Для кого этот курс

  • Инженеры с собранным LLM-приложением, которым нужно защищать "стало лучше" перед командой.
  • Прошедшие бесплатный курс LLM-инженер или собравшие свой RAG самостоятельно.

Начальные требования

  • Python на уровне классов и типизации.
  • Своё LLM-приложение или готовность взять открытый демо-сервис как систему под тестом.
  • Доступ к любой модели через OpenAI-совместимый API. Без ключа курс проходится в режиме повтора (--replay) на сохранённых данных, только числа будут авторские.

Преподаватели курса

Формат курса

Текст без видео: 13 уроков в шести разделах, код-задачи с автопроверкой, финальный проект с рецензиями сокурсников. Уроки выходят с 5 октября по 2 ноября.
Сертификат курса Оценка LLM-систем: от разметки до гейта в CI

Сертификат

Успешно завершив курс, вы получите сертификат от платформы Stepik. Уже 1 учеников получили сертификат.

Нагрузка

3-5 часов в неделю в среднем

Расскажите о курсе друзьям