Генеративный ИИ

LLM Evaluation

Оценка языковых моделей

новинкаНовое или быстро растущее направление

Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.

Ключевые тезисы

  • Автометрики совпадения (BLEU, ROUGE) плохо отражают качество свободного ответа.
  • LLM-as-judge даёт масштабируемую оценку, но имеет систематические смещения — по длине и позиции.
  • Минимальный рабочий набор: 50–200 реальных запросов с эталонами и прозрачной рубрикой.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Три уровня оценки

От юнит-тестов до людей.

УровеньЧто даётСтоимость
Детерминированные проверкиформат, наличие полей, ограниченияпочти ноль
LLM-as-judgeоценка качества по рубрике на сотнях примеровнизкая
Человеческая оценкаистина в последней инстанциивысокая
На практике

Начинайте снизу: половина проблем в проде — это невалидный JSON и превышение длины, а не тонкости смысла.

2

Смещения модели-судьи

О чём нужно помнить, доверяя автооценке.

  • Позиционное смещение: первый вариант получает преимущество — меняйте порядок и усредняйте.
  • Смещение по длине: длинные ответы кажутся лучше — фиксируйте это в рубрике.
  • Самопредпочтение: модель выше оценивает тексты, похожие на её собственные.
  • Всегда проверяйте согласие судьи с человеческой оценкой на небольшой выборке.

Связанные темы

Работа с корпусами текстов