← Все инструкции

РУКОВОДСТВО · ОБНОВЛЕНО 2026-10-11

LLM как судья: как проверить качество автоматического оценщика

Ответ оценивает ещё одна модель со своими ошибками. Разберём проверочную рубрику, человеческие примеры и устойчивость вердикта до массового использования.

Задайте явные критерии, откалибруйте судью на размеченных человеком примерах и проверьте смещения порядка и длины ответа. Для обязательных правил используйте независимые валидаторы. Вердикт LLM помогает масштабировать разбор, но не становится объективным доказательством качества без собственной проверки оценщика.

1. Определите понятную рубрику

Разделите фактическую правильность, выполнение инструкции, структуру и полезность ответа. Для каждой шкалы дайте определения и примеры границ. Не просите просто «оценить качество от одного до десяти», если неизвестно, что отличает соседние значения. Для сравнения пары задайте одинаковые критерии и допустимую ничью. Сохраняйте исходный вопрос и нужное основание, иначе судья может предпочесть ответ, звучащий увереннее. Правила отказа и критические нарушения выделите отдельно: неверное действие инструмента не должно компенсироваться высоким баллом за стиль или полноту формулировки.

2. Подготовьте ручную контрольную разметку

Выберите типовые и сложные задачи, включая ответы с красивым стилем и неверным фактом. Зафиксируйте решения человека до настройки оценщика. Разберите несогласованность экспертов и уточните рубрику вместо того, чтобы объявить одну случайную оценку эталоном. Оставьте часть примеров для проверки после настройки. Сравните вердикты судьи с этой разметкой по отдельным критериям и видам ошибок. Общий процент согласия может скрывать провал важного сценария. Не переносите результаты опубликованного бенчмарка на вашу отраслевую задачу или русские ответы без собственного сравнения.

3. Проверьте смещения и недоверенный текст

Исследование MT-Bench описывает ограничения модельного судьи, включая позиционные и другие смещения. Для своих пар меняйте порядок кандидатов и сравнивайте вердикт. Проверьте, не выигрывает ли более длинный ответ только из-за объёма. Имена моделей скрывайте, если они не нужны критерию. Ответ кандидата является оцениваемыми данными, а не инструкцией поставить ему высший балл. Отдельно тестируйте такие попытки влияния на судью. Пояснение оценки должно ссылаться на наблюдаемые свойства ответа, а не только повторять уверенный общий вывод.

4. Сочетайте судью с независимыми проверками

Схему JSON, допустимую метку и повторное исполнение действия можно проверять кодом, не поручая весь контроль языковой модели. Для факта сверяйте разрешённый источник, а для цитаты — конкретный фрагмент. Если судья не имеет основания, его вердикт о достоверности ограничен. Сохраните статусы неизвестного и спорного результата. Не требуйте раскрыть внутренние рассуждения модели как доказательство: достаточно проверяемого объяснения по рубрике. При выборе победителя отдельно учитывайте критические ошибки, чтобы средний балл не скрывал результат, неприемлемый для вашего продукта.

5. Версионируйте и оценивайте стоимость процесса

Запишите модель судьи, промпт, рубрику, параметры и проверочный набор. При обновлении повторите калибровку, сохраняя возможность сравнить прежние оценки. Судья сам использует ресурсы и может ошибаться, поэтому определите допустимый объём автоматизации и ручного пересмотра. В Tokenmost guide не обещает встроенную систему evals. Без платных вызовов можно разметить примеры и проверить валидатор структуры на fixtures; реальная устойчивость вердикта требует отдельного согласованного прогона. Наличие успешного JSON-ответа не подтверждает, что оценщик различает хорошее и плохое решение.

Частые вопросы

Судья объективен, если это другая модель?

Нет. У другой модели тоже есть ошибки и смещения. Проверьте её на независимой ручной разметке и известных проблемных случаях.

Достаточно среднего балла?

Добавьте критические нарушения и оценки отдельных сценариев. Среднее может скрыть важные ухудшения.

Зачем менять порядок ответов?

Так проверяют, зависит ли выбор от позиции кандидата. Одинаковое содержание не должно получать преимущество только из-за порядка.

Можно заменить судью обычными тестами?

Для формата и строгих правил часто можно. Смысловые критерии требуют отдельного подхода; сочетайте проверки вместо обещания универсального оценщика.

Источники

Калькулятор стоимости →