Модель-судья: что она ловит и что пропускает
Судья совпадает с человеком примерно так же часто, как человек совпадает с человеком. Проблема не в проценте совпадений, а в том, что его ошибки систематические.
Идея выглядит слишком удобной, чтобы работать: пусть качество ответов оценивает другая модель. Разметка перестаёт быть узким местом, прогон набора занимает минуты, оценку можно повесить прямо в конвейер.
Возражение возникает сразу же и звучит убедительно: как модель может судить модель, если она сама ошибается?
Обе позиции мимо. Судья работает — но не там и не так, как обычно предполагают в обеих.
Потолок — не сто процентов
Первое, что ломает интуицию: правильного ответа, с которым можно сверить судью, не существует.
Когда два человека независимо размечают одни и те же пары ответов, они соглашаются друг с другом в 69–75% случаев, в среднем около 72%. На аккуратно поставленных сравнениях согласие экспертов доходит до 79–90%. То есть даже эталон нестабилен: «правильная» оценка — это чьё-то мнение, и второй человек его в пятой части случаев не разделит.
На этом фоне цифры судьи выглядят иначе. Совпадение модели с человеком — 68–71%, в среднем около 70%. Разница с человеческим согласием в пределах пары процентных пунктов.
Отсюда практическое следствие, которое стоит проговорить прямо: фраза «судья ошибся в двадцати процентах случаев» ничего не доказывает. Человек на том же материале ошибётся примерно столько же. Требовать от автоматики того, чего не даёт эталон, — это способ не внедрить ничего и остаться при ручной разметке, у которой ровно та же нестабильность, только медленнее и дороже.
Где судья надёжен
Дальше начинаются различия между постановками задачи, и они большие.
Сравнение двух ответов надёжнее оценки одного. Судья, которому показали два варианта и спросили «какой лучше», приближает человеческие предпочтения заметно точнее, чем судья, выставляющий баллы одному ответу. Причина понятна: балл требует устойчивой внутренней шкалы, которой у модели нет, и одна и та же работа сегодня получит семь, а завтра восемь. Выбор из двух шкалы не требует.
Явная рубрика поднимает согласие сильно. На структурированной оценке по заданным критериям точное совпадение с человеком доходит до 84.7% по рассуждению и 86.7% по итоговому ответу — выше, чем согласие людей между собой на свободной оценке. Рубрика работает не потому, что модель становится умнее, а потому что убирает главный источник расхождений: разное понимание того, что вообще оценивается.
Из этих двух наблюдений складывается простое правило: спрашивайте «какой из двух», а не «сколько баллов», и всегда говорите, по каким признакам.
Три смещения, и они систематические
Теперь то, ради чего стоило разбираться.
Порядок. Один и тот же ответ выигрывает чаще, если стоит первым. Перестановка мест меняет долю побед на 10–15 процентных пунктов.
Длина. Более длинный ответ получает преимущество в 15–30 процентных пунктов — воспроизводится на разных моделях-судьях. Причём дело даже не в предпочтении: оценка судьи коррелирует с сырой длиной ответа на уровне r = .87, тогда как у людей на том же материале — .44. Судья в значительной мере измеряет объём, а не качество.
Самопредпочтение. Модель ставит выше ответы, порождённые ею же, на 10–25%.
Вот здесь и находится настоящая опасность, и она не в величине чисел.
Случайная ошибка судьи безобидна: на сотне сравнений она усредняется, и сигнал проступает. Смещение не усредняется никогда. Сколько прогонов ни делай, длинный ответ будет выигрывать, и вы получите уверенную, воспроизводимую, статистически значимую оценку — измеряющую не то, что вы думаете.
Причём измеряет она ровно то, что вы обычно и хотите убрать. Многословность модели — статья расходов, а судья награждает за неё. Оптимизируя промпт по такому судье, вы систематически двигаете систему в сторону более длинных и более дорогих ответов, и метрика при этом растёт.
Что с этим делать
Меры дешёвые, и они закрывают почти всё.
Прогонять каждую пару дважды, меняя порядок. Если при перестановке победитель меняется — засчитывать ничью. Стоит вдвое дороже и убирает смещение по порядку целиком, а не уменьшает.
Уравнивать длину или называть её в рубрике. Либо ограничить объём обоих ответов, либо прямо написать судье, что длина не является достоинством. Второе работает хуже первого, но лучше, чем ничего.
Не судить свою же модель той же моделью. Самый простой из трёх шагов и самый часто нарушаемый: удобно взять ту же модель, она уже подключена.
Держать якорь из ручной разметки. Полсотни примеров, размеченных человеком, которые прогоняются вместе с остальными. Они не нужны для оценки — они нужны, чтобы заметить, когда судья поехал: сменилась версия модели, поменялась рубрика, изменился характер входов.
Условие несогласия
Всё вышесказанное — про судью как измерительный прибор для сравнения версий. Как фильтр в проде он живёт по другим правилам: там не нужно точное согласие с человеком, нужно надёжно ловить грубые отказы — пустой ответ, ответ не на том языке, срыв формата, явную грубость. На таких проверках согласие близко к полному, и никакая рубрика для этого не нужна.
Граница проходит по вопросу «что будет, если судья ошибётся». В роли фильтра ошибка стоит одного лишнего прохода. В роли метрики ошибка уводит всю разработку в сторону на месяцы, и заметить это некому, потому что цифры растут.
Чего я делать не стал бы
Не стал бы просить у судьи балл от одного до десяти. Шкалы у модели нет, и вы получите распределение, сосредоточенное на семёрках и восьмёрках, с дисперсией, не связанной с качеством.
Не стал бы использовать судью на предметной области, где он слабее проверяемой модели. Он честно оценит стиль и структуру и не заметит фактической ошибки, а фактическая ошибка — это как раз то, ради чего проверка затевалась.
Не стал бы верить росту метрики без ручной проверки хотя бы десятка случаев, где судья изменил решение. Это единственный способ отличить «стало лучше» от «стало длиннее».
Открытый вопрос
Смещения известны и измерены, но все известные меры борьбы с ними — внешние: перестановки, ограничения, рубрики, якорь. Ни одна не делает судью менее смещённым, все они делают смещение менее вредным.
Меня не оставляет подозрение, что здесь есть предел, который так не обойти: судья и проверяемая модель обучены на пересекающихся данных и разделяют одни и те же представления о том, что выглядит хорошим ответом. Тогда любая оценка одной модели другой систематически слепа к общему для них классу ошибок, и величину этой слепоты внешними мерами не измерить — для этого нужен человек, то есть ровно то, от чего уходили.
Источники: Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge, Self-Preference Bias in LLM-as-a-Judge, Judging the Judges: bias mitigation strategies, измерение согласия судьи и человека.