LLM-судья стабильно выбирает первый из двух сравниваемых ответов
Для сравнения двух версий промпта используется LLM-as-a-judge: судье показывают ответ версии A, затем ответ B и спрашивают, какой лучше. A побеждает в 68% случаев. Когда ради проверки поменяли порядок, «победила» версия B в 64% случаев.
Как сделать оценку надёжнее?
- Менять порядок и сверять судью с разметкой людей
- Всегда ставить новую версию первой
- Повысить температуру судьи
- Доверять результату, раз судья — сильная модель
