Вступить в клуб →
средняявопросNLP, эмбеддинги, LLM и RAG

LLM-судья стабильно выбирает первый из двух сравниваемых ответов

Для сравнения двух версий промпта используется LLM-as-a-judge: судье показывают ответ версии A, затем ответ B и спрашивают, какой лучше. A побеждает в 68% случаев. Когда ради проверки поменяли порядок, «победила» версия B в 64% случаев.

Как сделать оценку надёжнее?

  • Менять порядок и сверять судью с разметкой людей
  • Всегда ставить новую версию первой
  • Повысить температуру судьи
  • Доверять результату, раз судья — сильная модель

🔒 Проверка ответа — для участников клуба

  • Проверка ответа
  • Подсказка, если застряли
  • Разбор с объяснением, почему так
  • Прогресс по всем задачам и виртуальные собеседования
Зарегистрироваться →

Регистрация занимает минуту

Другие задачи раздела