RAG-ассистент ошибается в 30% ответов — непонятно, что чинить
Команда оценивает RAG-ассистента только по итоговому ответу: асессоры отмечают, верен ли он. Ошибочны 30% ответов. Одни предлагают сменить LLM, другие — модель эмбеддингов, третьи — переписать промпт.
Как построить оценку, чтобы найти узкое место?
- Оценивать поиск и генерацию отдельно
- Сменить все компоненты сразу и сравнить
- Удвоить число асессоров итоговых ответов
- Оценивать только скорость ответа
