Классификация 5 000 обращений по 8 темам: с чего начать
Нужно автоматически распределять обращения в поддержку по 8 темам. Размечено 5 000 обращений, темы различаются в основном ключевыми словами: «возврат», «доставка», «пароль». Коллега предлагает сразу дообучить большую языковую модель на GPU-кластере.
Какой первый шаг разумнее?
- Бейзлайн TF-IDF с логистической регрессией
- Сразу дообучить LLM на всех данных
- Разметить ещё 100 тысяч обращений
- Написать правила на регулярных выражениях
