Плавающее падение: с чего начать диагностику
Сервис падает примерно один запуск из пятидесяти, каждый раз в разном месте, стек в дампе выглядит бессмысленно. Логи ничего подозрительного не показывают.
Что разумно сделать первым шагом?
- Пересобрать с AddressSanitizer и UndefinedBehaviorSanitizer и прогнать нагрузочный сценарий
- Расставить логирование на входе и выходе каждого метода и ждать повторения падения в проде, чтобы поймать последний вызов перед сбоем
- Увеличить размер стека потоков и лимиты памяти процесса
- Собирать только в Release: под оптимизациями падения не воспроизводятся
