Флаки разбирают через стабильное воспроизведение, логирование полного HTTP, проверку гонок данных/async и порядка параллельных тестов — затем фикс изоляции или ожидания, не retry как единственное решение.
Разбор
- Соберите failing request id, timestamps, environment.
- Причины: shared data, eventual consistency, rate limit, clock skew.
- Устранение: уникальные данные, явные wait conditions, serial для конфликтных suite.
- Retry — временный щит, не корневой fix; метрика flaky в CI.
Итог
Senior подход: найти корневую причину недетерминизма, а не маскировать падение.