Несколько лет назад команда столкнулась с серией инцидентов и запустила расследование в поисках скрытого дефекта Redis-клиента. Сбои воспроизводили под контролируемой нагрузкой, проверяли гипотезы одну за другой, обновляли Jedis, меняли таймауты и размеры пулов — но проблема не уходила.

Типичные шаги по настройке клиента и библиотеки не дали результата, хотя именно они обычно первыми приходят в голову при нестабильности кэша. Перелом наступил после введения новых метрик и логов совместно с настойчивой работой команды. Именно наблюдаемость, а не очередное изменение параметров, позволила увидеть корень сбоя, который не проявлялся при стандартной диагностике.

Инженерам стоит закладывать метрики и логирование до исчерпания очевидных правок конфигурации. Без них длинное расследование может закончиться так же, как началось — серией догадок без доказательств, даже если обновления Jedis и настройки пулов выглядят логичными.