Тимлид платформы hh.ru Коля Грибанов описал расследование серии сбоев Redis-клиента. Команда долго гоняла инциденты под нагрузкой, меняла Jedis, таймауты и размеры пулов — и всё равно не находила причину.

Помогли новые метрики, логи и ночные эксперименты. В итоге подозреваемой оказалась одна лишняя строчка кода. Отдельно автор объясняет, почему потеря одной ноды Redis поднимала шторм из десятков тысяч соединений.

Текст полезен тем, кто держит кэш в проде и привык чинить «железо», хотя ломается клиент. Полный разбор гипотез — в статье на Хабре.