
Оптимизация параметров кластера привела к цепной реакции и перегрузке управляющих процессов.
Команда Discord увеличила ресурсы сервиса сессий, уменьшив общее число его копий.
При остановке экземпляры не успели передать данные соседним узлам системы.
В результате эксперимента одномоментно оборвалось около 17% текущих сессий устройств.
──────────────────────────────────────────────────
Массовые переподключения перегрузили процессы, отвечающие за HTTP-соединения.
Через них же проходило обновление регистраций в критически важном хранилище etcd.
Растущие очереди блокировали узлы, не позволяя им восстановиться даже после перезапуска.
──────────────────────────────────────────────────
Ограничение частоты запросов и расширение кластера помогли вернуть сервис в норму.
Для предотвращения повторов создание соединений разнесли по независимым процессам.
Разбор сбоя позволил команде пересмотреть механизмы отказоустойчивости инфраструктуры.
──────────────────────────────────────────────────