Моя топовая история починки чего-либо тянулась нон-стоп 32 часа. Это был Greenplum заказчика, который несколькими последовательными командами gprecoverseg вывели в «нештатный» режим. Ночная смена под жестким sla плюс неудачное стечение обстоятельств. Через примерно час я сказал что кластеру хана и данным хана, и пошел восстанавливать из бекапа. Пока команда инцидента из 6 или 8 человек проходила стадии Отрицание-Гнев-Торг-Принятие, терабайты уже поднимались в резерв кластер. Потом звали вендора, искали причину, писали бумажки, клялись-божились что больше никогда-никогда. Нагоняли с заказчиком дельту из источников, крепились под нагрузку х4 от обычной. Перенастраивали DNS и все виды коннектов-фаерволлов на резервный кластер. Были веселые выходные. Бизнес-заказчик в понедельник увидел отчеты как ни в чем ни бывало. Записали как учения по отказоустойчивости 🤪