Хай! После обновления оркестратора (напомнило тот самый day 2 в документации) в продакшне «уплыли» все переменные окружения для половины stateful-сервисов (PostgreSQL, Redis). Автоматические rollback-сценарии не сработали из-за конфликта в метаданных. Решение? Костыль на bash + jq, который, подключаясь к API конфигурационного хранилища (Consul) и сравнивая снепшоты etcd, за 15 минут восстановил корректные конфиги и перезапустил специфичные пода через kubectl с патчем, игнорируя стандартные workflow.
В итоге даунтайм составил 40 минут вместо прогнозируемых 4+ часов. Интересно, у кого были подобные «пожары» с оркестрацией или конфигурацией, где спасла только голая импровизация с CLI и API? Делитесь кейсами и подходами.