Всем 🔥 привет! Разбираем эпичный ночной даунтайм. Продакшн на микросервисах (K8s, Go/Python) лег из-за каскадного отказа проблема в цепочке взаимодействия service mesh (Istio) и кастомного rate-limiter’а. Команда на горячую развернула Python-скрипт, который, парся логи fluentd и метрики Prometheus через их API, обнаружил аномалию в latency между specific pods. Скрипт не только восстановил баланс через K8s API, но и, используя простую линейную регрессию (scikit-learn) на исторических данных, спрогнозировал следующее потенциальное падение через 57 минут.
Вопрос – какие нестандартные мониторинговые или ‘скоращенные’ automation-решения вас выручали в критических ситуациях? Интересуют именно хаки, а не готовые enterprise-решения.