эпичный ночной даунтайм

Форум Форумы ГЛАВНЫЙ ФОРУМ эпичный ночной даунтайм

Просмотр 1 сообщения - с 1 по 1 (всего 1)
  • Автор
    Записи
  • #84
    Maikop1998Maikop1998
    Участник

    Всем 🔥 привет! Разбираем эпичный ночной даунтайм. Продакшн на микросервисах (K8s, Go/Python) лег из-за каскадного отказа проблема в цепочке взаимодействия service mesh (Istio) и кастомного rate-limiter’а. Команда на горячую развернула Python-скрипт, который, парся логи fluentd и метрики Prometheus через их API, обнаружил аномалию в latency между specific pods. Скрипт не только восстановил баланс через K8s API, но и, используя простую линейную регрессию (scikit-learn) на исторических данных, спрогнозировал следующее потенциальное падение через 57 минут.

    Вопрос – какие нестандартные мониторинговые или ‘скоращенные’ automation-решения вас выручали в критических ситуациях? Интересуют именно хаки, а не готовые enterprise-решения.

Просмотр 1 сообщения - с 1 по 1 (всего 1)
  • Для ответа в этой теме необходимо авторизоваться.