Secondary в replica set отстаёт от primary, через минуту приложение начнёт читать stale-данные. Нужен HTTP-эндпойнт со словом "ok" / "lag".
Кулинарная книга мониторинга
Готовые рецепты для типовых задач мониторинга. Каждый рецепт показывает минимальный DIY-скрипт и one-click монитор Enterno.io, который закрывает ту же задачу без лишней инфраструктуры.
Memcached переполнился и начал выбрасывать ключи под нагрузкой — приложение получает cache-miss и долбит БД. Нужен порог evictions/мин.
Node-приложение тормозит из-за блокирующих CPU-операций; latency пользователей растёт. Нужен endpoint с моментальным значением event-loop-lag.
Apache начал отдавать 502/503 у одного backend, но не у всех. Нужен endpoint с долей 5xx за последние 60 секунд.
Сайт в HSTS preload-листе, но после рефакторинга nginx конфиг заголовок пропал. Через 3 месяца домен будет удалён из preload-листа. Нужен ежедневный чек.
Real-time-чат работает, но disconnects/sec в три раза выше обычного — где-то проксирующий nginx стал рвать соединения. Нужен endpoint с rate.
Мисконфигурация name-server открыла AXFR на интернет — все ваши поддомены, MX, TXT (включая SPF DKIM ключи) видны атакующему. Ежедневный чек с алертом.
Spring-приложение тормозит — long GC pauses (>500ms) каждые несколько минут. Heap-size был ок, но new-gen неправильно настроен. Нужен endpoint с p99 pause.
Раз в неделю аналитик запускает тяжёлую выборку без LIMIT и блокирует другие транзакции. Хочется получать уведомление через минуту, а не через час.
Релиз увеличил bundle-size, p99 cold-start вырос с 800ms до 3s. Метрика в CloudWatch есть, но никто туда не смотрит. Нужен heartbeat-style алерт.
Sentinel сделал failover в 3 ночи, никто не заметил. Хотим узнавать в момент смены master, а не на следующей неделе.
Caddy обычно сам обновляет cert, но один раз rate-limit от Let's Encrypt сорвал renewal — узнали за 2 дня до expiry. Нужен ежедневный двойной чек.
CrashLoopBackOff в одном пространстве имён — kubectl показывает restart-count = 47, но никто не видит. Хочется endpoint, который вернёт high когда счётчик прыгает.
Worker деплоится автоматически из main. Однажды сломался prod 5xx-rate ушёл в 12% — но dashboard смотрят раз в день. Нужна ежеминутная проверка.
Атакующий упёрся в `limit_req_zone` — все легитимные запросы тоже начали получать 429. Логи показывают это, но никто не следит.
Cron-workflow на `schedule:` иногда тихо отключается (форкнутые репо, истёкший token, GH outage). Узнаёшь через неделю по пропавшим backup'ам.
У вас включён `request_slowlog` в php-fpm.conf — но никто туда не смотрит. Хочется endpoint который вернёт high когда за минуту > 5 медленных запросов.
Endpoint `/stripe/webhook` начал отвечать 500 после деплоя — Stripe сделал 5 retry, потом сдался. Платежи отстают на 24h. Узнавать через 60 сек.
API gateway деплоит новую схему — Mobile-команда узнаёт что type был удалён через crash report. Хочется снимок раз в 5 минут с diff-алертом.
Под нагрузкой Tomcat-приложение упирается в `maxThreads=200` — новые запросы стоят в очереди, p99 latency растёт. Метрика есть в JMX, но никто не смотрит.
Не нашли нужный рецепт?
Напишите, какой стек добавить — письмо на support@enterno.io, добавим рецепт и поставим кредит на странице.
Начать мониторинг — бесплатно →