OTP-коды для логина шлются через Twilio — ночью carrier начал блокировать тип сообщений, delivery dropped до 30%. Узнаёте по жалобам пользователей.
Кулинарная книга мониторинга
Готовые рецепты для типовых задач мониторинга. Каждый рецепт показывает минимальный DIY-скрипт и one-click монитор Enterno.io, который закрывает ту же задачу без лишней инфраструктуры.
Filebeat / Logstash тихо упал на одном edge-сервере. Ingest rate в Elasticsearch снижен на 40%, но dashboards никто не смотрит. Запросы в Sentry без логов = слепота.
CloudFront CDN-distribution начал возвращать 5xx 4% времени — клиенты в дальних регионах видят битые страницы. CloudWatch graph есть, dashboard никто не открывает.
Один из нескольких systemd units (cron, redis, postfix) упал в 3 ночи и не поднялся. Узнал утром по жалобам. Хочется endpoint показывающий high когда любой unit failed.
Сервис подключается к стороннему API через JWT, токен живёт 24 ч и иногда продляется ручкой. Если забыл — пайплайн ломается в 3 утра.
Webhook-receiver принимает события GitHub. Если валидация подписи начала падать (поменяли secret где-то в одном месте) — деплои тихо ломаются.
Релиз выкатили — Sentry даёт правильные алерты только за крупные сбои. Хочу видеть медленный рост error-rate за окно 15 минут до того, как это станет инцидентом.
Postfix начал bounce-ить часть писем (домен подмочил репутацию) — но видишь это только когда клиенты пишут в support: «не пришло письмо».
Часы поползли (timesync завис, провайдер NTP-сервера лёг) — TOTP начнёт фейлить, JWT с iat в будущем отвергаются, логи путаются.
Авто-релогирование сертификатов на 200 поддоменов — однажды попадаешь в Let's Encrypt rate-limit (50 certs/неделя на регистрируемый домен) и сидишь без HTTPS.
MySQL replica перестала применять binlog (Slave_SQL_Running=No после ошибки query) — но мониторишь только heartbeat, lag не растёт линейно потому что просто стоп.
Внезапно много банов в fail2ban — credential-stuffing или enumeration кампания. Хочу узнать про это в первые 5 минут, а не утром по логам.
GitLab pipeline иногда зависает в running на час+ (runner потерял связь, или job висит в curl без timeout) — увидишь только когда merge request «не двигается».
OpenSearch на 85 % диска (high watermark) — индексы переходят в read-only, write-API ломается. Нужно поймать раньше, а не когда уже 95 % (flood-stage).
DynamoDB начал throttle-ить запросы (горячий ключ или write-capacity мал) — приложение получает ProvisionedThroughputExceededException, но AWS-алерты только на 5-минутном агрегате.
Все алерты идут в Slack — но если URL webhook revoked / 404 / Slack-incident, ты не узнаешь именно потому что алерты не доходят (failure-of-failure).
Redis работает, но `mem_fragmentation_ratio > 1.5` — реальное использование памяти намного больше отчёта `used_memory_human`. OOM придёт внезапно.
etcd в кластере K8s переизбирает лидера каждые 30 сек — kube-apiserver лагает, controller-manager не успевает применять reconcile. Это видно только в etcd-метриках.
OAuth-callback (`/auth/callback`) начал отдавать 4xx — пользователи не могут залогиниться, но common health-check на `/` возвращает 200.
Chargeback-rate резко вырос — карта-fraud-волна или политика партнёра поменялась. Stripe сам шлёт email только когда уже late, а dispute window 7 дней.
Не нашли нужный рецепт?
Напишите, какой стек добавить — письмо на support@enterno.io, добавим рецепт и поставим кредит на странице.
Начать мониторинг — бесплатно →