IncidentRelay, новая open-source платформа для управления расписаниями дежурств, маршрутизацией оповещений, эскалациями и реагированием на инциденты, вышла в первом стабильном релизе 1.1 после серии бета-сборок.
Проект ориентирован на команды SRE, DevOps, платформенные, инфраструктурные и операционные группы, которые хотят управлять процессами инцидентов на собственной инфраструктуре, а не полагаться исключительно на облачные сервисы вроде PagerDuty.
Важно понимать, что IncidentRelay не очередная система мониторинга. Она работает между существующими инструментами мониторинга и людьми, ответственными за реагирование на оповещения.
Когда платформа мониторинга обнаруживает проблему, IncidentRelay принимает оповещение, проверяет его источник, метки, серьёзность, правила маршрутизации и принадлежность к команде, а затем направляет его нужному дежурному. После этого оповещение можно подтвердить, закрыть, заглушить или эскалировать, если ответа не поступило.

IncidentRelay поддерживает графики дежурств, повторяющиеся ротации, временные замены, напоминания и цепочки эскалации. Неподтверждённые оповещения запускают повторные напоминания, прежде чем эскалировать следующему по очереди, что помогает командам не пропускать критические уведомления.
Платформа также предоставляет окна обслуживания и режим тишины для плановых работ, а также группировку и контроль доступа для организаций с несколькими инфраструктурными или командами разработки. Кроме того, интерфейс календаря показывает текущие назначения и замены.
Для входящих оповещений IncidentRelay интегрируется с Prometheus Alertmanager, Grafana Alerting, AWS SNS и CloudWatch, Zabbix, Sentry, LibreNMS, RMON и универсальными вебхуками. Уведомления доставляются через Slack, Mattermost, Telegram, Discord, Microsoft Teams, электронную почту, исходящие вебхуки, push-уведомления в браузере или PWA, а также подключаемые провайдеры голосовых вызовов.
Платформа поддерживает управление доступом на основе групп и мультикомандную работу: каждый маршрут использует уникальный токен приёма, что позволяет администраторам задавать, какие внешние системы могут отправлять оповещения в команду или ротацию.
Приложение также предоставляет документированные конечные точки OpenAPI и поддерживает персональные API-токены. Кроме того, доступен отдельный провайдер Terraform для команд, которые хотят управлять частью конфигурации IncidentRelay через подход «инфраструктура как код».
Как и ожидалось от self-hosted платформы, IncidentRelay работает с собственной базой данных организации, сетевыми правилами и политиками эксплуатации. Администраторы могут выбрать SQLite для небольших одноузловых развёртываний или PostgreSQL, который рекомендуется для крупных и долгосрочных установок.
Варианты развёртывания включают Docker Compose, Helm-чарт для Kubernetes и ручную установку через systemd. Для совместимых с RHEL дистрибутивов доступен RPM-репозиторий. IncidentRelay в основном написан на Python и распространяется под пермиссивной лицензией MIT.
Для получения дополнительной информации, включая инструкции по установке и документацию, посетите веб-сайт проекта или репозиторий на GitHub.
Image credits: IncidentRelay




Пока нет комментариев. Будьте первым!