IncidentRelay, новая open-source платформа для управления расписаниями дежурств, маршрутизацией оповещений, эскалациями и реагированием на инциденты, вышла в первом стабильном релизе 1.1 после серии бета-сборок.

Проект ориентирован на команды SRE, DevOps, платформенные, инфраструктурные и операционные группы, которые хотят управлять процессами инцидентов на собственной инфраструктуре, а не полагаться исключительно на облачные сервисы вроде PagerDuty.

Важно понимать, что IncidentRelay не очередная система мониторинга. Она работает между существующими инструментами мониторинга и людьми, ответственными за реагирование на оповещения.

Когда платформа мониторинга обнаруживает проблему, IncidentRelay принимает оповещение, проверяет его источник, метки, серьёзность, правила маршрутизации и принадлежность к команде, а затем направляет его нужному дежурному. После этого оповещение можно подтвердить, закрыть, заглушить или эскалировать, если ответа не поступило.

Open-Source On-Call Management Platform
Open-Source On-Call Management Platform

IncidentRelay поддерживает графики дежурств, повторяющиеся ротации, временные замены, напоминания и цепочки эскалации. Неподтверждённые оповещения запускают повторные напоминания, прежде чем эскалировать следующему по очереди, что помогает командам не пропускать критические уведомления.

Платформа также предоставляет окна обслуживания и режим тишины для плановых работ, а также группировку и контроль доступа для организаций с несколькими инфраструктурными или командами разработки. Кроме того, интерфейс календаря показывает текущие назначения и замены.

Для входящих оповещений IncidentRelay интегрируется с Prometheus Alertmanager, Grafana Alerting, AWS SNS и CloudWatch, Zabbix, Sentry, LibreNMS, RMON и универсальными вебхуками. Уведомления доставляются через Slack, Mattermost, Telegram, Discord, Microsoft Teams, электронную почту, исходящие вебхуки, push-уведомления в браузере или PWA, а также подключаемые провайдеры голосовых вызовов.

Платформа поддерживает управление доступом на основе групп и мультикомандную работу: каждый маршрут использует уникальный токен приёма, что позволяет администраторам задавать, какие внешние системы могут отправлять оповещения в команду или ротацию.

Приложение также предоставляет документированные конечные точки OpenAPI и поддерживает персональные API-токены. Кроме того, доступен отдельный провайдер Terraform для команд, которые хотят управлять частью конфигурации IncidentRelay через подход «инфраструктура как код».

Как и ожидалось от self-hosted платформы, IncidentRelay работает с собственной базой данных организации, сетевыми правилами и политиками эксплуатации. Администраторы могут выбрать SQLite для небольших одноузловых развёртываний или PostgreSQL, который рекомендуется для крупных и долгосрочных установок.

Варианты развёртывания включают Docker Compose, Helm-чарт для Kubernetes и ручную установку через systemd. Для совместимых с RHEL дистрибутивов доступен RPM-репозиторий. IncidentRelay в основном написан на Python и распространяется под пермиссивной лицензией MIT.

Для получения дополнительной информации, включая инструкции по установке и документацию, посетите веб-сайт проекта или репозиторий на GitHub.

Image credits: IncidentRelay