В какие часы чаще всего происходят сбои
Мониторинг шлёт алерт, когда сервис уже упал. Но он не показывает закономерность - например, что почти половина сбоев приходится на одни и те же часы.
Какую задачу решаем?
Чтобы увидеть закономерность по времени, кто-то должен сесть и вручную пересчитать сотни строк лога. Руки до этого обычно не доходят - и повторяющийся паттерн так и остаётся незамеченным, хотя именно он часто указывает на причину.
Наши результаты
На реальных данных (журнал отказов в дата-центре, около 1000 записей) движок посчитал распределение инцидентов по часам и дням недели:
Важная оговорка к этому датасету. Здесь 02:00 - это момент суточного скана дисков (система проверяет их раз в сутки ночью), а не момент реального отказа. Это как судить о времени, когда людям стало плохо, по журналу утреннего обхода: все записи падают на 08:00, но это время обхода. Метод отработал честно, но здесь он показал расписание скана, а не «рабочий ритм». На логах с точным временем события тот же метод покажет настоящий ритм сбоев - например, пик перед началом рабочего дня или после ночных релизов.
Как это считается
Методы из семейства описательной аналитики - «что у меня происходит?».
- Топ временных окон. Группируем инциденты по часу и дню недели и находим, где концентрация выше случайной.
- Кластеризация инцидентов. Разбиваем сбои на типовые группы по времени и длительности («ночные короткие», «дневные затяжные», «редкие критические»), а не оставляем общую массу без структуры.
Мы не заменяем мониторинг реального времени (Zabbix, Datadog, Grafana) - он ловит сбой в моменте. Мы находим закономерность за период, которую в моменте не видно.
Узнать это про свою инфраструктуру
Загрузите историю инцидентов - движок найдёт закономерность по времени в ваших данных.
Все данные обрабатываются изолированно и не передаются третьим лицам.