Какие инциденты дают больше всего простоя
Сотни, а то и тысячи инцидентов в трекере за год - обычное дело. Чинить всё и сразу ресурсов нет. Но с чего начать, чтобы простои снижались быстро?
Задача
Мы не встречали ещё команду, которая успевает разбирать всё и всегда. А первое желание у многих - починить сбои, которых больше всего. Но далеко не всегда те инциденты, что дают больше всего времени простоя, происходят часто. И здесь будет полезен способ отделения немногого важного от большинства, которое можно отложить.
Как это считается
Метод из семейства описательной аналитики.
- Парето-анализ (правило 80/20). Сортируем инциденты по вкладу в простой и считаем накопленную сумму - до какой точки набегает 80%. Рядом - коэффициент Джини как числовая мера концентрации.
Метод считает частоту и долю простоя, но не тяжесть отдельного катастрофического сбоя. Поэтому рядом всегда идёт оценка риска долгого простоя (отдельный разбор).
Пример результата
На реальных данных (банковский процессинг, 802 инцидента за год) движок посчитал вклад каждого инцидента в общий простой:
Практический вывод: заняться этими 52 инцидентами важнее, чем всей массой сразу. Остальные 93.5% чинить тоже возможно нужно, но простой они почти не двигают, даже если закрыть их все. Экономия сил очевидна и может дать хороший коммерческий эффект.