Сколько ещё будет сбоев и когда следующий
Главный сервис снова лёг. Когда это кончится - толком никто не говорит, технари что-то обещают, но после третьего раза им уже не веришь. Сколько ещё таких сюрпризов ждать и что с этим делать?
Какую задачу решаем?
Два практических вопроса. Первый - сколько инцидентов реально ждать в ближайшую неделю или месяц: под это планируют дежурства и спринт. Второй - насколько вероятен один по-настоящему долгий и болезненный сбой: готовить ли эскалацию и резерв заранее, или это редкость, о которой можно не думать.
Наши результаты
На реальных данных движок посчитал ожидаемое число инцидентов вперёд по модели Пуассона (стандартная модель для числа редких случайных событий):
Отдельно движок оценил риск очень долгого простоя методом POT / GPD (статистика экстремальных значений - раздел статистики именно про редкие, но тяжёлые случаи, а не про типичный день):
Как это считается
Два метода из семейства прогнозов - «что будет дальше?».
- Прогноз частоты событий (Пуассон). С поправкой на тренд: если частота растёт, прогноз это учитывает. Нужна история инцидентов от ~2 недель.
- Риск долгого простоя (POT / GPD). Отдельно от «типичного» простоя моделируется именно хвост - редкие затяжные случаи, которые обычная средняя маскирует. Нужно от ~50–100 инцидентов с длительностью.
Узнать это про свою инфраструктуру
Загрузите историю инцидентов - движок посчитает прогноз частоты и, если данных достаточно, риск долгого сбоя.
Все данные обрабатываются изолированно и не передаются третьим лицам.