MTBF и MTTR по логам - без установки агента
Как часто падает сервис и как быстро его чинят? Обычно за этим идут ставить агента мониторинга. Но иногда его поставить нельзя - или просто некогда.
Какую задачу решаем?
Поставить агента или подключиться к Datadog / Zabbix не всегда возможно: доступ закрыт по договору, инфраструктура старая, или это разовая проверка перед аудитом либо тендером, где разворачивать постоянный мониторинг просто незачем. А ответ на «как часто падает и как быстро чинится» нужен уже сейчас.
Наши результаты
На реальных данных (журнал отказов в дата-центре, около 1000 записей за квартал) движок посчитал MTBF и MTTR - два самых частых показателя надёжности (среднее время между отказами и среднее время восстановления) - прямо из CSV-файла, без единой установки:
P95 - значение, хуже которого только 5% случаев: оно показывает «плохой», а не типичный день.
Как это считается
Метод из семейства описательной аналитики - «что у меня происходит?».
- Инциденты, MTBF / MTTR. Движок берёт колонки начала и конца события (или готовую длительность) из выгрузки - CSV или Excel из Jira, ServiceNow, Zabbix или просто список инцидентов - и считает среднее, медиану и P95.
Всё, что нужно, - две временные метки (или готовая длительность) и, желательно, название сервиса. Установка агента, доступ к боевой инфраструктуре и интеграции не требуются - только файл с историей.
Узнать это про свою инфраструктуру
Загрузите файл с историей инцидентов (CSV / Excel) - движок посчитает MTBF и MTTR за минуты, ничего не устанавливая в вашей инфраструктуре.
Все данные обрабатываются изолированно и не передаются третьим лицам.