Надёжность по логам · Тариф Free

MTBF и MTTR по логам - без установки агента

Как часто падает сервис и как быстро его чинят? Обычно за этим идут ставить агента мониторинга. Но иногда его поставить нельзя - или просто некогда.

Какую задачу решаем?

Поставить агента или подключиться к Datadog / Zabbix не всегда возможно: доступ закрыт по договору, инфраструктура старая, или это разовая проверка перед аудитом либо тендером, где разворачивать постоянный мониторинг просто незачем. А ответ на «как часто падает и как быстро чинится» нужен уже сейчас.

Наши результаты

На реальных данных (журнал отказов в дата-центре, около 1000 записей за квартал) движок посчитал MTBF и MTTR - два самых частых показателя надёжности (среднее время между отказами и среднее время восстановления) - прямо из CSV-файла, без единой установки:

MTBF: 2.0 часа в среднем, 0 часов медиана, 24 часа - P95. Разница между средним и медианой здесь не случайна: среднее тянут вверх редкие долгие паузы, а медиана 0 показывает, что чаще всего отказы идут почти подряд. Это уже диагноз - но виден он только через статистику, а не через беглый просмотр лога.

P95 - значение, хуже которого только 5% случаев: оно показывает «плохой», а не типичный день.

Как это считается

Метод из семейства описательной аналитики - «что у меня происходит?».

Всё, что нужно, - две временные метки (или готовая длительность) и, желательно, название сервиса. Установка агента, доступ к боевой инфраструктуре и интеграции не требуются - только файл с историей.

Эти числа - результат реального прогона движка на реальных данных, а не пример. Считает статистический движок; ИИ в расчётах не участвует и не может изменить цифру. Почему нашим числам можно верить →

Узнать это про свою инфраструктуру

Загрузите файл с историей инцидентов (CSV / Excel) - движок посчитает MTBF и MTTR за минуты, ничего не устанавливая в вашей инфраструктуре.

Все данные обрабатываются изолированно и не передаются третьим лицам.