Разборы

Что можно узнать из логов инцидентов

Короткие разборы реальных вопросов эксплуатации. Каждый - про один вопрос: что мы находим, каким методом и почему числам можно верить. Данные в примерах обезличены.

Приоритет
Какие инциденты дают больше всего простоя
Парето: на реальных данных 6.5% инцидентов дали 80% простоя.
Надёжность
MTBF и MTTR по логам, без установки агента
Как часто падает и как быстро чинится - прямо из выгрузки.
Закономерности
В какие часы чаще всего происходят сбои
Закономерность по времени, которую не видно в моменте.
Проверка
Стало ли реально хуже после изменения
Доказательство, а не ощущение: тест до и после релиза.
Первопричина
Что предшествует сбою: цепочки событий
Где корень цепочки, а что - следствие.
Прогноз
Сколько ещё будет сбоев и когда следующий
Прогноз частоты и риск долгого простоя.
Цикличность
Почему сбои повторяются в одно и то же время
Поиск цикличности и прогноз следующего пика.
Сравнение
Мои показатели надёжности - это нормально?
Сравнение с нормами вашей отрасли.
Доверие
Почему нашим числам можно верить
Почему ИИ у нас не может выдумать цифру.

Первый шаг - грейд качества данных - бесплатный. Все данные обрабатываются изолированно и не передаются третьим лицам.