Лестница эксплуатации: пять ступеней зрелости
Зрелость эксплуатации видна не по тому, сколько графиков построено и какая система стоит, а по тому, что служба делает и записывает ради своей услуги: ведёт ли журнал аварий, ставит ли приоритет, обещает ли сроки, разбирает ли причины. На одном и том же Zabbix можно стоять на второй ступени и на четвёртой.
Перепрыгнуть ступень не выходит. Без записанной истории нечего считать, без приоритетов и обещанных сроков нечего сравнивать, без записанных изменений не с чем связать повторную аварию. Поэтому у каждой ступени ниже стоит признак, по которому себя узнают, что на ней болит, один шаг наверх и что по такой истории уже можно посчитать.
Нажмите на ступень, чтобы прочитать, что на ней.
Ваша ступень по ответам
1. Реагируем
Как узнать себя: О поломке узнают от потребителя, а история аварий нигде не копится: разбираемся в чатах и по телефону.
Что болит: Разговор о надёжности опереть не на что: фактов нет, есть впечатления.
Шаг наверх: Записывать каждую аварию в одном месте: начало, окончание, что затронуто.
Что мы считаем по такой истории: Ничего: считать пока нечего.
Ваша ступень по ответам
2. Регистрируем
Как узнать себя: Каждая авария записана: когда началась, когда закончилась, что затронуто.
Что болит: Видно, что ломается, но не видно, что важнее: аварии равны между собой, сроков никто не обещал.
Шаг наверх: Назвать главные услуги и их владельцев, ставить приоритет по влиянию и срочности, обещать сроки восстановления и поставить дежурство.
Что мы считаем по такой истории: Время восстановления и суммарный простой, где простой скапливается, худшие часы недели, какие аварии возвращаются по циклу и тянут за собой другие, частота аварий на 7 и 30 дней и вероятность долгой аварии.
Что должно быть на ступени:
- каждая авария записана Incident management
Ваша ступень по ответам
3. Управляем
Как узнать себя: У главных услуг есть владельцы, у аварий - приоритет, сроки восстановления обещаны, дежурство работает по графику.
Что болит: Аварии закрываются быстро, но возвращаются: причину не ищут, а изменения нигде не записаны, поэтому связать с ними поломку нечем.
Шаг наверх: Разбирать повторы до причины, записывать изменения с типом и результатом и узнавать об авариях раньше потребителя.
Что мы считаем по такой истории: Всё с прошлой ступени и разбивку аварий по приоритетам.
Что должно быть на ступени:
- у главных услуг есть владельцы Service level management
- приоритет ставится по влиянию и срочности Incident management
- обещаны сроки восстановления Service level management
- дежурство и порядок передачи аварии Service desk
Ваша ступень по ответам
4. Предупреждаем
Как узнать себя: Повторы разбираются до причины, изменения записываются, об авариях узнают раньше потребителя.
Что болит: Улучшения делаются, но сработали они или нет, никто не проверяет: показатель до и после не сравнивают.
Шаг наверх: Дать каждому улучшению владельца и показатель, разбирать показатели вместе с потребителем услуги и записать, от какого оборудования услуги зависят.
Что мы считаем по такой истории: Всё с прошлых ступеней, и дату, с которой частота аварий изменилась, можно сверить с записанными изменениями.
Что должно быть на ступени:
- повторы разбираются до причины Problem management
- изменения записываются с типом и результатом Change enablement
- об аварии узнают раньше потребителя Monitoring and event management
Ваша ступень по ответам
5. Улучшаем
Как узнать себя: У улучшений есть владелец и измеренный эффект, показатели разбираются с потребителем, зависимости услуг от оборудования известны.
Что болит: Общего рецепта дальше нет: настройка, сделанная один раз, устаревает вместе с инфраструктурой.
Шаг наверх: Удерживать ступень повторными выгрузками: сравнивать показатели с прошлым периодом и проверять, что сделанное сработало.
Что мы считаем по такой истории: Всё с прошлых ступеней и проверку, сработало ли улучшение: изменилась ли частота аварий после него и сколько их ждать дальше.
Что должно быть на ступени:
- у улучшений есть владелец и измеренный эффект Continual improvement
- показатели разбираются с потребителем Measurement and reporting
- известны зависимости услуг от оборудования Service configuration management
На чём основана лестница
Лестница опирается на ITIL 4 - оттуда взяты названия практик; на подход формальной оценки процессов (ISO/IEC 33000, метод оценки CMMI) - оттуда правило двух свидетельств: слова людей и рабочие записи; и на типы аналитики Gartner - что произошло, почему, что будет, что делать. Опрос даёт «заявлено», ваша выгрузка - «подтверждено», расхождение между ними - «спорно».
Узнать свою ступень
Двенадцать вопросов, несколько минут. Ответы покажут ступень по вашим словам, выгрузка журнала - по вашим данным.
Что дальше с вашей ступенью
Пришлите выгрузку журнала аварий за 90 дней и больше: по ней движок посчитает то, что открывает ваша ступень.