MTBF i MTTR: koliko često pada i koliko brzo se popravlja
MTBF (Mean Time Between Failures) - srednje vreme između kvarova: koliko dugo servis radi od jednog kvara do sledećeg.
MTTR (Mean Time To Recovery) - vreme oporavka: koliko je potrebno da se servis vrati u radno stanje.
Ovo su dva osnovna pokazatelja pouzdanosti. Zajedno pokazuju koji servisi otkazuju češće od drugih i gde kompanija gubi najviše vremena na popravke.
Zadatak
Izračunati za svaki servis učestalost otkaza i brzinu oporavka, i utvrditi kojim se metrikama zaista može verovati pri planiranju i u izveštajima.
Dve glavne greške u proračunu
- Opisivati vreme oporavka jednim prosekom. Nekoliko dugih havarija jako podiže prosek i on više ne pokazuje trajanje običnog incidenta.
- Računati učestalost otkaza zbirno za sve servise. Pokazatelj „kvar svakih 8 sati“ za celu kompaniju ne govori koji konkretno servis je nepouzdan.
Kako se računa
Metod iz porodice deskriptivne analitike.
- Vreme oporavka (MTTR). Za svaki incident beleži se vreme od nastanka do potpunog oporavka. Iz tih podataka računaju se tri ključna pokazatelja:
Medijana - tačka do koje se zatvara 50% svih incidenata.
Prosek - zbir trajanja svih kvarova podeljen njihovim brojem.
P95 (95. percentil) - granica posle koje traje samo 5% najtežih kvarova.
Dodatno se računa koji udeo ukupnog zastoja čine tih 5% teških havarija. Ako je to polovina ili više, proces oporavka se zapravo deli na dva različita režima: standardni i havarijski. - Srednje vreme između kvarova (MTBF).
Za konkretan servis: period posmatranja podeljen brojem njegovih otkaza.
Za celu kompaniju: isti pristup pokazuje ukupnu učestalost incidenata u infrastrukturi.
Zahtevi za podatke:
Tačno vreme početka i završetka svakog incidenta (ili ukupno trajanje u minutima/satima).
Povezanost kvara sa konkretnim servisom (za proračun MTBF).
Napomena: incidenti koji u trenutku proračuna nisu zatvoreni ne ulaze u MTTR.
Primer rezultata
Na primeru bankarske obrade.
Glavnina sitnih kvarova je levo od medijane. Desno od linije P95 nalazi se retka grupa teških havarija: brojčano ih je malo, ali upravo one čine najveći deo ukupnog zastoja.
Praktična korist
- Izbor metrika za izveštaje. U izveštajima i KPI treba navoditi medijanu i P95, a ne aritmetički prosek.
Zašto: prosek (3 h 13 min) daje lažnu sliku. Zbog njega biznis misli da se svaki običan kvar otkloni za tri sata (iako se polovina reši za 22 minuta), a istovremeno potcenjuje težinu stvarnih havarija (9+ sati). - Odvojeni propisi i eskalacija. Pošto se kvarovi dele na brze (masovne) i dugotrajne (sistemske), način rada s njima mora biti različit. Vremenske pragove eskalacije efikasnije je vezati za stvarnu raspodelu (medijanu i P95):
Do 30 minuta: otklanja dežurna smena po standardnim uputstvima (runbooks).
Posle 30-60 minuta (prekoračeno standardno vreme): uključuju se L3 inženjeri i određuje se koordinator incidenta (Incident Commander).
Posle 2 sata: eskalacija na rukovodioca sektora i formiranje operativnog štaba.
Posle 4-8 sati (blizu P95): uključuje se krizni protokol (angažuju se arhitekta i proizvođači, prelazi se na rezervne šeme). - Gde usmeriti pažnju i resurse. Glavni resurs razvoja i eksploatacije treba usmeriti na 5% najtežih havarija. Smanjenje njihovog broja ili trajanja daje najveći efekat, jer upravo one čine 72% ukupnog zastoja.
- Prioritizacija servisa (po MTBF). Poređenje srednjeg vremena između kvarova daje rang problematičnih sistema i određuje redosled rada:
Plaćanje usluga: kvar na svakih 3.9 dana (najproblematičniji servis)
Procesni centar: kvar na svakih 5.0 dana
SBP transferi: kvar na svakih 5.5 dana
Ova lista pokazuje od kog servisa treba početi inženjerska poboljšanja i služi kao polazna tačka pri proveri rezultata nakon kvartala.