Pouzdanost iz logova

MTBF i MTTR: koliko često pada i koliko brzo se popravlja

MTBF (Mean Time Between Failures) - srednje vreme između kvarova: koliko dugo servis radi od jednog kvara do sledećeg.
MTTR (Mean Time To Recovery) - vreme oporavka: koliko je potrebno da se servis vrati u radno stanje.
Ovo su dva osnovna pokazatelja pouzdanosti. Zajedno pokazuju koji servisi otkazuju češće od drugih i gde kompanija gubi najviše vremena na popravke.

Zadatak

Izračunati za svaki servis učestalost otkaza i brzinu oporavka, i utvrditi kojim se metrikama zaista može verovati pri planiranju i u izveštajima.

Dve glavne greške u proračunu

  • Opisivati vreme oporavka jednim prosekom. Nekoliko dugih havarija jako podiže prosek i on više ne pokazuje trajanje običnog incidenta.
  • Računati učestalost otkaza zbirno za sve servise. Pokazatelj „kvar svakih 8 sati“ za celu kompaniju ne govori koji konkretno servis je nepouzdan.

Kako se računa

Metod iz porodice deskriptivne analitike.

  • Vreme oporavka (MTTR). Za svaki incident beleži se vreme od nastanka do potpunog oporavka. Iz tih podataka računaju se tri ključna pokazatelja:
    Medijana - tačka do koje se zatvara 50% svih incidenata.
    Prosek - zbir trajanja svih kvarova podeljen njihovim brojem.
    P95 (95. percentil) - granica posle koje traje samo 5% najtežih kvarova.
    Dodatno se računa koji udeo ukupnog zastoja čine tih 5% teških havarija. Ako je to polovina ili više, proces oporavka se zapravo deli na dva različita režima: standardni i havarijski.
  • Srednje vreme između kvarova (MTBF). Za konkretan servis: period posmatranja podeljen brojem njegovih otkaza.
    Za celu kompaniju: isti pristup pokazuje ukupnu učestalost incidenata u infrastrukturi.

Zahtevi za podatke:
Tačno vreme početka i završetka svakog incidenta (ili ukupno trajanje u minutima/satima).
Povezanost kvara sa konkretnim servisom (za proračun MTBF).
Napomena: incidenti koji u trenutku proračuna nisu zatvoreni ne ulaze u MTTR.

Primer rezultata

Na primeru bankarske obrade.

Medijana - 22 minuta. Prosek - 3 h 13 min. P95 - 9 h 47 min. Prosečno vreme oporavka je 9 puta veće od medijane. Razlog je 5% najdužih kvarova (dužih od 9 h 47 min), na koje je otpalo 72% celokupnog zastoja.

Praktična korist

  • Izbor metrika za izveštaje. U izveštajima i KPI treba navoditi medijanu i P95, a ne aritmetički prosek.
    Zašto: prosek (3 h 13 min) daje lažnu sliku. Zbog njega biznis misli da se svaki običan kvar otkloni za tri sata (iako se polovina reši za 22 minuta), a istovremeno potcenjuje težinu stvarnih havarija (9+ sati).
  • Odvojeni propisi i eskalacija. Pošto se kvarovi dele na brze (masovne) i dugotrajne (sistemske), način rada s njima mora biti različit. Vremenske pragove eskalacije efikasnije je vezati za stvarnu raspodelu (medijanu i P95):
    Do 30 minuta: otklanja dežurna smena po standardnim uputstvima (runbooks).
    Posle 30-60 minuta (prekoračeno standardno vreme): uključuju se L3 inženjeri i određuje se koordinator incidenta (Incident Commander).
    Posle 2 sata: eskalacija na rukovodioca sektora i formiranje operativnog štaba.
    Posle 4-8 sati (blizu P95): uključuje se krizni protokol (angažuju se arhitekta i proizvođači, prelazi se na rezervne šeme).
  • Gde usmeriti pažnju i resurse. Glavni resurs razvoja i eksploatacije treba usmeriti na 5% najtežih havarija. Smanjenje njihovog broja ili trajanja daje najveći efekat, jer upravo one čine 72% ukupnog zastoja.
  • Prioritizacija servisa (po MTBF). Poređenje srednjeg vremena između kvarova daje rang problematičnih sistema i određuje redosled rada:
    Plaćanje usluga: kvar na svakih 3.9 dana (najproblematičniji servis)
    Procesni centar: kvar na svakih 5.0 dana
    SBP transferi: kvar na svakih 5.5 dana
    Ova lista pokazuje od kog servisa treba početi inženjerska poboljšanja i služi kao polazna tačka pri proveri rezultata nakon kvartala.
Ista analiza na vašim podacima - „Pokreni analizu“ na početnoj →

Svi podaci se obrađuju izolovano i ne prosleđuju se trećim licima.