Koliko će još biti kvarova i kada sledeći
Glavni servis je opet bio pao i svi su opet „stajali na ušima“. Kada će ovo prestati, niko ne ume pouzdano da kaže. Tehničari naravno nešto obećavaju, ali posle trećeg puta im malo ko veruje. Poznato?
Zbog toga obično nastaju strahovi koliko još takvih problema čekati i koliko je situacija uopšte stabilna - da li je vreme da se spremamo za probleme većeg obima.
Zadatak
Sve probleme eksploatacije bez dubinske analize nije lako pronaći, ali se mogu izvesti par pokazatelja koji će razjasniti neke momente:
- Koliko incidenata očekivati u narednoj nedelji ili mesecu. Na toj osnovi već se mogu planirati dežurstva, sprintovi i slično.
- Koliko je verovatan jedan, ali „zaista dug“ kvar. Da li unapred pripremati eskalaciju i rezervu (što obično izraste u ceo budžet), ili je to retkost čiji je rizik jeftinije ne uračunavati.
Kako se računa
Dva metoda iz porodice prognoza - „šta će biti dalje?“
- Prognoza učestalosti događaja (Poasonov)
Osnova: u obzir se uzima trenutna statistika učestalosti kvarova.
Dugoročne promene: ako su sistemi počeli da padaju češće (ili ređe) i novi tempo se drži duže od dva meseca, prognoza se pravi samo po novim podacima, a stari se odbacuju.
Kratkoročni skokovi: ako se učestalost kvarova promenila sasvim nedavno, glavna prognoza se ne menja: za par nedelja nemoguće je razlikovati slučajnost od stabilnog pogoršanja. Ali se dodatno računa rezervni scenario: „šta će biti ako trenutni skok postane norma“.
Nestabilnost: ako se havarije dešavaju neravnomerno (čas nijedna, čas odjednom mnogo), prognoza daje širi raspon: ne „biće tačno 5 kvarova“, nego „biće od 2 do 8“.
Horizont prognoze: ne može se predvideti budućnost na dug rok ako je malo podataka iz prošlosti. Rok prognoze nije duži od prikupljene istorije: ima podataka za dve nedelje - predviđamo samo nedelju dana unapred.
- Rizik dugog zastoja
Suština: proceniti verovatnoću dugih otkaza sistema.
Obična statistika: ako nas zanima trajanje kvara koje se već javljalo u prošlosti, procena se pravi običnim brojanjem takvih slučajeva u istoriji.
Havarije bez presedana: ako treba proceniti rizik havarije duže od svih prošlih rekorda, primenjuje se poseban matematički model za retke događaje. To je teorijski proračun, zato se navodi raspon verovatnoće, a ne tačan broj slučajeva.
Filtriranje podataka: zastojem se računaju samo kritični incidenti (prioriteti 1 i 2). Nehitne prijave koje dugo vise ne računaju se kao zastoj: dok čekaju u redu, sam servis nastavlja da radi.
Rezultat: koji udeo svih incidenata prelazi u zaista dug zastoj i koliko takvih slučajeva očekivati mesečno.
Šta prognoza vidi, a šta ne
Na osnovu već otkrivenih obrazaca i scenarija, evo koje varijante izveštaj već obrađuje:
| Šta je u dnevniku | Šta piše izveštaj |
|---|---|
| Iznenadni skokovi havarijana primer, posle izdanja | Sistem ne paniči i ne podiže prognozu više puta. Glavni proračun ide po staroj normi, a za skok se daje poseban scenario „šta će biti ako ovo ne prestane“. |
| Sezonska preopterećenjana primer, decembar | Prognoza za miran januar ne pravi se po vršnom decembru. Ako postoje podaci za prošlu godinu, sistem to prepoznaje kao sezonalnost. |
| Neravnomerni kvarovičas gusto, čas prazno | Ako havarije idu u talasima, sistem širi raspon prognoze da uzme u obzir tu nestabilnost, i posebno pokazuje koliko krupni jednokratni skokovi kvare sliku. |
| Premalo podatakaistorija samo od 2 nedelje | Sistem odbija da nagađa mesec dana unapred. Prognoza se pravi najviše za jednu nedelju, uz objašnjenje razloga. |
| Nezatvoreni incidenti | Uračunavaju se u učestalost kvarova, ali ne učestvuju u proračunu vremena zastoja: još nisu popravljeni. Za njih se daje poseban pregled: koliko ih visi i ima li među njima kritičnih. |
| Automatsko zatvaranje prijavasistem sam zatvara tiket posle 3 dana | Analizator prepoznaje takva veštačka kašnjenja i ne računa ih kao stvarne duge kvarove, da ne bi izobličio statistiku zastoja. |
| Masovna čišćenjaodjednom zatvoreno 60 starih prijava | Sistem vidi tu anomaliju, navodi datum „čišćenja“ i isključuje te tikete iz proračuna trajanja havarija. |
| Vreme birokratijepostoji samo vreme formalnog zatvaranja | Ako se beleži samo vreme zatvaranja prijave, a ne stvarni oporavak servisa, izveštaj će pošteno upozoriti na grešku i zamoliti da se ubuduće navodi tačan datum popravke. |
Primer 1. Koliko kvarova očekivati
Situacija: internet prodavnica. Pre dve nedelje izbačeno je neuspešno ažuriranje, broj grešaka je naglo porastao, povratak na staro nije urađen.
Šta će pokazati izveštaj: sledećeg meseca očekuje se od 61 do 118 incidenata, u proseku 88. Ali ako se trenutni skok ne ispravi (sada 10 kvarova dnevno umesto uobičajena 3), za mesec će se nakupiti više od 300 kvarova.
U čemu je korist: dobijate realan raspon, a ne lažno tačnu cifru. Opterećenje tehničke podrške može se planirati za osnovni nivo, bez naduvavanja osoblja zbog privremenog skoka. I pri tom se vidi cena odlaganja, ako se neuspešno izdanje ne popravi odmah.
Primer 2. Rizik dugog zastoja
Situacija: ista internet prodavnica u normalnom režimu rada. Procenjujemo rizik da kritičan servis padne duže od 6 sati.
Šta će pokazati izveštaj: 3% svih kvarova traje duže od 6 sati, u proseku oko 3 puta mesečno. Ako se uzmu samo najkritičnije havarije (najviši prioritet), one se otegnu na 6+ sati otprilike jednom u dva meseca.
U čemu je korist: postaje jasno da dug zastoj nije apstraktno strašilo, već redovan događaj. Cifra od 3% je varljiva: to je šansa za jedan konkretan incident. Na nivou meseca dugačka havarija će se desiti skoro sigurno. Znači, za nju je potreban unapred odobren plan: ko donosi odluku o prelasku na rezervu i ko je odgovoran za vezu sa klijentima.
Kako primeniti ove podatke u radu
Razumevanje stvarne učestalosti i trajanja kvarova prevodi upravljanje IT-om iz režima „gašenja požara“ u režim planiranja:
- Dežurstva i zapošljavanjeResursi se raspoređuju prema matematički zasnovanoj prognozi, a ne prema emocijama od poslednje havarije. Jasno je kada je potreban ojačan sastav, a kada je dovoljna osnovna podrška.
- Obrazloženje IT budžetaRezervisanje kapaciteta je skupo. Sada su u rukama cifre kojima se biznisu dokazuje potreba kupovine „gvožđa“ - ili, naprotiv, pokazuje da je rizik velikog zastoja zanemarljiv i da je besmisleno trošiti milione na rezervu.
- Upravljanje SLAPrestajete da obećavate klijentima i susednim odeljenjima nemoguću dostupnost od 99.99%, ako izveštaj pokazuje redovne višečasovne padove. Uslovi ugovora prilagođavaju se stvarnim mogućnostima sistema.