Rangiranje vrsta kvarova: šta najviše kvari kvalitet rada infrastrukture
Dežurnoj smeni glavni izvor problema je ono što se najčešće kvari: oprema, komunikacioni kanali. Ali ako u dnevniku ne gledate broj slučajeva, nego izgubljene sate, slika je drugačija. To su dva različita rangiranja, i skoro u svim kompanijama gde smo ih računali, ona se ne poklapaju. Ono što najviše kvari rad infrastrukture retko je prvo po broju događaja.
Ispod je dvanaest izvora kvarova po opadajućem uticaju. Prvo - po kojim znacima se uopšte mogu porediti tako različite stvari kao otkaz napajanja i neispunjeno uputstvo. Zatim samo rangiranje u tabeli i na čemu se zasniva: naše iskustvo u eksploataciji, provereno otvorenim istraživanjima kvarova. Dalje detaljnije o redovima koji daju najviše zastoja. Na kraju - kako napraviti takvo rangiranje iz sopstvenih podataka, a ne po „proseku za celu branšu“.
1. Po kojim znacima porediti kvarove
Za pojedinačni incident ITIL ima opšteprihvaćen par znakova: uticaj (koliko korisnika i usluga je pogođeno) i hitnost (koliko brzo treba vratiti rad). Iz njih nastaje prioritet: koji kvar rešavati prvi. Da bi se uporedile cele vrste kvarova za godinu, to nije dovoljno. Koristimo četiri pitanja. To nije standard industrije, nego praktična šema sastavljena od opšteprihvaćenih pokazatelja.
- Koliko sati zastoja se skupilo. Učestalost pomnožena prosečnim trajanjem. Glavno pitanje: pokazuje kuda zaista odlaze sati. Često se ispostavi da retka vrsta kvara oduzima više vremena od svakodnevne sitnice.
- Koliko široko pogađa. Razmera uticaja: koliko usluga i korisnika pogađa jedan otkaz. U praksi SRE (pouzdanost servisa, Google-ov pristup) to se zove „radijus pogotka“ (blast radius). Otkaz jednog servera i gašenje cele lokacije mogu trajati isto, a koštati neuporedivo.
- Da li se može sprečiti sopstvenim snagama. Sopstvene izmene su potpuno u vašim rukama. Dobavljač - delimično i samo kroz ugovor. Vreme i gradilište iza ograde - nikako.
- Ko popravlja. Ako uslugu vraća provajder, vaše umeće skoro ne utiče na trajanje. Utiču dve stvari: koliko brzo ste shvatili da je uzrok kod njega i šta piše u ugovoru. U ITIL-u je to oblast upravljanja dobavljačima i sporazuma o nivou usluge.
Korisno je i peto pitanje: da li se moglo videti unapred. Disk koji se mesec dana punio logovima je rupa u nadzoru: moglo se znati. Kabl koji je presekao bager - ne. Prvo se leči monitoringom, drugo samo rezervom.
2. Rangiranje: dvanaest izvora
Redosled je za tipičnu kompaniju: nekoliko desetina sistema, sopstvena ili iznajmljena lokacija, deo usluga kod spoljnih dobavljača. Učestalost i udeo izgubljenog vremena dati su rečima, a ne procentima: tačni udeli su u svakoj kompaniji drugačiji, a ubacivati tuđe brojke je upravo greška od koje ovaj tekst upozorava.
| Br. | Izvor kvara | Učestalost | Udeo izgubljenog vremena | Ko vraća rad |
|---|---|---|---|---|
| 1 | Greške u procedurama i organizaciji eksploatacijeuputstvo nije ispunjeno, ne postoji ili je pogrešno; dugo se tražilo ko je odgovoran | visoko | visoko | U potpunosti vi |
| 2 | Sopstvene izmene i ažuriranjanova izdanja, ponovno podešavanje, selidbe sistema | visoko | visoko | U potpunosti vi |
| 3 | Planirani radovi i održavanjeprozori održavanja, prebacivanja, preventiva | srednje | visoko | U potpunosti vi |
| 4 | Spoljni dobavljačikomunikacioni kanali, oblak, iznajmljena lokacija, platni i mejl gejtveji | srednje | visoko | Dobavljač; od vas - brzo primetiti i javiti se |
| 5 | Nedostatak kapaciteta i preopterećenjevrhovi potražnje, izveštajni periodi, pozadinski zadaci | srednje | srednje | U potpunosti vi |
| 6 | Greške u programimacurenje memorije, rast logova, zaglavljene sesije | srednje | srednje | Vi i proizvođač programa |
| 7 | Napajanje i hlađenjepriključak zgrade, izvori neprekidnog napajanja, klimatizacija | nisko | visoko kada se desi | Vi ili vlasnik lokacije |
| 8 | Ručne izmene mimo procesa izmena„brzo popravio i zaboravio“, podešavanja odstupaju od standarda | srednje | srednje | U potpunosti vi |
| 9 | Isteklosertifikati, licence, lozinke servisnih naloga, domeni | nisko | srednje | U potpunosti vi |
| 10 | Opremadiskovi, napajanja, ploče, optika | srednje | nisko | Vi i dobavljač rezervnih delova |
| 11 | Bezbednosni incidentinapadi, ransomware, krađa pristupa | nisko | izuzetno visoko kada se desi | Vi, služba bezbednosti, ponekad spoljni stručnjaci |
| 12 | Spoljna sredinavreme, gradilište, prekid kabla, kvar kod suseda | nisko | nisko | Niko od vas |
Dve napomene. Prvo: redovi 11 i 12 su na dnu po uobičajenom doprinosu izgubljenom vremenu, a ne po opasnosti. Ako se rangira po najgorem scenariju, bezbednost i napajanje penju se u prvu trojku. To je drugo rangiranje i drugi zadatak - plan oporavka posle katastrofe. Drugo: red 1 nije baš vrsta kvara. On deluje na sve ostale redove: od njega zavisi koliko traje bilo koji kvar. Zato je prvi.
Na čemu se zasniva redosled. Google u knjizi o pouzdanosti servisa (Site Reliability Engineering) piše da je oko 70% kvarova izazvano izmenama u sistemu koji radi - to su redovi 2, 3 i 8. Uptime Institute (izveštaj o kvarovima za 2025. godinu): skoro 40% organizacija je za tri godine imalo veliki kvar zbog greške osoblja, i u 85% takvih slučajeva uputstvo nije ispunjeno ili je bilo pogrešno - red 1. Isti izvor: oko dve trećine javno poznatih kvarova došlo je od spoljnih dobavljača - oblaka, veza, iznajmljenih lokacija - red 4. I tamo: među teškim kvarovima samih data centara prvi uzrok je napajanje. To nije u suprotnosti sa redom 7: napajanje otkazuje retko, ali gasi sve odjednom.
3. Zašto je organizacija važnija od tehnike
Zastoj svakog kvara sastoji se od četiri dela. Otkrivanje: koliko je kvar trajao neprimećen. Reakcija: koliko se tražilo ko će popravljati i kada je počeo. Dijagnostika: koliko se tražio uzrok. Oporavak: koliko se popravljalo. U SRE i DevOps za to postoje opšteprihvaćeni pokazatelji - prosečno vreme otkrivanja (MTTD) i prosečno vreme oporavka (MTTR). Tehnika utiče samo na poslednji deo. Prva tri su monitoring, dežurstvo, način predaje kvara pravom stručnjaku i baza poznatih grešaka, to jest organizacija.
Situacija: u dve kompanije otkazuje isti čvor iste opreme. U prvoj zastoj traje 20 minuta: upozorenje je stiglo odmah, dežurni je našao opis u bazi poznatih grešaka i primenio zaobilazno rešenje po uputstvu. U drugoj - 4 sata: za kvar su saznali od korisnika, dežurni je sat i po tražio ko je odgovoran za sistem, a potrebni inženjer je bio na odmoru i njegov telefon je znao samo šef. Zaključak: ista tehnika, razlika 12 puta - sve je organizacija.
Drugi i treći red - sopstvene izmene i planirani radovi - visoko su iz drugog razloga. To su potpuno upravljivi izvori: vi sami odlučujete šta menjate, kada i sa kojim planom vraćanja. Zato se ulaganje ovde najbrže isplati: ne trebaju ni nabavke ni pregovori sa dobavljačima. Za merenje rezultata DevOps koristi udeo neuspešnih izmena: koliko izmena od sto je dovelo do kvara ili vraćanja.
4. Planirani radovi: najpotcenjeniji izvor
Planirani radovi skoro uvek ispadaju iz statistike iz formalnog razloga: ne beleže se kao incidenti. Nema ih u dnevniku kvarova, dogovoreni prozor se obično oduzima iz izveštaja o dostupnosti, na analizama se o njemu ne govori. A za klijenta nema razlike: usluga nije bila dostupna. Razlika postoji samo u internom izveštavanju.
Tri načina na koja planirani radovi stvaraju zastoj
- Prozor se nije zatvorio na vreme. Radovi su se otegli, vraćanje nije pripremljeno, i usluga se vratila ne posle dva sata, nego posle šest. Formalno - „planirani radovi“, u suštini - kvar koji niko ne smatra kvarom.
- Posledica se pokazala kasnije. Radovi su prošli uspešno, a posle dva dana se ispostavilo da je prestalo rezervno kopiranje ili je otpao drugi kanal. Vezu sa radovima niko nije utvrdio, i kvar je ušao u statistiku kao samostalan.
- Kratki prozori se sabiraju. Svako održavanje je kratko i dogovoreno, ali ih je mnogo, i za godinu se skupe sati uporedivi sa kvarovima. Taj zbir niko ne računa, jer se svaki prozor gleda posebno.
Ovo se ne leči odustajanjem od radova: odloženo održavanje samo stvara otkaze. Leči se sa četiri pravila, a ispunjenje svakog se može proveriti.
- Računati planirane prozore u ukupnom bilansu nedostupnosti. Kao poseban red, ali u istom izveštaju. Inače niko neće videti prozore koji su se skupili.
- Proveriti rezervu pre početka radova, a ne tokom njih. Klasičan kvar: radovi na glavnom čvoru dok je rezervni već neispravan, a niko to nije znao.
- Unapred zapisati kada se vraća. U ITIL-u je to plan vraćanja. Ne „ako nešto krene po zlu“, nego „ako usluga do 04:00 nije podignuta - vraćamo sve kako je bilo“. Odluka doneta noću na licu mesta skoro uvek zvuči kao „probajmo još malo“.
- Držati period pojačane pažnje posle radova. Dan-dva svaki kvar se podrazumevano smatra povezanim sa radovima dok se ne dokaže suprotno. U ITIL-u slična praksa se zove rana podrška posle izmene. Samo tako se hvataju posledice koje se pokažu kasnije.
5. Spoljni dobavljači: tuđe vreme oporavka
Kvarovi kod dobavljača su visoko u rangiranju ne zbog učestalosti. Radi se o četvrtom pitanju: ne popravljate vi. Znanje tima, alati i disciplina u tom trenutku skoro ne utiču na trajanje zastoja. Utiču dve stvari: koliko brzo ste shvatili da je uzrok spolja i šta piše u ugovoru.
Situacija: usluga ne radi, tim sat i po traži uzrok kod sebe, i tek onda neko proverava spoljni kanal ili stranicu stanja provajdera oblaka. Taj sat i po nije vreme dobavljača, nego vaše, potrošeno na traženje na pogrešnom mestu. Šta pomaže: provera dostupnosti usluge spolja, očima klijenta, a ne samo iznutra, i spisak spoljnih zavisnosti koji dežurni prolazi u prvim minutima.
O ugovorima vredi reći posebno: ovde mnoge kompanije imaju iluziju zaštite. Rok oporavka u sporazumu o nivou usluge nije garancija da će usluga biti podignuta u tom roku. To je uslov za nadoknadu ako ne bude: obično popust na sledeći račun. Nadoknada ne vraća klijente koji u tim satima nisu mogli da koriste vašu uslugu. Zato se od kritičnih dobavljača štiti rezervom - drugim kanalom drugog operatera, drugom lokacijom, rezervnim gejtvejem - a ugovor služi kao dodatna sigurnost.
6. Napajanje: retko, ali sve odjednom
Napajanje i hlađenje su u sredini rangiranja, i to mesto deluje čudno: intuicija ih stavlja ili više ili niže. Po doprinosu godišnjem zastoju napajanje zaostaje za izmenama i planiranim radovima: događaja je malo. Po težini jednog događaja nema mu ravnog.
Razlog je razmera uticaja. Otkaz napajanja ne gasi jedan sistem, nego celu lokaciju. Sve rezerve unutar lokacije su u tom trenutku beskorisne: rezervni server stoji u istom ormaru i napaja se sa istog priključka. Zato se zaštita ovde gradi pre svega projektom lokacije: dva nezavisna priključka, rezervni izvori, raspoređivanje sistema po različitim lokacijama i plan oporavka.
Druga osobina poznata je svima koji su to prošli: posle nestanka struje infrastruktura se ne vraća sama. Deo opreme se ne uključuje, deo se podiže pogrešnim redom, baze podataka traže proveru, aplikacije ne nalaze servise koji im trebaju. Stvarni zastoj ne zavisi od toga koliko je struje nije bilo, nego od toga koliko je uvežban redosled pokretanja. A on se skoro nikad ne proverava.
Praktično pravilo: izvore neprekidnog napajanja i generatore testirati pod opterećenjem po rasporedu, a redosled pokretanja sistema posle potpunog nestanka struje zapisati i proveravati bar jednom godišnje. Neproverena rezerva i neuvežbano pokretanje otkrivaju se u najgorem mogućem trenutku.
7. Zašto je oprema na dnu liste
Ovo je najspornija stavka: protivreči i intuiciji i razgovorima u pauzi. Oprema se kvari, i to redovno. Ali otkako je rezervisanje postalo norma - diskovi u nizovima, dvostruka napajanja, serveri u klasterima, rezervni kanali - otkaz jednog dela obično ne zaustavlja uslugu. Otkaz se desi, zastoja nema.
Oprema se penje u rangiranju u tri slučaja, i svaki zapravo pripada redu 1 - organizaciji eksploatacije.
- Rezerva nije radila. Drugo napajanje je otkazalo pre pola godine, upozorenje o tome je postojalo, ali niko po njemu nije postupio. Prvi otkaz postao je poslednji.
- Nema rezervnih delova. Neispravan čvor nedelju dana čeka deo. To nije otkaz opreme, nego nedostatak zalihe i ugovora o podršci.
- Oprema je odslužila svoj vek. Proizvođač je više ne podržava, otkazi su sve češći, zamena se odlaže, a svaki kvar se analizira kao slučajan. To je odložena odluka, a ne neizbežnost.
Odatle opšti princip za celo rangiranje: što je red niže, to se češće njegov stvarni doprinos objašnjava redom 1. Tehnika retko otkaže sama po sebi - otkaže tamo gde ju je organizacija ostavila bez rezerve.
8. Kako napraviti sopstveno rangiranje
Naš redosled je smernica, a ne vaš rezultat. Za kompaniju sa jednom lokacijom i starom opremom on je jedan. Za kompaniju koja u potpunosti živi u oblaku - drugi: tamo se dobavljači penju na prvo mesto, a napajanje nestaje sa liste. Sopstveno rangiranje se pravi iz dnevnika incidenata za godinu.
- Uzeti dnevnik za celu godinu. Ne za kvartal: na kratkom periodu sezonski vrhovi i retki teški kvarovi kvare sliku.
- Svakom kvaru dodeliti jedan izvor sa liste. Jedan, čak i ako je uzroka bilo više: onaj bez kog kvara ne bi bilo. Sporni slučajevi - u posebnu grupu. Ako je velika, to je već nalaz: uzroci se loše beleže.
- Sabrati trajanje, a ne broj. I kao poseban red dodati planirane prozore, inače prozori koji su se skupili, iz odeljka 4, ostaju nevidljivi.
- Proceniti razmeru uticaja. Koliko usluga ili korisnika u proseku pogađa jedan kvar svakog izvora. Ova kolona često menja mesta gornjim redovima.
- Odvojiti ono na šta utičete od ostalog, i pogledati vrh prvog dela. To je plan rada za sledeći kvartal: u njemu je samo ono što možete da promenite.
Najčešća greška je na drugom koraku: beleženje simptoma umesto izvora. „Nedostupnost servisa“ nije izvor, to je ono što je korisnik video. Izvor je ono bez čega kvara ne bi bilo: izmena podešavanja, pun disk, radovi izvođača na susednom priključku. Rangiranje po simptomima svodi se na par redova i iz njega ne slede odluke.
Kratak zaključak. Kvalitet rada infrastrukture pre svega ne određuje ono što imate instalirano, nego ono što se dešava oko otkaza: koliko brzo se vide, ko ih i po kom pravilu preuzima, da li se uzroci uklanjaju i kako se izvode sopstveni radovi. Gornja četiri reda rangiranja - organizacija, izmene, planirani radovi, dobavljači - upravljaju se disciplinom i dogovorima, a ne budžetom. Upravo tu je glavni deo zastoja koji se može smanjiti bez ikakve kupovine.
Takvo rangiranje iz vaših podataka možete napraviti sami, po metodu iz odeljka 8, ili uz našu pomoć: pošaljite izvoz incidenata za pola godine ili godinu - vratićemo analizu: gde se koncentriše zastoj, da li otkazi imaju raspored i koji kvarovi povlače druge. Šta raditi sa svakim nalazom - u „Šta dalje“.
Razgovarajte o rezultatu sa inženjerom eksploatacije - .