Ciljno stanje · Svakodnevica

Kako izgleda idealna eksploatacija obične kompanije: predvidljivost umesto podviga

Kada se kaže „eksploatacija svetskog nivoa“, obično se pokazuje sala sa video zidom, smena 24/7 i tim inženjera pouzdanosti. To nema veze sa običnom kompanijom. Obična kompanija je nekoliko desetina sistema, od tri do petnaest ljudi u eksploataciji, bez posebnog tima za procese, budžet koji treba braniti i rukovodilac kome je eksploatacija jedna od pet briga. Za nju ima smisla drugo pitanje: kako ovde izgleda dobro.

Naš odgovor mnoge iznenadi: idealna služba eksploatacije izgleda dosadno. U njoj nema podviga, niko noću ne spasava situaciju, i na konferenciji nema mnogo šta da se ispriča. Kvari se koliko i kod suseda - razlika je u tome šta se dešava posle. Ispod je to stanje deo po deo: običan dan, znaci zrele službe, čega u njoj nema, na čemu stoji i koliko vremena tima odlazi na to. Gde se oslanjamo na opšteprihvaćene prakse (ITIL, Google SRE), to je rečeno; ostalo je naše iskustvo.

  1. Šta znači „idealna“ i šta ona nije
  2. Jedan običan utorak
  3. Osam znakova zrele službe
  4. Čega u njoj nema
  5. Četiri oslonca
  6. Haos, norma, ideal
  7. Koliko to košta u ljudima i vremenu
  8. Deset pitanja za samoproveru

1. Šta znači „idealna“ i šta ona nije

Počnimo od onoga što idealna eksploatacija nije: upravo tu se najčešće postavlja nedostižan cilj, a zatim se rad na njemu napušta. To nije odsustvo otkaza. Otkaza će biti: oprema stari, dobavljači padaju, ljudi greše, a biznisu trebaju izmene brže nego što se mogu bezbedno uneti. Služba koja je postavila cilj „da se ništa ne kvari“ uvek će sebe smatrati neuspešnom.

To nije dostupnost po svaku cenu. Svaka sledeća „devetka“ u procentu dostupnosti košta sve više: prema Google SRE, sledeće povećanje pouzdanosti može koštati sto puta više od prethodnog. A korisnik čiji sopstveni pametni telefon radi pouzdano 99% vremena neće primetiti razliku između 99,99% i 99,999%. Zrela služba zna koja dostupnost treba svakoj usluzi i ne podiže sve na nivo najkritičnije.

To nije debela fascikla procedura. Dokument napisan jednom koji ne menja ponašanje u tri ujutru je trošak, a ne imovina. Zrela služba se prepoznaje po ponašanju, a ne po papirima: napisanog u njoj često ima manje nego što se očekuje.

Radna definicija koju koristimo: eksploatacija je idealna kada rezultat ne zavisi od toga ko je danas u smeni, a svaki otkaz se završava u predvidljivom roku i ostavlja za sobom zapis iz kog se može učiti. Sve ostalo su posledice.

2. Jedan običan utorak

Opisi zrelosti se teško pamte, zato je lakše pokazati dan. Srednja kompanija, nekoliko desetina sistema, u eksploataciji šest ljudi. Smene 24/7 nema - postoji dežurstvo po rasporedu sa telefonom.

08:40

Dežurni otvara noćni pregled. U njemu su tri reda, a ne trista: događaji po kojima nije trebalo postupiti otišli su u dnevnik i nisu stigli u traku. Jedan red od tri završio se incidentom - restartom servisa po uputstvu, za jedanaest minuta, bez poziva.

Niko se noću nije budio. Ne zato što je noć bila mirna, nego zato što su pravila buđenja zapisana i nijedno nije okinulo.

09:15

Petnaest minuta jutarnjeg sastanka. Razgovara se o tri stvari: jučerašnji incidenti sa prioritetom višim od srednjeg, izmene za danas i jedna otvorena kartica problema. Problem ima vlasnika i rok, i danas po njemu ima pomaka.

11:00

Stiže upozorenje: prostor na fajl skladištu će se potrošiti za otprilike dve nedelje. To nije kvar, i niko se ne budi - to je zadatak u redu za nedelju dana. Rast se video unapred, jer se resursi prate po trendu, a ne čeka se da udare u prag.

14:30

Planirano ažuriranje jednog od sistema. Prozor je dogovoren pre nedelju dana, korisnici su upozoreni, upozorenja za sistem su isključena za vreme radova, plan vraćanja je zapisan zajedno sa vremenom odluke: ako do 15:30 ne proradi - vraćanje.

Proradilo je u 15:05. Sledeća 24 sata sistem se pažljivo prati: svaki kvar na njemu do sutra podrazumevano se smatra povezanim sa ažuriranjem.

16:20

Klijent javlja da spoljna usluga radi sporo. Dežurni vidi: upozorenje je stiglo pre osam minuta, incident je već otvoren. Klijentu odgovaraju da je problem poznat, uzrok je kod provajdera, zahtev prema njemu je otvoren, sledeće ažuriranje - za pola sata.

To je ključni trenutak dana. Kvar postoji, i nije njihov, ali klijent dobija status, a ne tišinu, i ne saznaje vest prvi.

17:40

Inženjer dopisuje u bazu poznatih grešaka pasus o jučerašnjem nestandardnom slučaju: znaci, zaobilazno rešenje, status trajnog. Pet minuta rada koji će sledeći put uštedeti sat i po - i to najverovatnije ne njemu.

Primetite šta u tom danu nije bilo. Niko nije tražio ko je odgovoran za sistem. Niko nije zvao jedinu osobu „koja zna kako se to popravlja“. Niko nije saznao za kvar od klijenta. Niko nije u panici odlučivao o vraćanju: odluka je doneta unapred i mirno. A dan je potpuno običan: dva incidenta, jedna izmena, jedan spoljni kvar.

3. Osam znakova zrele službe

Ovi znaci se vide spolja i proveravaju se pitanjima, a ne revizijom. Ne trebaju im ni određen sistem monitoringa ni određena metodologija: viđali smo ih i u kompanijama koje za ITIL nikad nisu čule.

  • Dnevnik incidenata: svaki incident ima vlasnika i zapis koji se nađe za minut. Ne „negde u prepisci“, nego na jednom mestu: vreme, objekat, ishod. Bez zapisa ne može se ni meriti ni učiti.
  • Rešenje bez stručnjaka: poznat kvar zatvara po uputstvu dežurni obične kvalifikacije. Stručnjaci se zovu za novo, a ne za tipično.
  • Noćni pozivi po pravilu: kriterijumi su zapisani, dežurni ih primenjuje za pola minuta, i za poziv po pravilu ga ne grde.
  • Red u izmenama: radovi idu u dogovorenom prozoru, svaka izmena ima plan vraćanja sa konkretnim vremenom odluke.
  • Ponavljanje je defekt, a ne loša sreća: ponovljeni kvar postaje kartica problema sa vlasnikom - tako ITIL razdvaja upravljanje incidentima i upravljanje problemima. Naše radno pravilo: treći isti kvar se ne popravlja treći put, nego se otvara problem.
  • Kompanija prva javlja o kvaru: udeo incidenata o kojima se saznalo od klijenata je poznat i opada. Verovatno najpouzdaniji spoljni znak od osam.
  • Desetak pokazatelja: ne sto i ne tri - onoliko koliko staje na jednu stranu i o čemu se razgovara pola sata jednom mesečno.
  • Izveštaj za biznis: jednom u kvartalu služba sama donosi spisak onoga što je poboljšala - u satima i procentima, sa početnim nivoom „pre“. To razlikuje partnera od izvođača.

4. Čega u njoj nema

Odsustva govore o zrelosti više od prisustava i brže se primećuju. Svako od njih je u svoje vreme izgledalo razumno - u tome je teškoća.

  • Nema heroja. Čoveka bez kog se ništa ne vraća u rad u zreloj službi nema. Heroj nije dostignuće, nego koncentrisan rizik: njegov odmor ili odlazak opasniji su od otkaza opreme.
  • Nema jutarnjih ručnih provera. Obilazak sistema „da se vidi da li je sve živo“ znači da se monitoringu ne veruje. Ili se popravlja monitoring, ili ritual ostaje zauvek.
  • Nema trake koja se gleda iz navike. Ako se tok upozorenja čita krajičkom oka, znači da se uglavnom sastoji od onoga po čemu ne treba postupati.
  • Nema privremenih rešenja starijih od kvartala. Zaobilazno rešenje postavljeno „na nedelju dana“ pre osam meseci nije rešenje, nego nevidljiv dug koji će jednog dana biti naplaćen.
  • Nema izveštaja koje niko ne čita. Redovan dokument bez primaoca i bez odluka posle njega - čist gubitak vremena. Takvi izveštaji se ukidaju, a ne poboljšavaju.
  • Nema traženja krivca na analizi incidenata. Čim analiza postane disciplinska, zapisi postaju uredni i beskorisni. U Google SRE se to zove analiza bez traženja krivca (blameless): analiziraju se događaji i pravila, a ne ljudi.

5. Četiri oslonca

Sve opisano stoji na četiri stvari. Nijedna ne zahteva velike nabavke, i potrebne su sve četiri: uklonite bilo koju - i za nekoliko meseci konstrukcija počinje da se raspada.

  • Podaci: jedan dnevnik u koji ulazi svaki incident - sa vremenom, objektom i ishodom. Ne radi izveštavanja, nego da se za pola godine pogleda unazad i vide obrasci koji se ne vide u trenutku.
  • Pravila: ko saznaje, ko postupa, za koje vreme, ko je sledeći i kada se budi rukovodilac. Kratak dokument koji se zna napamet radi bolje od detaljnog koji se otvara jednom godišnje.
  • Znanje: opisani tipični kvarovi - znaci, zaobilazno rešenje, status trajnog. To pretvara umeće jednog čoveka u osobinu cele službe.
  • Ritam: petnaest minuta ujutru, pola sata mesečno na pokazatelje, pola dana u kvartalu na analizu podataka i odluke. Bez ritma prva tri oslonca tiho zastarevaju: infrastruktura se menja, a pravila i znanje ostaju iz prethodne verzije kompanije.

Graditi ih treba jednim redom: podaci, pravila, znanje, ritam. Početi od pravila bez zapisa nema smisla - nema čime da se proveri da li se poštuju. Početi od znanja pre pravila takođe: opisana zaobilazna rešenja nema ko da primeni ako događaj ne stigne do pravog čoveka.

6. Haos, norma, ideal

Između haosa i ciljnog stanja postoji međustanje, i u njemu je većina. Ono nije loše: u njemu se može raditi godinama. Razlika se najbolje vidi na konkretnim situacijama - evo osam.

SituacijaHaosNormaIdeal
Kako se saznaje za kvar Od klijenta ili od rukovodstva Iz monitoringa, ali sa kašnjenjem i ne za sve usluge Iz monitoringa, pre klijenta; udeo slučajeva kada je klijent bio prvi je poznat i opada
Ko preuzima incident Ko je prvi video ili koga su našli Dežurni, dalje po dogovoru Dežurni po pravilu, eskalacija po tajmeru, svaka uloga ima zamenu
Noćni poziv Po osećaju dežurnog; dobija po glavi za grešku u oba smera Dogovor postoji, ali ga svako tumači na svoj način Zapisani kriterijumi; poziv po kriterijumu se ne raspravlja, loše pravilo se preispituje
Izmene Kad je zgodno; kako se vraća, odlučuje se na licu mesta Dogovaraju se, ali posle radova sistem se posebno ne prati Prozor, upozorenje korisnicima, vreme odluke o vraćanju, 24 sata posebnog praćenja posle
Ponovljeni kvar Popravlja se iznova svaki put Primećen, zaobilazno rešenje je poznato, uzrok nije uklonjen Kartica problema sa vlasnikom i rokom; zaobilazno rešenje opisano, uklanjanje uzroka u planu
Zapisi o incidentima U prepisci i u sećanju U sistemu, ali se popunjavaju kako se stigne Toliko potpuni da se statistika računa bez ručnog čišćenja
Razgovor sa biznisom Samo kada je nešto palo Izveštaj o dostupnosti koji malo ko čita Jednom u kvartalu: šta je poboljšano, u satima i procentima, sa nivoom „pre“
Odlazak ključnog inženjera Katastrofa: deo sistema postaje nejasan Bolno, oporavljaju se mesecima Primetno, ali ne kritično: znanje je opisano, uloge imaju zamenu

Tabelu je korisno proći zajedno sa timom i označiti svoju kolonu u svakom redu. Slika je skoro uvek mešovita, i to je normalno: razlika između redova preciznije od bilo koje opšte ocene pokazuje kuda da se krene.

7. Koliko to košta u ljudima i vremenu

Glavni prigovor: „nemamo ljude za to“. Prigovor je pošten, zato evo naše procene redovnog opterećenja za tim od pet do osam ljudi. To nije cena prelaska, nego cena održavanja kada je stanje već dostignuto.

  • Svakodnevno: 15 minuta jutarnjeg sastanka za ceo tim i nekoliko minuta za zapis o svakom zatvorenom incidentu.
  • Nedeljno: oko sat vremena na red problema i trendove resursa.
  • Mesečno: pola sata do sat na stranu pokazatelja i razgovor o njoj.
  • Kvartalno: pola dana na analizu podataka za kvartal, reviziju pragova i pravila upozorenja i kratak pregled za biznis.
  • Jednom godišnje: jedna vežba oporavka ključne usluge i jedna provera pokretanja sistema posle potpunog nestanka struje.

Ukupno je to nekoliko procenata radnog vremena tima. Treba ih porediti ne sa nulom, nego sa udelom vremena koji sada odlazi na havarijski i rutinski rad i na ponovno utvrđivanje već utvrđenog. Kao orijentir: Google SRE postavlja cilj da takav rad bude ispod 50% vremena inženjera. Timovi koji svoj udeo računaju prvi put obično dobiju više nego što su očekivali - i upravo ta razlika postaje glavni argument u razgovoru sa rukovodstvom.

Prelazak je posebna priča, i bolje ga je planirati ne kao projekat na godinu, nego kao niz kratkih koraka po kvartalima: jedan korak - jedan merljiv rezultat. Po našem iskustvu, inicijative u eksploataciji ne propadaju od složenosti, nego od trajanja: tim ne izdrži pola godine rada bez vidljivog efekta, i ne može se zbog toga kriviti.

8. Deset pitanja za samoproveru

Odgovarajte samo sa „da“ ili „ne“, bez „uglavnom“ i „trudimo se“. „Da“ se računa samo ako je tačno ne za jedan uzoran sistem, nego za bilo koju ključnu uslugu i u bilo kojoj smeni.

  1. Da li znate udeo incidenata o kojima ste saznali od klijenta, a ne iz monitoringa?
  2. Može li dežurni za minut da nađe ko je odgovoran za bilo koji ključni sistem i njegovu zamenu?
  3. Da li su kriterijumi po kojima se noću budi rukovodilac zapisani, i da li ih dežurni zna?
  4. Da li svaka izmena ima plan vraćanja sa određenim vremenom odluke?
  5. Da li se ponovljeni kvar pretvara u zadatak za uklanjanje uzroka, umesto da se ponovo popravlja?
  6. Da li je deset najčešćih kvarova opisano tako da ih zatvori čovek bez iskustva u tom sistemu?
  7. Da li u radu nema „privremenih“ zaobilaznih rešenja postavljenih pre više od kvartala?
  8. Možete li za deset minuta dobiti statistiku incidenata za pola godine bez ručnog čišćenja?
  9. Da li se planirani prozori računaju u ukupnom bilansu nedostupnosti?
  10. Da li je biznis u poslednjem kvartalu dobio od vas pregled poboljšanja u satima i procentima?

Kako čitati rezultat (skala je naša). Osam „da“ i više: u ciljnom ste stanju, zadatak je da ga održite. Od četiri do sedam: obična zrela kompanija, i jasno je kuda dalje: uzmite pitanja sa „ne“ redom brojeva. Manje od četiri: početi od prvog oslonca - od beleženja incidenata. Bez njega ostali koraci ne mogu se ni planirati ni proveriti.

Kratak zaključak. Idealna eksploatacija obične kompanije nije razmera ni budžet, nego predvidljivost. Kvari se koliko i kod svih. Razlika je u tome što kvar primećuje sistem, on stiže do pravog čoveka po pravilu, završava se u jasnom roku i ostavlja zapis zahvaljujući kom sledeći put sve ide brže. Nijedna od ovih osobina se ne kupuje.

Proveriti sebe možete na dva načina. Rečima - deset pitanja iznad ili test zrelosti u našem botu (7 pitanja, oko 5 minuta, na kraju nivo i saveti). Po podacima - pošaljite izvoz incidenata: vratićemo analizu: gde se koncentriše zastoj, koliko brzo se popravlja i u kojim satima se gomilaju kvarovi. Anketa pokazuje predstave tima, izvoz - njegovo ponašanje.

Povezane analize: pet stepena zrelosti eksploatacije, matrica eskalacije i šum upozorenja, šta raditi sa nalazima izveštaja. Razgovarajte o svom položaju sa inženjerom eksploatacije - .