nettverk og infrastruktur
Midt på natta begynner stormaskinene å oppføre seg rart. Det skal bli starten på et 24 timers mareritt
Fredag 6. oktober går inn som en helsvart dag i historiebøkene for Evry. Stormaskinene på Fet kollapset og flere millioner brukere –både i og utenfor Norge – ble rammet. Først etter nesten ett døgn klarte det norske selskapets IT-teknikere å løse problemene.
– Internt i Evry har denne dagen fått navnet «Black Friday», sier konserndirektør Per Hove for digitale plattformtjenester i Evry til digi.no.
Like etter midnatt 6. oktober oppdager driftsteknikere på Fet at stormaskinene begynner i bli ustabile, før de går helt ned. I løpet av natten og morgentimene etableres det full kriseberedskap hos selskapet.
I/O-kort tok kvelden
Teknikerne er relativt sikre på at det er en komponent i lagringsløsningen som har tatt kvelden. I tillegg er det oppdaget feil i mikrokode på stormaskinene. Det fører til at disksystemet går i en kontinuerlig restart.
Analyser viser så at et I/O-kort i lagringsriggen har tatt kvelden.
I stedet for en normal «failover» blir systemet utilgjengelig.
På grunn av omfanget av feilen blir IBMs eget internasjonale utviklerteam og lab med ansvar for lagring raskt koblet på. De er eksperter på selskapets milliardsatsing.
- LES OGSÅ: Evry-problemer rammet millioner av kunder. Posten, bankene og Telenor sleit i over 20 timer
IBM fraråder Evry å bytte ut I/O-kortet. De tyske og amerikanske ekspertene mener at konsekvensen med å bytte ut den sentrale komponenten med stor sannsynlighet vil føre til korrupte data på lagringsriggen.
Bank-, post- og telekunder sliter
Teknikere fra IBM og Evry går så i gang med å lage en midlertidig feilrettingsfiks som skal kunne benyttes til å stoppe den kontinuerlig bootingen av systemet.
I morgentimene har kundeproblemene for alvor begynt å vise seg. Bankkunder har mistet tilgang til bankkontoene sine, de får ikke gjennomført kjøp på nett eller tatt ut penger i minibank.
Kortkjøp går nå bare igjennom på reserveløsning i butikk.
Posten-kunder som venter på pakkene sine får ikke sporet sendingene, og det har oppstått full kollaps i både utlevering og sending av pakker.
(artikkelen fortsetter under)
Melder at feilen er rettet 12.15 fredag
Samtidig sliter Telenor med egne ordresystemer som følge av stormaskinproblemene. Dermed oppstod forsinkelser for brukere som ønsket å opprette eller avslutte sine teleabonnementer.
Også folkeregisteret opplever problemer med IT-systemene.
Klokken 12.15 melder Evry at feilen er rettet. Evrys driftstjenester er i ferd med å fungere som normalt igjen, mener teknikerne.
Ettersom systemet restartet igjen og igjen var det ikke mulig å installere mikrokoden på vanlig måte. Feilfiksen ble derfor lastet rett inn i minnet på stormaskinene.
Ville ikke flytte produksjonen
– Når vi starter opp igjen systemene, må vi sjekke at alle tjenestene fungerer. Det kommer vi til å bruke ettermiddagen og kvelden, og eventuelt helgen på å gå gjennom, forklarte kommunikasjonssjef Geir Remman i det norske milliardkonsernet til NTB.
Siden IBMs teknikere mente at det var mulig å omgå komponentfeilen ved en midlertidig fiks, ble forslaget om å flytte hele produksjonen over på reserve-stormaskinene på et annet datasenter avfeid.
Når den nye maskinkoden etterhvert kom i produksjon, går IBM og Evry i gang med å få kundene opp igjen.
Servere går nå varme
Men da skal det vise seg at problemene ikke er så løst som Evry har gitt utrykk for i offentligheten.
– Når vi igjen kjører full trykk på produksjonsserverne, etter at feilrettingen er installert ved lunchtider fredag, dukker det opp en følgefeil. Stormaskinene starter opp, går varme, og går ned igjen, sier konserndirektør Per Hove for digitale plattformertjenester i Evry til digi.no.
Nok en gang klør teknikerne seg i hodet. Hva er det som har gått galt denne gangen?
Etter en del feilsøking viser det seg at det nok en gang er feil på mikrokoden som er lastet inn. En ny fiks må derfor etableres og implementeres, deretter blir denne lastet inn og maskinene startet opp igjen.
(artikkelen fortsetter under)
Var nede i nesten 24 timer
For mange av kundene sørget kollapsen i stormaskinene for at mange av systemene deres var utilgjengelige helt til klokken 23.45 fredag kveld.
Ikke før søndag 8. oktober klokken 10.45 blir det installert en feilfiks som permanent sørget for at slike feil ikke skal oppstå igjen.
Samtidig blir I/O-kortet på lagringsriggen byttet ut og fikset.
I etterkant av hendelsen har Evry etablert et forbedringsprogram med arbeidsstrømmer som skal styrke teknologisk infrastruktur, og forbedre prosesser knyttet til krisehåndtering og samhandling med kunder.
Ville ikke flytte over produksjonen
– Dette var svært dramatisk for oss, og det er mange år siden vi har hatt avbrudd på stormaskinene våre. Dette påvirket mange kunder i både Norge og Sverige, sier Hove til digi.no.
Ifølge ham ville Evry gått over på et annet datasenter med andre stormaskiner, om de hadde visst det vi nå vet.
Å flytte hele produksjonen fra ett datasenter til et annet medfører en viss risiko, forklarer Hove til digi.no. Siden både Evry og IBM mente at de ville komme raskere tilbake i produksjon ved å utvikle en feilfiks, var det løsningen teknologigigantene til slutt falt på.
– I ettertid ser vi jo at vi ville tatt en annen beslutning, men dette er noe som treffer oss i sanntid. Da er det ikke så enkelt å forholde seg til, som når man har fått satt seg skikkelig ned og evaluert hele prosessen.
– All infrastruktur har svakheter
Selv om stormaskinene hos Evry til nå nærmest har hatt 100 prosent oppetid siden teknologien ble implementert en gang på 70-tallet, har det ikke bare vært fryd og gammen.
– All infrastruktur har svakheter. Det er vi også klar over. Fremover kommer vi til å ha en gjennomgang av hele arkitekturen. Det er naturlig etter en slik hendelse, konstaterer Hove.
Det gigantiske mageplasket gikk helt opp på styrenivå i både Evry og IBM globalt.
Nå går begge selskapene igjennom rutinene for å sørge for at noe lignende ikke skjer igjen.
Må bli bedre på kommunikasjon
Evry skal gå igjennom både hele infrastrukturen og hendelsesforløpet, og se om selskapet kan implementere forbedringstiltak.
Er det for eksempel mulig å gjøre løsningene mer robuste? spør Hove retorisk.
–For det andre skal vi gå igjennom arbeidet som ble utført av krisestaben i de timene dette påvirket oss. Kunne vi som jobbet i kriseteamet gjort noe bedre?
– For det tredje må vi bli tydeligere i vår kommunikasjon med både kunder og ansatte som sitter midt oppi dette. Der kunne vi vært både bedre og tydeligere. Spesielt da vi kommuniserte i offentligheten at problemene var løst rundt klokken tolv, oppsummerer konserndirektør Per Hove for digitale plattformertjenester i Evry til digi.no.