nettverk og infrastruktur

Det kan bli dyrt å være etterpåklok når datasenteret svikter

Norske eksperter gir råd etter forrige ukes Amazons S3-havari.

Nettskyen gir i seg selv ingen garanti mot nedetid. Men det er mulig å sikre seg langt bedre enn mange faktisk gjør. Illustrasjonsbildet er fra Ateas datasenter «Dora», som leverer skytjenester fra en tidligere ubåt-hangar i Trondheim.
Nettskyen gir i seg selv ingen garanti mot nedetid. Men det er mulig å sikre seg langt bedre enn mange faktisk gjør. Illustrasjonsbildet er fra Ateas datasenter «Dora», som leverer skytjenester fra en tidligere ubåt-hangar i Trondheim.

Kundene som ble rammet av problemene til Amazon S3 (Simple Storage Service) forrige uke var mange. Det var også ringvirkningene.

Verdens største lagringstjeneste er så utbredt at den blir sammenlignet med en slags ryggrad for internett. Litt vondt i ryggen får da større konsekvenser enn mange skulle tro.

Les også: Skrivefeil førte til omfattende Amazon-nedetid

Nettskyen kan raskt bli en virksomhets «single point of failure». Men det kan også bedriftens eget datarom være. Det er noe vi skal reflektere rundt i denne saken.

Store summer kan gå tapt når alt stopper opp

– IT er blitt forretningskritisk, ikke bare for kontorstøtte og den typen ting, men avgjørende for at bedrifter og organisasjoner i det hele tatt virker. Når teknologien feiler så stopper alt opp, sier Petter Merok, forretningsdirektør Cloud og Enterprise hos Microsoft Norge.

Amazon S3 er ikke alene om å rammes av nedetid. Microsoft Azure også har snublet. Sist de var nede i litt volum var for to-tre år siden, da en oppgradering gikk skeis.

Petter Merok, forretningsdirektør Cloud og Enterprise hos Microsoft Norge. Foto: Harald Brombach
Petter Merok, forretningsdirektør Cloud og Enterprise hos Microsoft Norge.

Nettskyen er et attraktivt alternativ til bedriftens eget datarom, mener Merok.

– Jeg har på nært hold opplevd frustrasjonen hos fortvilte kunder i Norge som har tapt 500.000 eller millioner av kroner fordi dataene tapt. De hadde ikke tenkt på eller tatt seg råd til backup og redundans, sier han.

Merok hevder at dette skjer langt oftere enn man skulle tro. Selv kunder med sikkerhetskopi på magnettape kan oppleve at den ikke virker, fordi de ikke har verifisert at tapen fungerer før uhellet inntreffer.

En annen analogi: – De som installerer alarm i huset er gjerne de som akkurat har hatt innbrudd. På samme måte er det vanlig å investere i katastrofegjenoppretting og bedre backupløsninger først etter at det har gått galt, sier Microsoft Norge-direktøren.

Alle egg i samme kurv

Listen over berørte nettsteder, apper, programvare og tjenester i forrige ukes Amazon-svikt er for lang til å gjengi her. Hos noen sviktet kanskje en funksjon for bildeopplasting eller –visning. Andre sluttet å virke helt. Det er ikke meldt om datatap.

Viktigheten av å ha riktig design når man setter opp skytjenestene sine er alfa omega. Menneskelige feil vil alltid skje

Felles for alle var de ble rammet av nedetiden i S3 US-EAST-1. Det er bare én av skyleverandørens mange regioner spredt over hele verden.

Hadde de berørte tatt forholdsregler kunne de ha unngått nedetid, slik Amazon.com - altså IT-gigantens egen nettvarehandel gjorde. De ble aldri berørt.

Det er fordi applikasjonene og systemene er laget for feiltoleranse og redundanse. Enkelt forklart sørger de for å spre risiko ved å være tilgjengelig i flere regioner og datasentre. Hvis ett anlegg svikter kan et annet overta.

– Viktigheten av å ha riktig design når man setter opp skytjenestene sine er alfa omega. Menneskelige feil vil alltid skje. Derfor må man sette opp tjenestene sine for å håndtere feil hvis de oppstår, sier Truls Vaagan i Evry.

Han er direktør for forretningsområdet Cloud Services.

Evry satser som kjent også sterkt på nettsky som leveransemodell. I norsk og nordisk målestokk er de en gigant med rundt 9.000 ansatte og flere datasentre. Går alt sammen ned for telling vil hele samfunnet merke det, ikke minst banksektoren.

Evry hevder at ytterst få eller nærmest ingen av kundene deres har plassert alle egg i én kurv. En nøyaktig statistikk foreligger ikke, men langt de fleste skal altså ha sikret seg med i hvert fall speiling til en såkalt disaster recovery-site.

Digiplex' datasenter på Fet. Illustrasjonsfoto. Foto: Espen Zachariassen
Digiplex' datasenter på Fet. Illustrasjonsfoto.

Lot seg overraske

Evrys direktør Cloud Services peker på at det er vel så interessant med de som ikke ble rammet av denne episoden, selv om de var kunder av Amazon S3.

Han vedgår at han ble overrasket over det store antallet som ble direkte berørt av nedetiden til Amazon S3.

– Ja, jeg ble overrasket. Samtidig ble veldig mange kunder ikke berørt, men de kunne ha blitt det. De hadde et oppsett som var mer robust og som tok høyde for feil, mener Vaagan.

Evry holder seg med flere geografisk atskilte datasenter. Ikke bare det nye anlegget eid av Digiplex på Fet i Akershus, men også backup-anlegg på Gjøvik eller i Stockholm. Evry har også sitt eldre datasenter på Skøyen i drift, selv om det etter hvert skal fases vekk.

– Det er mulig å sette opp redundante løsninger både inne i et datasenter, eller å koble på et andre eller tredje alternativ. Eller mot andre skyleverandører, sier Vaagan.

Risiko vs. kostnad

Det er fullt mulig å investere i dyrere løsninger. Ekstra beskyttelse og dermed større vern mot nedetid. Tjenesteleveranser enten det er SaaS, IaaS eller PaaS kan speiles over flere geografiske lokasjoner, datasentre, regioner eller soner.

– Det er alltid en vurdering av risiko målt opp mot kostnad. Ser man på høyrisikotjenester med høye kostnader hvis de går ned, bør man legge inn ekstra på design for å sikre bedre tilgjengelighet.

Andre tjenester er det kanskje ikke så farlig at blir påvirket en liten stund, og da trenger man ikke gjøre det samme. – Det er en kost-nytte avveining, sier Vaagan.

Hvor komplisert det er å speile en løsning over flere skydatasentre kan fort være et spørsmål om hvordan selve applikasjonen er laget, mener skyarkitekt Marius Sandbu i Evry.

– Det handler mye om tjenesten og applikasjonen din kommuniserer mot flere regioner samtidig eller om du har data som speiles på tvers. Skalerbarhet spiller også inn for eksempelvis en webtjeneste som skal kommunisere mot lagring eller en database. Det er flere elementer som spiller inn. For noen vil det være en større jobb enn andre, sier Sandbu.

Plan og strategi

– I hvilken grad blir kundens håndtering av IT-systemet mer komplisert som følge av speiling til flere ulike datasentre?

– Det kommer an på hva slags arkitektur som ligger til grunn. Moderne arkitektur slik som mikrotjenester er bedre egnet, men hvis du har en mer monolittisk arkitektur er det vanskeligere, sier konserndirektør i Evry cloud services, Tuomo Louhivuori.

Det viktigste når en virksomhet velger å flytte systemene sine ut i en nettsky er likevel å først ha en plan og strategi på plass.

– Det dreier seg ikke om å flytte løsninger slik de har vært («as is»), men å gjøre løsningene klare for skyen, å cloudifisere dem. Du får ikke nødvendigvis en bedre driftssikkerhet uten å gjøre de nødvendige tilpasningene, sier kommunikasjonsdirektør Geir Remman.

Sammenfattet mener han at det er en enorm oppside ved nettsky hvis det er gjort på riktig måte. – Men det må gjøres med fornuft og målsetting, som han sier.

Speiling på mange nivåer

Skyleverandørene tibyr en lang rekke ulike alternativer deriblant for økt tilgjengelig. Microsofts norske cloud-direktør peker på tre overordnede nivåer.

– Det er en masse smartness bygget inn i de ulike skyløsningene. Selv den minste virtuelle maskin eller lagringsløsning er speilet tre separate steder, riktignok i samme datasenter men i ulike vedlikeholdsklynger. Får du feil på en disk, VM-node eller et helt rack, så finnes det alltid to andre kopier som er i synk.

Neste nivå er for kunder som ønsker geo-replikering, det vil si redundans med speiling over to eller flere fysiske adskilte datasentraler.

– Da sier du at disse dataene eller infrastrukturen er litt mer verdifullt for meg og det er viktig å sikre ekstra. Da opprettes automatisk tre kopier til, men på et datasenter som er minst 40 mil unna. Hvis datasenteret i Irland brenner opp har du likevel alt sammen kjørende i for eksempel Nederland eller Storbritannia.

For kunder med ekstra behov finnes det et tredje alternativ. Hvis all infrastrukturen de tilbyr i Europa skulle svikte, så kan tjenestene leveres andre verdensdeler, for eksempel Japan og USA.

– Failover er enkelt å sette opp

Ifølge Petter Merok koster det ikke veldig mye mer å gå et hakk opp på nevnte nivåstige.

– Det er ikke veldig mye mer. For å si det på en annen måte. Det eneste alternativet du har hvis du ikke vil forholde deg til skyen er nesten full pris. Da må du bygge et helt likt datasenter et annet sted og ha failover mellom de. Det blir en dobbelt så stor investering, han.

Microsoft-direktøren peker også på muligheten for å synkronisere fra lokalt installerte datasystemer hos en virksomhet, og ut mot deres Azure-tjeneste, eller til andre steder.

– Det er en latterlig enkel jobb å få satt på failover og datarecovery. Legg på den tjenesten, få speiling av noen data opp i Azure og en beskrivelse av hvordan datasenteret skal se ut, og vips har du en fysisk speiling som kan ta over, hvis du skulle være så uheldig at noe skjer med ditt eget. Jeg har sett de tåredryppende konsekvensene for de som ikke har gjort dette.

Oppetid kan bli sovepute

I tilfellet med Amazon S3 sist ble svært mange kunder og brukere rammet, selv om feilen var isolert til én av leverandørens mange ulike regioner.

Hva kan årsakene til at kunder legger «alle eggene sine i en kurv» være. Kan det være et kostnadsspørsmål eller manglende bevissthet?

– Det er helt sikkert det siste. Jeg tror i mindre grad det første (kostnadene), mener Merok.

Han er overbevist om at nettskyen gir høyere oppetid enn lokale datarom. Merok sier han ikke tror noe på den IT-sjefen som hevder å ha null nedetid i sitt datasenter.

En årsak til at så mange ble rammet forrige uke kan, ifølge Merok, være at kundene ikke vet nok om muligheter i skyen.

Eller at SLA-avtalene med høye oppetidsgarantier fører til at kunder tenker at «det bare virker» og at tanken om at de må gjøre noe ekstra for å unngå driftsavbrudd dermed blir fjernere.

– De velger heller å bruke mer tid på å lage mer funksjonalitet og bygge nye løsninger enn på å sikre de som de allerede har, tror han.

Også for små bedrifter

– Hvor vanlig er det at norske Azure-kunder har site-redundanse?

– Da vil jeg kommer med en appell. Det er ikke alle, sier Petter Merok og humrer godt.

Han snakket nylig med en av selskapets egne arkitekter om dette.

– Vi rådgir alle våre kunder om å tenke og lage arkitektur med tanke på sikkerhet og oppetid, men dessverre er det ikke alle som tar seg tid eller velger å prioritere det. Det kan være at de tenker det er stabilt og godt nok uten. Det kan også være at du lager en løsning som ender opp med å bli viktigere enn du først forestilte deg, og så har du ikke tatt konsekvensen av det, sier Microsoft-direktøren.

Det kan være ulike grunner til hvorfor en kunde velger bort redundans. Merok er opptatt av å fortelle er at finnes mange mekanismer som kan hjelpe, og enkelte som kan sikre deg slik at løsningen ikke går ned.

– Og det koster litt mer?

– Ja, men det er en slikk og ingenting mot hva som var eneste mulighet før eller mot kostnaden av nedetid. Nå er sikre løsninger for kontinuerlig drift et reelt tilbud også for små bedrifter. En rørleggerbedrift med 10 mann er ikke mindre avhengig av IT-systemene sine enn en bedrift på 200 ansatte i dag, mener han.

– Blir det ikke mer komplisert å forvalte løsningene, hvis de er spredt over flere ulike datasentre eller regioner?

– Det finnes gode overvåkningsverktøy som Operations Management Suite. Det håndterer ikke bare alt du har on-premise eller i vår sky, men også alt hos Google, Amazon eller IBMs BlueMix. Du kan styre alt sammen fra et oversiktsbilde. Verktøyet har også prediktiv analyse og kunstig intelligens som kan si «her har du konfigurert litt feil» med forslag til løsninger basert på vår globale erfaring. Det gir økt sikkerhet og mye høyere oppetid. Det er også whitepapers for alle typer situasjoner for å gjøre det riktig.

– I hvilken grad ble du overrasket over at så vidt mange ble rammet av forrige ukes nedetid hos Amazon S3?

– Jeg er ikke så overrasket. Det er to hovedfaktorer som er gjeldende. Det er at løsningene stort sett er oppe, samt at utviklere ikke har utnyttet egenskapene i plattformen til å sikre bedre oppetid. De har tenkt tradisjonelt og ikke fullt utnyttet mulighetene i plattformen eller kanskje tenkt nok på implikasjonene ved nedetid. Men ingen datasenter har 100 prosent oppetidsgaranti. Derfor må du planlegge for hva som skjer ved en nedetid. Dersom risiko ganget med konsekvens er høy bør du designe litt annerledes. Løsningene finnes men de er i mange tilfeller ikke tatt i bruk, sier Petter Merok.

Powered by Labrador CMS