content delivery network
Derfor ble så mange nettsteder slått ut på tirsdag
Mange har satset mye på ett kort.
Midt på dagen i går opplevde millioner internettbrukere at en voldsom mengde med nettsteder, hvorav mange er relativt store, enten ble helt utilgjengelige eller manglet mye innhold.
Som Digi.no skrev i går, skyldes problemene en feil som hadde oppstått hos Fastly. Selskapet kom med den første statusmeldingen om problemene klokken 10.58 i går. Klokken 11.36 hadde selskapet fått rettet feilen, og klokken 13.41 ble det meldt om at alle tjenester var blitt gjenopprettet.
Utløst av uoppdaget programvarefeil
Noe senere opplyste Fastly i et blogginnlegg at svikten skyldtes en uoppdaget feil i programvare som ble rullet ut 12. mai. Feilen var av en slik type at den bare utløses ved visse kundekonfigurasjoner og spesifikke omstendigheter. Nettopp dette skjedde i går, da en kunde tok i bruk en slik konfigurasjon. Det førte til at 85 prosent av nettverket til Fastly returnerte feil.
Problemene ble løst ved å identifisere og trolig endre eller fjerne denne kundekonfigurasjonen. Bare minutter senere skal tjenestene ha begynt å virke igjen. Sent i går ettermiddag ble det installert en feilfiks som skal hindre at dette problemet oppstår igjen.
Databehandling på kanten
Hvordan kan en feil hos én leverandør – et selskap de fleste trolig knapt har hørt om – føre til så store konsekvenser?
Det første man kan gjøre, er å ta en titt på kundelisten til Fastly. Den preges av nettstedaktører som har mye trafikk fra brukere over hele verden.
Fastly tilbyr en form for «edge computing», databehandling på kanten, noe som innebærer at kundene kan bruke Fastlys geografisk distribuerte infrastruktur til å utføre databehandling nærmere det stedet brukerne befinner seg.
Selv om alle de store nettskyleverandørene har datasentre i mange land, går edge-tankegangen mye lenger. Allerede kan det være snakk om å sette ut egne servere i alle større byer, og etter hvert som 5G modnes, kan det være aktuelt å ha servere i tilknytning til den enkelte basestasjon.
Helt der er ikke Fastly ennå, men blant noen av feilmeldingene som undertegnede observerte i går, ble navn som dette oppgitt: cache-osl6526-OSL
Navnet antyder at det dreier seg om en server lokalisert i eller nær Oslo. I andre deler av verden var det navnet på andre lokale servere som ble oppgitt, slik som dette:
Mellomlagring av innhold
En svært viktig del av tjenestene som Fastly tilbyr, kalles for Content Delivery Network (CDN), og det var dette som var berørt av problemene i går.
I praksis er dette proxyservere som fungerer som en slags mellomlager eller buffer for populært innholdet på nettet. Dette gjør at når du for eksempel skal laste ned en mye brukt programvare eller se en populær video eller en mye lest nyhetsartikkel i nettleseren eller i en mobilapp, så hentes i utgangspunktet ikke dette innholdet direkte fra en sentral server et sted i utlandet, men fra en slik CDN-server som befinner seg mye nærmere. Vel å merke dersom innholdsleverandøren benytter slike tjenester.
Noe av hensikten med dette er å kunne levere innholdet på en raskere og mer pålitelig måte enn om dataene må sendes over mye lengre strekninger, for eksempel helt fra USA. I stedet befinner kanskje CDN-serveren seg i datasenteret til internettleverandøren din.
I mange tilfeller vil det likevel være nødvendig å hente innholdet fra opprinnelseskilden, fordi det ennå ikke har blitt mellomlagret i CDN-serveren. Dette skal også ha skjedd med mye innhold etter at feilen ble rettet i går.
– Resultatet av monokultur
Problemet som feilen i går avslørte, er at mange legger alle eggene i samme kurv.
– Driftsstansen var resultatet av monokultur, sier Roland Dobbins, en ingeniør hos sikkerhetsselskapet Netscout, til Wired.
Han mener at alle virksomheter med betydelig tilstedeværelse på internett bør benytte flere CDN-leverandører for å unngå nettopp slike situasjoner som den så mange opplevde i går. CDN-markedet domineres av tre leverandører, Akamai og Cloudflare, i tillegg til Fastly.
Like etter at hendelsen oppstod i går, var det flere som mistenkte at problemene lå hos Amazon Web Services, for Amazons nettbutikk var berørt av problemene. Men ifølge Wired var nettbutikken helt tilgjengelig igjen etter rundt 20 minutter. I løpet av denne tiden skal selskapet ha greid å omdirigere all trafikk til andre CDN-leverandører.
Det norske bidraget
I tvitringen som er gjengitt over, ser man en litt spesiell feilmelding («Guru Mediation»). Dette skal være Fastlys variant av feilmeldingen «Guru Meditation» fra den norskutviklede programvaren Varnish, som Fastly benytter på serverne. Det hele er for øvrig inspirert av feilmeldingene til gode, gamle Amiga.
Digi.no kjenner ikke til om programvarefeilen som ble rettet, befant seg i Varnish-programvaren eller i annen programvare som Fastly benytter.