nettverk og infrastruktur
Det var ikke mangel på redundans som førte til DNBs nettbankproblemer
Les intervjuet med bankens IT-ledelse.
BJØRVIKA, OSLO (digi.no): DNB har hatt en rekke tilfeller av nedetid den siste måneden. Det toppet seg i forrige uke, da det på torsdag gikk omtrent 16 timer fra den omfattende feilen ble oppdaget, til at alle systemene ble friskmeldt. Deretter gikk det bare noen dager før det oppsto nye problemer. Mandag var det mange som ikke greide å logge inn. Dette varte i rundt tre timer, før problemene ble løst.
Nedetiden disse to dagene utgjør mer nedetid enn det nettbanken har hatt hele det foregående året. Da var nettbanken tilgjengelig 99,8 prosent av tiden, altså en nedetid på omtrent 17,5 timer.
Den hyppige utilgjengeligheten i det siste har igjen fått kritikken mot DNB til å blusse opp. Det er ikke så overraskende. Mange har ikke fått utført de banktjenestene, i noen tilfeller tidskritiske, som de ønsker.
Men det er også mange som lurer på hva disse hendelsene egentlig skyldes. Teoriene er mange, og blant annet IKT-Norge peker på at banken må ha reservesystemer som kan ta over når et annet system feiler.
Digi.no ba derfor om å få et møte med DNB for å få en grundig forklaring. Vi fikk møte de to som er de øverste ansvarlige for IT- og driftsvirksomheten til DNB – Liv Fiksdahl, som er konserndirektør for IT og Operations, og Arne Damvin, som er direktør for drift og ansvarlig for å koordinere alt rundt drift og det operative rundt DNBs IT-leverandører.
Mandag: DNB sliter med de tekniske løsningene for femte gang på kort tid
Ingen sammenheng
– Det er viktig å si at disse hendelsene på ingen måte henger sammen. Men vi skjønner veldig godt at det bryr ikke kundene seg om. For kundene betyr driftsavvikene bare at vi ikke er tilgjengelige. Det er vi veldig ydmyke for. Likevel er vi ekstremt opptatt av å finne rotårsaker for å kunne gjøre permanente tiltak. Det har vi veldig rigide prosedyrer for, innleder Fiksdahl.
(artikkelen fortsetter under)
DNB gikk tidlig ut og fortalte at hendelsen på torsdag i forrige uke skyldtes lagringssystemene. Damvin kommer nå med langt flere detaljer om dette.
– Når det gjelder hendelsen på torsdag, så hadde vi utfordringer med stabiliteten til noen av våre lagringssystemer. Dette er «state of the art» lagringssystemer, kjøpt av noen av verdens ledende leverandører, sier han.
Fiksdahl legger til at det nok ikke er noen hemmelighet at det er Dell/EMC som har levert lagringskabinettene.
Torsdag: DNBs nettbank og Vipps har vært utilgjengelig i mange timer
Redundanssystemet feilet
– Her har vi ikke bare to, men tre parallelle systemer, hvor to er i separate datahaller og et DR-senter (Disaster Recovery) som ligger omtrent 300 kilometer unna. De tre hallene har til sammen seks aktive nettverkslinjer inn, fra to forskjellige leverandører, forteller Damvin.
Systemene er satt til å være ekstremt redundante
– Systemene er satt til å være ekstremt redundante. Ikke bare mellom datahaller, men også internt i hver datahall er det satt opp med høy grad av redundans. Blant annet står det på SAN-et (Storage Area Network, journ. anm.) i hver av hallene hele åtte kontrollere i parallell i hvert av systemene. Likevel hadde vi en situasjon hvor det stoppet å fungere.
Selv om rotårsaksanalysen fra leverandørene ikke er ferdig ennå, mener Damvin at man har en ganske god indikasjon som skjedde.
– Det som har skjedd, er trolig at det er en feil i styresystemet til lagringsleddet, SAN-et. Denne styrer ikke bare tilgangen til lagringsenhetene, men også failover mellom systemene. Vi har investert ganske store summer i å sette opp redundant infrastruktur. Men så er det faktisk komponentene som skal sikre redundans, som har feilet denne gangen, sier han.
Frustrerende
– For oss er det litt trist å se at selv om vi har satt oss opp mer robust enn noen gang, vi kjøper det beste fra de tryggeste leverandørene, likevel kommer i situasjoner hvor det ikke er mulig å forsikre oss mot at det skal skje. Dette gjør oss litt frustrerte, forteller Fiksdahl.
Vi venter nå på en fiks
– Det jobbes enormt når vi får slike hendelser som dette. Det hadde likevel vært verre om det hadde vært dårlig prosesshåndtering og ikke-optimale oppsett. Men med det som skjedde på torsdag, er vi veldig sikre på at dette er gjort etter boka. Det bekrefter også leverandørene. Vi venter nå på en fiks.
Hun understreker at man ikke kan være hundre prosent sikre før rotårsaksanalysen er klar, men sier at hypotesen er at dette ikke er noe det var enkelt å gjøre noe forebyggende mot.
Overbelastning?
– Det vi hadde på mandag, det var annerledes. Da hadde vi utfordringer med innlogginger i nettbanken. Det betyr ikke at nettbanken ikke var åpen, men den var ikke åpen for alle. Vi så at det var mange som kom inn, men også mange som hadde utfordringer med å få tilgang til nettbanken, forteller Fiksdahl.
Hun legger til at det det fortsatt er for tidlig å si noe om årsaken, men det ikke har hindret DNB i å sette inn tiltak.
Det var en virkelig «peak»-dag
– Når denne typen situasjoner oppstår, gjør vi ganske mange korrektive tiltak. Men når vi ikke vet rotårsaken, er dette ofte basert på hva vi tror kan være problemet, og vi jobber ekstremt bredt ut fra dette, forteller Damvin.
– Vi forbereder oss godt rundt drift med tanke på hvilke dager som det er høyt trykk, både når det gjelder nettbanken og tilhørende områder. Dette inkluderer dager med lønnsutbetalinger, skatteutbetalinger og lignende. Vi har god statistikk som viser hvilke dager i måneden og hvilke måneder i året hvor det er ganske mye trykk. Vi har ganske mange tiltak vi kan iverksette rundt denne typen hendelser. Det er litt farlig å konkludere ennå, men vi ser i alle fall at de tiltakene vi iverksatte i natt [til tirsdag, journ. anm] ser ut til å ha en god effekt i dag, i alle fall, sier han.
Fiksdahl legger til at IT-organisasjonen vet at det er større trykk på mandager enn de andre ukedagene, at dette blir enda verre når det 20. i en måned faller på en mandag, og på mandag var det i tillegg forfall på bilavgiften.
– Så det var en virkelig «peak»-dag, sier hun.
Sammensatte systemer
– Generelt vil jeg tro at alle selskapet som har holdt på noen år, og som har en portefølje som er bygd opp over tid, har komponenter, systemer og applikasjoner som er bygd for en gitt tid og én type bruk og med veldig gode buffere sammenlignet med det som var av krav til tilgjengelighet på det tidspunktet de ble lagd. Men så skifter adferdsmønsteret til kundene veldig raskt og kravene til tilgjengelighet blir stadig strammere. Det som var tilstrekkelig i går, er ikke tilstrekkelig i dag, sier Fiksdahl.
Det dreier seg hele tiden om mer og mer
Hun forteller dessuten at selv om kundene nå for eksempel har blitt veldig glad i å bruke mobilbanken, så er det ikke slik at de slutter å bruke den vanlige nettbanken.
– De har bare blitt glad i flere ting. Så det dreier seg hele tiden om mer og mer. Det er flere produkter, produktene skal ha mye mer data i seg og tilgjengelighet på flere tider av døgnet. Det krever derfor mer og mer å drive en tjeneste som skal være åpen hele døgnet.
Forenkling
– Vi ser også det at det er lagd løsninger som henter data i alle verdens systemer, fordi kundene var veldig opptatt å få tilgang til alt på en gang på det tidspunktet vi lagde disse systemene. Nettbanken er veldig sammensatt og er jo egentlig utstillingsvinduet for alle produktene og tjenestene vi har. Dermed er det kanskje også den mest komplekse løsningen vi har, sier Fiksdahl.
Appene har gjort noe med oss
Samtidig ser DNB at kundene har blitt trent til å gå inn litt smalere.
– Appene har gjort noe med oss, at vi kan se på forskjellig informasjon på forskjellige steder og tidspunkter. Det gjør at vi kan se på om vi skal tilby alt til enhver tid, like bredt som vi gjør, eller skal vi forsøke å porsjonere det ut litt? Jeg tror det er færre kunder i dag som føler at de har behov for alt i samme slengen. Trenden i dag er man skal få akkurat det du trenger, når du trenger det, samtidig som at det er lett tilgjengelig, forteller Fiksdahl.
Derfor ser DNB på mulighetene for å løsne systemene litt fra hverandre.
Snur enhver stein
– Når vi har hendelser som dem vi har hatt nå, så lager vi både en kortsiktig plan og en lengre plan for å se på robustifisering. Da tar vi de beste folkene våre, setter dem sammen med de beste folkene fra leverandørene våre og kjører skikkelig brainstorming hva som kan være årsaker og hva som kan gjøres. Så lager vi aksjonsplaner som vi følger opp for å stabilisere og robustifisere, sier Fiksdahl.
Vi lar ikke det eksisterende være en sannhet fra tidligere
– Det er en veldig bredde i arbeidet vi gjør i denne typen grupper. Vi lar ikke det eksisterende være en sannhet fra tidligere, men ser på absolutt alt, legger Damvin til.
– Den bakenforliggende infrastrukturen til mange av bankløsningene i Norge er sentralisert, den er ikke distribuert som en typisk Facebook-variant. Det er mye betalinger som går via Nets og denne typen kanaler, mens mot utlandet er det Swift.
Myndighetskrav
Fiksdahl forteller også at man tidligere faktisk hadde reserveløsninger hvor man kunne håndtere betalingene på siden av de problemene som nå inntraff på torsdag, ved for eksempel bruke partnerbanker.
– Men de siste årene har det kommet noe som heter AML (Anti-Money Laundering, journ. anm.). Bankene har blitt regulert slik at alt det du gjør innen betaling, skal gjennom et hvitvaskingsfilter. Noe av det vi så på torsdag, er at dette gjør at det ikke er så lett å tilrettelegge for alternative muligheter, fordi dette filteret har veldig store beskrankninger. Dette gjør at vi er nødt til å tenke på om det er noe vi kan løse opp i på noen måte, innenfor det som er teknisk og juridisk mulig, forteller hun.
(Artikkelen fortsetter under)
Stormaskiner
– Det er fortsatt slik at bankene kjører betalingene sine på stormaskiner. Vi har ingen planer om å skifte ut stormaskinene, og vi har tilegnet oss mye kompetanse. Vi har de siste årene virkelig klatret når det gjelder det å være en attraktiv arbeidsgiver. Så vi får tak i flinke folk, sier Fiksdahl.
Vi får tak i flinke folk
– Men en av årsakene til at vi har etablert partnerskap med våre globale leverandører, er jo for å få tilgang til kompetansen deres. Stormaskinmarkedet i Norge og Norden er kanskje ikke det største, men de har en hel verden som sitt nedslagsfelt. Vi ser også at disse store leverandørene har en helt annen tilgang til kompetansen til sine underleverandører også. Og det er jo ekspertise som vi får tilgang til, bare kort tid etter at hendelsene inntreffer, nettopp fordi våre leverandører er store kunder av disse og har allianser og relasjoner høyt oppe i systemet.
Høyt på listen: Hos disse virksomhetene vil norske IT-spesialister helst jobbe
HCL
– Vi har leverandørene her på huset, og de sitter sammen med oss når vi har slike hendelser som dette. Jeg håndterer jo dem som om de er mine egne folk.
Jeg håndterer jo dem som om de er mine egne folk
– Vi har samtidig et driftsoppsett som gjør at vi, ved behov, kan driftes fra et av husene litt lenger borti Bjørvika, hvor HCL har sin driftsoperasjon for Norge. Tilgangen til ledelse, fokus og prioritering når det er krevende, er ikke noe dårligere enn det vi har hatt historisk. Tvert imot, understreker Fiksdahl.
– Ingenting av det vi har opplevd den senere tiden, har noe å gjøre med hvem vi har valgt som leverandør. Når vi ser på analysene og årsakene, så er det heller ingen enkeltleverandør som peker seg ut.
Derfor tok det lang tid
– I den siste tiden har vi fått hendelser på et kort tidsrom som vi kanskje burde ha hatt én av i året. Vi opplever jo problemer som det med det nevnte styringssystemet innimellom. Det er jo slik at med teknologi, så skjer det ting som er veldig vanskelige å forklare. Vanskeligheten nå er at vi har hatt flere slike tilfeller innenfor et kort tidsrom. Også leverandørene understreker at de veldig sjelden ser slike ting, sier Fiksdahl.
– Selv om vi hadde et godt år i 2016, så er organisasjonen vår veldig trimmet og trenet til å håndtere slike hendelser. Men når det skjer slike ting som på torsdag, hjelper det ikke hvor mye man trener og tester. Da handler alt om å finne ut hva vi gjør og hvordan vi kommer oss opp igjen. Vi visste tidlig var det var som var galt, men det tok likevel ganske lang tid for oss å komme oss opp igjen.
Damvin forklarer hvorfor:
Trygghet for både egne og kunders data er det aller viktigste for oss
– Vitalt for vår IT-virksomhet i DNB er at vi kan stole på de dataene vi har og at det er konsistente data. Når komponenter som SAN feiler, så tar vi det ikke bare opp igjen, kobler det til klyngen og kjører videre. Det er en ganske lang verifikasjonsprosess som går på disse SAN-ene før vi velger å ta dem inn igjen. Dette fordi vi lever av tillit. Vi hadde ikke kunnet stå inne for det dersom vi ikke virkelig hadde hatt kontroll på dataene og det vi gjør. Trygghet for både egne og kunders data er det aller viktigste for oss.
– Vi brukte noe tid på å finne feilen og å mitigere den, men vi brukte også noe tid på å verifisere dataene. Det dreier seg om data i petabyte-skalaen, samtidig som vi skynder oss langsomt når slike hendelser skjer, rett og slett for å sikre at vi ikke gjør overilt som får negative konsekvenser, forteller Damvin.
Les også: DNB brukte en dag på banktrøbbel
Forsiden forsvant
En konsekvens av hendelsene på torsdag, var at ikke bare nettbanken og andre mer eller mindre avansert tjenester ble utilgjengelige. Selv forsiden til på DNBs nettsted forsvant. Damvin forklarer hvorfor dette skjedde.
Når det som feiler, er det som egentlig skal sikre deg oppetid, så inntreffer det problemer slik som det gjorde nå på torsdag
– Vi har jo bygget løsningene for å ha høy tilgjengelighet, slik at hele stacken er bygget multiredundant. Vi har egentlig tatt høyde for at en av datahallene våre skal kunne feile og den andre leve videre med helt separate strømføringsveier, nettverk og alt mulig annet. Hvis man skal gjøre dette, må det faktisk være en speiling fra datahall én til datahall to i sanntid. Men med feilen som oppstod på torsdag, når våre servere i datahall to prøver å aksessere dataene gjennom SANets clusterløsning, så får du heller ikke opp websidene som er replikert over, fordi styringssystemet ikke klarte å håndtere feilsituasjonen som hadde oppstått, forklarer Damvin.
– Når du kjøper en løsning som ifølge leverandøren er garantert alltid å være tilgjengelig, så bygger du det slik at ved failover fra en datahall til en annen, så skal du ha med deg all informasjonen over, fortsetter han.
– Vi kommer til å se på om vi skal gjøre noen endringer rundt dette. Men den underliggende arkitekturen er tenkt å være høytilgjengelig, faktisk også med tanke på data recovery, i og med at vi speiler til et tredje driftssted. Vi har tenkt på at dersom vi får en hendelse i regionen hvor datasenteret ligger, så skal vi kunne kjøre bankdrift fra et annet sted i løpet av relativt kort tid.
– Når man skal ta hensyn til slike eventualiteter, så støtter du deg noe på kapabilitetene til den underliggende infrastrukturen. Og når den feiler, spesielt det som egentlig skal sikre deg oppetid, så inntreffer det problemer slik som det gjorde nå på torsdag, sier Damvin.
Les også: I dag har de over 800 ansatte som jobber med IT i Norge. I 2017 skal de ansette enda en haug
Beklager
– Vi syns det er kjempetrist for kundene våre, slik det har vært i noen dager nå. Vi beklager dette på det sterkeste, og vi er på ingen måte fornøyde med å levere drift som har avbrudd. Stabil drift trumfer alt. Dette er prioriteten til styret og konsernledelsen, og førsteprioriteten til IT-organisasjonen. Dette er høyest på agendaen hver eneste dag. Selv om vi har en høy endringstakt, så er vi ekstremt opptatt av at denne ikke skal forstyrre driften, sier Fiksdahl.
– Nå gjør vi alt for å komme over i en stabil situasjon. Når vi har driftsavvik, så plukker vi de beste folkene fra alt vi holder på med, og da gjør vi ikke noe annet. Men det er også vanskelig over tid, fortsetter hun.
Vi føler i alle fall at vi får mer enn nok oppmerksomhet
Når det er sagt: Fiksdahl reagerer når digi.no antyder at DNB har mer nedetid enn mange andre, norske banker. Hun sier hun gjerne skulle ha sett statistikk som viser at dette er tilfellet. Hun spør om pressen skriver like mye om problemene og utilgjengeligheten som andre banker opplever fra tid til annen. Og det må vi nok innrømme at ikke er tilfellet.
– Vi føler i alle fall at vi får mer enn nok oppmerksomhet, sier hun.
Damvin sier han ikke kan uttale seg om andre banker, men påpeker at DNB er ganske flinke til å informere allerede på forsiden av nettstedet om at deler av tjenestene har problemer, uten at det betyr at hele nettbanken er nede.
– Hvis du for eksempel ikke får opp kortinformasjonen i nettbanken, så informerer vi om dette på forsiden for rett og slett gi kundene en tjeneste, uansett om det skyldes vedlikehold eller at det er problemer med dette systemet, sier han.
Fiksdahl legger til at DNB har måttet gå noen runder med enkelte for å forklare hva som er forskjellen på faktisk er nedetid og det som er planlagt og ikke-planlagt utilgjengelighet av tjenester som ikke er primærtjenester.
Ingen teknologer i konsernledelsen
Søndag skrev Jan M. Moberg, ansvarlig redaktør for både digi.no og Tekniske Ukeblad, en kommentar hvor han påpeker at DNB, som omtaler seg selv like mye som en teknologibedrift som en bank, ikke har noen teknologier i konsernledelsen. For eksempel er Fiksdahl primært økonomiutdannet.
Jeg er veldig trygg på at styret og konsernledelsen får tilgang til nok teknologikjennskap
Hun hadde ikke lest kommentaren da digi.no møtte henne, men kommer likevel med en uttalelse om det Moberg poengterer.
– Vi har mange teknologer med inn i styrerommet og konsernledermøtene, som er der, deler kunnskap, redegjør og diskuterer. Så jeg er veldig trygg på at styret og konsernledelsen får tilgang til nok teknologikjennskap, sier Fiksdahl.
– Samtidig våger jeg å si at det ikke er så mange i min rolle som sitter tettere på virksomheten sin enn det jeg gjør. Jeg forsøker virkelig å være den som tar teknologien inn i styrerommet og konsernledermøtene. Jeg er med på hendelseshåndteringen, det er jeg som har møter med leverandørene. Men det tenker jeg at er jobben min også, da, sier hun.
Setter seg inn i teknologien
Fiksdahl mener at man ikke skal se seg blinde på hva som står på CV-en, men heller se mer på den operasjonelle erfaringen og måten å drive på.
– Jeg kunne ha tegnet opp det aktuelle lagringskabinettet for deg, hevder Fiksdahl. Det ble riktignok ikke noe av på grunn av tidsbegrensninger under møtet, men Fiksdahl mener at det er mange i lignende stillinger som ikke tar jobben det er å sette seg inn i teknologien.
Den kjekkeste tidsbruken jeg har, er når jeg sitter sammen med teknologi-folkene mine
Hun nevner som eksempel at hun mandag kveld deltok i diskusjoner helt ned på et nivå hvor man snakket om CPU-forbruket til en database.
– Jeg vet det var på 4 prosent i morges, hva det var på dagen før og hvilken applikasjon vi derfor ryddet litt i, forteller hun.
– Det er mange jeg møter på min vei, med teknologiutdannelse, som jeg syns det er uinteressant å diskutere med, fordi de ikke er «hands on» med virksomheten sin.
– Jeg kan likevel si at den kjekkeste tidsbruken jeg har, er når jeg sitter sammen med teknologifolkene mine og vi tenker høyt, diskuterer og tegner på tavla for å finne løsninger og å komme opp med nye ideer. Det handler litt om hvilket miljø du lager rundt deg. Ledelsen av IT og Operations er jo mye mer enn bare meg. Jeg har en knallsterk ledergruppe rundt meg, med de beste folkene i Norge, innenfor sine fagfelt. Så jeg føler at vi har god ballast når det gjelder kompetanse, sier Fiksdahl.
Hun mener likevel at Moberg stiller et interessant spørsmål.
– Det er jo teknologien som er «enableren» for hva vi skal gjøre i framtiden.
Hentet erfaringer hos Amazon
Fiksdahl forteller at hun og andre i DNB nylig kom tilbake fra en reise hvor de har besøkt både banker i Sydney og teknologiselskaper i San Francisco, Silicon Valley og Seattle, for å høre hvordan de løser sine utfordringer.
Blant annet synes hun det var morsomt å få komme innenfor hos Amazon og å få kjenne på hva som er kulturen og DNA-et hos denne giganten.
– Det er kjempemye du lærer. Kunsten er å bestemme seg for hva du vil ta med deg tilbake. Jeg er tilhenger av at jeg skal implementere tre ting, i stedet for å ha ti ting som bare koker bort i kålen. Dagen etter at vi kom hjem, hadde vi en kompetanseoverføring hvor vi inviterte hele banken til åpent hus og brukte en halvtime på høydepunktene fra læringspunktene våre, forteller Fiksdahl.
– Det jeg kanskje syntes var kulest med Amazon, noe som jeg er ordentlig tilhenger av, er at du hele tiden skal strebe etter å gjøre det best mulig, uten å unnskylde deg med at det ikke er mulig å ha høy fart og god kvalitet. Det er interessant, fordi det i dag er mange som sier at den høye farten gjør at vi ikke kan ha så høy kvalitet hele veien.
– Det er fristende å bruke det som argument når ting ikke går som de skal. Men Amazon var veldig tydelige på det at om du skal lykkes, så må du faktisk kunne håndtere begge deler. Slikt er spennende å diskutere når man kommer hjem, avslutter hun.
Somlet med krypto: – Dette er pinlig for Vipps