it-bransjen
– Data brukes i stadig mer avanserte IT-løsninger, men det er urovekkende liten fokus på kvaliteten
Vil kvalitetssikre data før de brukes til analyse eller maskinlæring.
HØVIK (digi.no): «Alle» snakker om hvordan man kan få mest mulig nytte ut av data, for eksempel innenfor business intelligence og maskinlæring. Det er imidlertid urovekkende liten fokus på kvaliteten på de stadig større mengdene data som brukes i moderne IT-løsninger, mener Per Myrseth i DNV GL.
Myrseth er sjef for DNV GLs eget kompetansesenter som jobber med kvalitetssikring av data. Han forteller til digi.no at han mener det vil være veldig viktig fremover at industrien begynner å se viktigheten av gode data og gode analyser. DNV GL er store innenfor maritimt, men jobber også med andre bransjer som olje og gass, fornybar energi, helsesektoren, matvaresporing, og mye annet.
Mer data er ikke alltid bedre
Innenfor maskinlæring er gjerne mantraet at det er om å gjøre å ha så mye data som mulig når maskinlæringsmodellene skal trenes. Dette er i og for seg riktig, men det er ikke likegyldig hva slags data man putter inn i modellene.
– Når du investerer i data og et IT-system som skaper verdi fra data, så ønsker du «return on investment». For å vite om systemet faktisk gir deg det, må du sjekke datakvaliteten både i designfasen og i operasjonell fase, sier Myrseth.
Av DNV GLs rundt 12.100 ansatte, jobber ca. 800 mennesker i forretningsområdet Digital Solutions ved hovedkontoret på Høvik – en stor andel er utviklere eller data scientists. Kompetansesenteret for datakvalitet er en del av dette teknologimiljøet.
Såkalt «predictive maintenance» og «condition monitoring» er viktig innenfor mange av bransjene DNV GL jobber med. Med dette menes å overvåke ulike deler av et maskineri – for eksempel en motor – slik at man kan forutse feil før de oppstår. Ved å overvåke for eksempel vibrasjoner, temperatur, støy, og så videre, kan man få varsler om når det er på tide å utføre forebyggende vedlikehold.
– Hvis man investerer en masse i sensorteknologi for å overvåke en vindmølle, et skip, et smartgrid eller en lakseoppdrettsfarm, så må du jo også drive «condition monitoring» på selve dataene. Hvis du ikke tar kontroll på datakvaliteten, da tar du en stor risiko.
Myrseth understreker at selv om kvaliteten på dataene kan være god på det tidspunktet løsningen blir designet, kan dette endre seg over tid. Dermed må man hele tiden overvåke dataene og teste at kvaliteten fortsatt er god nok.
Når man bruker dataalgoritmer til å forutse vedlikeholdsbehov, er det selvfølgelig om å gjøre å treffe så bra som mulig. Det viktigste er å unngå at algoritmen ikke varsler om fatale feil, det kan fort bli dyrere enn om man må utføre ett og annet vedlikehold som ikke var nødvendig. Et motorhaveri for eksempel, kan få store konsekvenser og bli svært dyrt.
Ønsker å tilby sertifisering på datakvalitet
Mye av arbeidet DNV GL gjør innenfor dette området er basert på ISO 8000, en standard for datakvalitet som begynner å få internasjonal utbredelse. På sikt ønsker DNV GL å kunne tilby ISO 8000-sertifisering, slik at organisasjoner får et sertifikat på at de håndterer data på en god måte. Men selv om DNV GL jobber mye med kvalitetssikring av data for kunder, er det foreløpig ingen internasjonalt som kan akkreditere DNV GL som sertifisør.
– En av grunnene til at vi tror dette er en spennende rolle, er at det på et skip er veldig mange leverandører av utstyr. Et moderne skip har sensorsystemer fra et titalls leverandører.
Noen ganger er det de som eier utstyret som er best på analyse av data, mens andre ganger vil dataene hentes ut fra utstyret og inn i en IT-infrastruktur – så gjøres analysen av andre.
– Hvis du vil etterprøve analysen som er gjort av utstyrseier, må du ha dataene ut av infrastrukturen, sjekke at dataene er gode nok til å bruke, så kan du gjøre analysen, forklarer Myrseth.
Advarer mot «overfitting» av algoritmer
Når man trener maskinlæringsalgoritmer, trener man først på de historiske dataene og ser om algoritmen er god nok til å finne feil som allerede har skjedd. Hvis den ikke er god nok til å finne historiske feil, bør heller ikke algoritmen brukes til å prøve å forutse fremtidige feil.
– Vi ser gang på gang at mange prøver å overtrene algoritmene sine. De prøver å tune algoritmene til å bli veldig gode til å forutse det som har skjedd. Men hvis mønsteret for feil frem i tid er litt annerledes enn det som har skjedd, så vil ikke algoritmene være gode til å forutse hva som kommer til å skje.
Denne typen overtrening av maskinlæringsalgoritmer er det som kalles «overfitting». Det betyr at modellen faktisk blir for godt trent til å kjenne igjen støy og tilfeldige variasjoner i historiske treningsdata – på en slik måte at modellen kan fungere dårligere når den får servert nye data.
– Du må sjekke kvaliteten på dataene og se om det er det vi kaller «predictive power» i dataene. Har dataene den egenskapen at de faktisk kan si noe om fremtiden? Det er jo det som er hele grunnlaget for å gjøre predictive maintenance. Hvis dataene ikke kan si noe om fremtiden, kan du gjøre så mye analyse og data science som du bare vil – det fungerer ikke, sier Myrseth.
Tre måter å måle datakvalitet på
Datakvalitet kan ifølge Myrseth måles på tre ulike måter: Syntaktisk kvalitet, semantisk kvalitet og pragmatisk kvalitet. Med syntaktisk kvalitet menes at dataene har riktig format med hensyn til hva de skal brukes til – for eksempel at datoformater levert av et API er riktige. Da vet man at filen eller objektet som sendes er i henhold til spesifikasjon.
Med semantisk kvalitet menes om dataene er i henhold til virkeligheten. For eksempel kan en tallverdi som sendes være syntaktisk korrekt (for eksempel at det forventes et heltall eller en dato), men det behøver ikke stemme med virkeligheten. Mottas det for eksempel en tallverdi fra en sensor, og tallet skal representere en temperatur, må dette også stemme med den faktiske temperaturen som sensoren skal måle.
– Det er helt ulike metoder vi bruker for å sjekke syntaktisk kvalitet og semantisk kvalitet. For å sjekke semantisk kvalitet må vi ha kunnskap om hva som skjer, hvor dataene kommer fra, hvilke data vi tidligere har fått, og så videre.
Som eksempel nevner Myrseth sensorer på et skip som måler for eksempel eksos, temperatur, rotasjon på motor og andre ting. Ved å se på de ulike målingene fra alle de ulike sensorene kan man se om dataene er troverdige fra et semantisk ståsted.
– Vi må ofte ut og sette sammen data for å gjøre denne typen analyser.
Det siste er pragmatisk kvalitet. Det handler om hvorvidt dataene er egnet til å brukes til et bestemt formål. Er det for eksempel behov for målinger hvert sekund, men du får dem bare en gang i minuttet, er dataene av lav pragmatisk kvalitet.
Bruker data til andre formål enn opprinnelig tiltenkt
Myrseth forteller at etter hvert som stadig flere virksomheter har fått øynene opp for verdien av data, så ønsker mange å bruke dataene til mye mer enn det som opprinnelig var planen. Og selv om det ligger mange muligheter for ny innsikt i å gjøre dette, er ikke dette helt problemfritt.
– Data er vanligvis designet for et primærformål og kvaliteten på dataene er gjerne designet for å løse dette primærformålet. Nå ser vi stadig oftere at man ønsker å bruke dataene til sekundærformål – og da kommer det nye kvalitetskrav inn.
Ofte ligger dataene i ulike tekniske siloer i virksomheten, noe som også kompliserer ting. Men jo mer informasjon man har som er god nok, jo lettere kan virksomheten ta de rette beslutningene, ifølge Myrseth.
– Ny teknologi gjør det mulig å skape informasjon som ikke var mulig å skape før, og de dataene kan du bruke til å jobbe på andre måter. I tillegg kan man også monitorere utstyr bedre, og dermed redusere operasjonell risiko. Du har mer informasjon om hva som foregår her og nå.
– IT er ikke et mål i seg selv
Myrseth mener at det faktum at Norge har mange ingeniører har gjort at mange har glemt det forretningsmessige – og i stedet hatt nesten all fokus på de tekniske løsningene.
– Budsjettene har gått til IT-avdelingen, men organisasjonens gevinst kommer først når dataene er gode nok. Hvis du fokuserer bare på at IT skal løse målet ditt, og ikke fokuserer på roller og ansvar knyttet til data, så vil du bli i en IT-system-fokusert verden. Nå flyter jo dataene mellom virksomheter.
Hvilket IT-system man bruker, er ifølge Myrseth underordnet. Man må begynne med å se på hvilke forretningsmål man har, hvilke data man har og hva man trenger – og så kan man begynne å tenke på hva slags IT-systemer man trenger.
Noe av skylden for at fokus har vært feil, kan også være at IT-konsulentselskapene typisk tjener penger på å levere selve IT-løsningene.
– IT er redskap for å dra nytte av dataene dine. IT er ikke et mål i seg selv. Det er sjelden teknologi i seg selv er målet, som regel er det de dataene du kan klare å skape og bruke sammen med teknologien som er målet.