kunstig intelligens
AI-løsningen til dataingeniør-studentene Magnus og Sigurd kan spare norsk bedrift for ekstremt ressurskrevende arbeid
Manuell kategorisering av innholdet i sikkerhetsdatablader er en tidkrevende oppgave. En algoritme basert på maskinlæring kan automatisere jobben.
Algoritmen er utviklet av to dataingeniørstudenter ved Universitetet i Sørøst-Norge som del av et bachelorprosjekt. Sikkerhetsdatablader er nøye standardisert med hensyn til innholdet, men de kan ha store variasjoner i utformingen, noe som gir utfordringer for et automatisk system. Studentene har løst problemet ved å bruke maskinlæring til å klassifisering av innholdet og har brukt Microsoft Azure som læringsplattform.
– Algoritmen gjenkjenner datapunkter i tekstene fra sikkerhetsdatabladet og klassifiserer teksten, forklarer Sigurd Holmen som var med på prosjektet sammen med Magnus Haukebøe.
– Hvert ord får en egen indeks og algoritmen finner ut hvilken ID den skal klassifiseres under. I dag blir dette gjort manuelt.
Studentene forteller at de fikk oppgaven av bedriften EcoOnline som tilbyr en samletjeneste for sikkerhetsdatablader i et stoffkartotek. Sikkerhetsdatablader inneholder kritisk informasjon og skal være tilgjengelig på arbeidssteder der en kan bli eksponert for bestemte kjemikalier. Informasjonen fra sikkerhetsdatabladene lagres i en egen database. Databladene blir delt inn i ulike datapunkter, eller id-er og informasjonen i databladet blir katalogisert under riktig datapunkt. Det er mye å vinne ved å kunne automatisere en slik prosess.
– Tanken er at systemet skal fores med en tekst og så skal kategoriseringen skje automatisk, forklarer Holmen.
Nevralt nettverk og maskinlæring
Selv om studentene ikke har laget et fullt ferdig system, så hevder de at de med sitt prosjekt har vist at det er mulig å løse en slik oppgave med et nevralt nettverk og maskinlæring. Et nevralt nettverk etterligner måten den menneskelige hjernen arbeider på og består av noder som er koblet sammen lagvis.
Sikkerhetsdatablader skal følge EU-standarden for klassifisering og katalogisering av sikkerhetsdatablader som blant annet setter krav til hva et sikkerhetsdatablad skal inneholde. Totalt inneholder sikkerhetsdatablad 16 seksjoner, men studentene har konsentrert seg om seksjon fire som handler om førstehjelpstiltak etter eksponering for kjemikalier. Seksjonene inneholder nummererte titler med tilhørende følgetekst. De nummererte titlene er faste i henhold til standarden og underteksten blir verdiene som skal lagres i databasen.
Ett av problemene er å skille titler og følgetekst fra hverandre, blant annet fordi det gjøres på forskjellige måter i de ulike databladene. For å få det til valgte studentene en metode der algoritmen tok hensyn til posisjoneringen av teksten, fonttyper og pdf-transformasjoner. Alle tekstbitene blir konvertert til tekstnoder der alle noder på samme linje blir koblet sammen.
– Tekstnodene blir brukt til å finne tittel-verdiparene ut ifra PDF-posisjoner og inneholder tekstene, forklarer studentene.
– Dette steget er ment for å finne tekst som hører sammen i tillegg til å markere teksten som ikke skal lagres etter klassifiseringen. Etter at teksten er hentet riktig ut, må den gjøres om til tall for å kunne benyttes av det nevrale nettverket.
Høy treffsikkerhet
Ut i fra dette laget studentene en modell som de kunne trene opp ved hjelp av Microsoft Azure læringsplattform. Etter at modellen var ferdig trent, ble den testet. Da brukte studentene et helt nytt datasett for å teste modellens evne til å klassifisere usett data. Testingen viste en generelt høy treffsikkerhet på klassifiseringen på 96 prosent.
Studentene presiserer at det de har laget ikke er et ferdig produkt, men at det kan legges inn i eksisterende systemer og dermed bidra til å forenkle dagens manuelle rutiner. Når et nytt datablad legges til systemet, hentes teksten ut av pdf-leseren og systemet klassifiserer den og returnerer svarene til brukeren. Dermed blir det opp til brukeren å avgjøre om den skal brukes og lagres eller om den må legges inn manuelt.
Ekstremt ressurskrevende
Alexander Moan fra EcoOnline forteller at studentene fikk denne oppgaven fordi det i dag er ekstremt ressurskrevende å manuelt legge inn de dataene som finnes i et sikkerhetsdatablad.
– Dataene skal legges inn i vårt stoffkartotek, EcoOnlines Chemical Manager, som utover vanlig stoffkartotek også håndterer risikovurderinger, personlig eksponering og andre viktige funksjoner som bedrifter er pålagt å ha kontroll på i henhold til norsk lov. forklarer han.
– For at disse funksjonene skal fungere optimalt, så må dataene finnes i CM.
Dette har alltid vært en akilleshæl for slike systemer, men vi har nå sett at vi kan automatisere denne prosessen, konstaterer han.
Seniorutvikleren fra EcoOnline understreker at løsningen slik den framstår i dag ikke er komplett.
– Den er spesifisert av oss i tett samarbeid med Magnus og Sigurd, og består av mange samarbeidende komponenter, forteller han.
Skal kunne brukes på alle språk
Utfordringen har ifølge Moan alltid vært at ulike leverandører av kjemikalier lager sin egen variant av dokumentstandarden for sikkerhetsdatablader. Standarden definerer i detalj hva som skal stå i et sikkerhetsdatablad, og definerer en overordnet struktur for hvordan dette skal se ut. Men nede på detaljnivå kan leverandøren utforme dokumentet slik de selv ønsker. Derfor blir dokumentene ganske ulike, og vanskelig å automatisere innleggelse fra.
– Det er definert en internasjonal XML-standard for elektronisk utveksling av disse dokumentene, SDSComXML, som EcoOnline har vært med på å utarbeide, forteller han.
– Problemet med den er at den ikke er tatt i bruk av leverandører i stor nok grad. Det er derfor en utfordring å sende informasjonen mellom aktører i verden.
Når metodikken de nå er i ferd med å utvikle er helt ferdig, vil den ifølge ham kunne brukes på alle sikkerhetsdatablader fra alle leverandører på alle språk.
– Eneste begrensing er at det må finnes en viss mengde datablader fra hver leverandør på hvert språk for at systemet skal kunne lære seg å gjenkjenne dokumentene. Det er vanskelig å trene en maskinlæringsprosess med bare ett eksempel, men vi håper å kunne lage en løsning som fanger opp disse enkeltdokumentene ved hjelp av en generisk metode, legger han til.
EcoOnline-representanten forteller at de har som målsetning å få til en løsning som automatiserer alt dette i nærmeste framtid.