kunstig intelligens

UD tar i bruk kunstig intelligens oppkalt etter roboten fra «2001: En romodyssé»

– Arkivsystemet er stedet informasjonen går for å dø. Vi har ikke hatt noen god måte å dele, finne og gjenbruke informasjonen. Systemene har ikke vært gode nok.

UDs fagdirektør (fra v.) Ole-Martin Martinsen og seniorrådgiver Øyvind Berget forteller for første gang om en ny løsning de har laget internt, som gir live klassifisert, kategorisert og klikkbar informasjon i kart, tid, tema og så videre. Den skal kunne ta alle dokumenter.
UDs fagdirektør (fra v.) Ole-Martin Martinsen og seniorrådgiver Øyvind Berget forteller for første gang om en ny løsning de har laget internt, som gir live klassifisert, kategorisert og klikkbar informasjon i kart, tid, tema og så videre. Den skal kunne ta alle dokumenter.

VICTORIA TERRASSE, OSLO (digi.no): Det kommer en jevn strøm av meldinger fra Norges 103 utenriksstasjoner tilbake til norske myndigheter.

Sett utenfra og med moderne teknologibriller, så har ikke denne kommunikasjonen vært særlig høyteknologisk. Det som før i tiden ble sendt med telefaks blir nå formidlet med ganske ordinær epost.

Ja, i 2019 sender fortsatt norske diplomater aktuell informasjon og rapporter med 1960-tallsteknologien elektronisk post.

Det siste halvannet året har et lite team laget en moderne løsning for å få orden på informasjonsflyten fra og til de rundt 2.500 ansatte i utenrikstjenesten.

Antakelig er det første gang UD tar i bruk kunstig intelligens.

Behov for nye løsninger

Utenriksdepartementet må ha tilgang på oppdatert informasjon. Ikke minst hva som ble sagt sist, som under det forrige møtet i New York, Geneve eller hvor det var.

– Vi har ikke hatt noen god måte å dele, finne og gjenbruke informasjonen. Systemene har ikke vært gode nok, mener fagdirektør Ole-Martin Martinsen i UD.

Bruk av maskinlæring til å tolke eller forstå hvilke tema tekstene handler om, er nok det mest unike i løsningen, mener fra v. Øyvind Berget og Ole-Martin Martinsen. Foto: Marius Jørgenrud
Bruk av maskinlæring til å tolke eller forstå hvilke tema tekstene handler om, er nok det mest unike i løsningen, mener fra v. Øyvind Berget og Ole-Martin Martinsen.

En av oppgavene til norske diplomater er å innhente nyheter og politiske vurderinger, som igjen danner grunnlag for politikk. Som altså sendes hjem via epost.

– Joda, det blir arkivert også, men hvis du ikke mottar eposten, så får du ikke den informasjonen. Du klarer ikke å finne det tilbake. Saks- og arkivsystemet er der informasjonen går for å dø, sier Martinsen.

Han og kollega Øyvind Berget har invitert digi.no for å vise fram noe de er stolte av. Begge er teknologer som jobber i UDs seksjon for analysestøtte og kunnskapsformidling.

Ikke akkurat en morderisk robot

Kunstig intelligens i form av maskinlæring er stikkord for en løsning de ironisk har døpt HAL, etter den fiktive datamaskinen i Stanley Kubricks kultklassiker «2001: En romodyssé».

Kanskje ikke verdens beste sammenligning, for i den dystre fremtidsvisjonen «våkner» den kunstige intelligensen og begynner å ta livet av besetningen i et romskip.

Jobben som UDs navnebror er satt til å skjøtte er en ganske annen.

Anslagsvis kommer det inn 5-6000 såkalte innrapporteringer i året til UD. «HAL» bearbeider disse rapportene automatisk og i sanntid. Det er mest tekst, men det kan også være bilder. I praksis er dette epost som prosesseres og havner i et annet system.

HAL: Løsningen klassifiserer flere tusen rapporter i sanntid, ved hjelp av maskinlæring. UD har gitt digi.no tillatelse til å publisere dette skjermbildet i sladdet utgave.
HAL: Løsningen klassifiserer flere tusen rapporter i sanntid, ved hjelp av maskinlæring. UD har gitt digi.no tillatelse til å publisere dette skjermbildet i sladdet utgave.

HAL brukes både til å klassifisere innhold og skape nye metadata, som hvilken ansatt eller ambassade som er forfatter. På skjermen (som vi ikke får lov til å fotografere) ser vi med et halvt øye en dagsfersk innrapportering fra ambassaden i Addis Abeba i Etiopia, uten at vi registrerer innholdet.

Klassifisering av språk, ord og uttrykk er en egen kunst. Ta for eksempel uttrykket «olje». Det kan bety så mangt. En ren søke- eller indekseringsløsning er i denne sammenheng ikke nok til å tolke hvilken sammenheng ordet er brukt i.

– Diplomater er veldig flinke til ikke å bruke de samme ordene. Søker du etter olje kan du bomme, for de kan ha skrevet petroleum, «olje i maskineriet» (noe som får en prosess til å gå lettere) eller fiskeolje.

– Egentlig sitter du med null metadata, utover avsender, tidspunkt og hvem eposten er sendt til. Vi sjekker blant annet opp hvem som har sendt og fra hvilken ambassade, og kan forsøke å hente ut land i teksten. Ofte når du skal søke på land, kan det være flere land, hvor det andre landet egentlig er irrelevant støy.

For eksempel kan det stå «som vil være lik Sveriges standpunkt i denne saken». Det gjør det lettere å forstå ett standpunkt med noe som normalt er nærmere Norge når det skal nå folk som har fokus på forskjellige områder, men da er Sverige irrelevant, utdyper Øyvind Berget.

Han legger til at akkurat denne funksjonaliteten ikke er fullt oppe og går ennå, fordi det gjenstår en del finjustering.

– Fungerte bedre enn ventet

Algoritmene sørger også for å hente ut og generere korte oppsummeringer, som blir en «executive briefing» med kulepunkter øverst i meldingen.

Klassifisering på tema og sted gjør det nå enkelt å raskt se antall rapporter filtrert ned på tema og sted på jordkloden. UD opererer med 36 ulike fagområder, der noen eksempler kan være økonomi, valg og demokrati, klima og miljø eller europapolitikk. Foto: Marius Jørgenrud
Klassifisering på tema og sted gjør det nå enkelt å raskt se antall rapporter filtrert ned på tema og sted på jordkloden. UD opererer med 36 ulike fagområder, der noen eksempler kan være økonomi, valg og demokrati, klima og miljø eller europapolitikk.

– Ved hjelp av maskinlæring klarer vi å tolke innholdet i innrapporteringer. Dermed så kan vi klassifisere den inn i et tema. Litt som å automatisk sette emne på en digi.no-artikkel. Det gjør at diplomatene kan følge sine områder. Og bruke det i kombinasjon med sted og tid, forklarer Berget.

Maskintaggingen er noe av det som er mest spennende, mener teknologene.

– Dette fungerer mye bedre enn vi på forhånd trodde. Hypotesen vår var at vi kan bruke maskinlæring til å tagge innhold i dokumentene. Svaret er at det fungerer langt bedre enn vi trodde. Det er fullt mulig å klassifisere disse dokumentene, konstaterer Martinsen.

Berget legger til: – På det beste treffer løsningen nesten på alle dokumenter. Den feiltagger veldig lite. Treffprosenten er på omtrent 80-85 prosent, røper han.

Det er mulig å overstyre og manuelt tagge rapporter, men ingen av dem har noen tro på at de skal klare å få UD-ansatte til å gjøre en slik jobb.

– Skal vi klare å gjøre dette må vi gi brukerne merverdi med én gang. Det ser vi at vi gjør nå. Løsningen bidrar til å påvirke hvordan rapportene skrives, uten at vi forteller ansatte hvordan de skal jobbe. Resultatet er at det blir mer struktur på informasjonen, sier Martinsen.

Beslutningsstøtte

Det er mulig å finne rapporter tilbake til 2012 i løsningen, men den største økningen av tilgjengelige rapporter er fra mars 2018, da HAL ble satt i produksjon.

På sikt er målet å ta med også andre dokumenttyper som UD benytter, med stammespråk som «flak» og «mapper».

Mapper er noe UD forbereder før tjenestereiser til utlandet. Det kan være en samling med bakgrunnsinformasjon som for eksempel utenriksministeren får. Med opplysninger om hva som er Norges standpunkt i ulike saker, helt ned til hva statsråden skal snakke om i kaffepausene.

– Vi bryter ned mappene, analyserer og tagger dem, men denne delen av løsningen er ikke helt ferdig før til høsten, forteller Martinsen.

– Hva er målet med å tagge opp eller å klassifisere disse dokumentene?

– Det handler om å kunne finne tilbake. Hvis du søker etter noe og folk har et stort vokabular, så ender det opp med en haug ulike søkeord, og folk vet ikke om de treffer, sier Berget.

– Deling av informasjon og kunnskap er løsningens styrke, forteller Martinsen. Foto: Marius Jørgenrud
– Deling av informasjon og kunnskap er løsningens styrke, forteller Martinsen.

Martinsen trekker en parallell til enklere tider, da det var mulig å jobbe mer isolert innenfor et og et fagområde.

– I dag har ansatte dårligere tid og ulike fagområder konvergerer. Jobber du med energi må du nesten vite hva som skjer på næringsutviklingsfeltet. Eller de som jobber med hav må vite hva som skjer innen digitalisering. Deling av informasjon og kunnskap er derfor styrken her, da. Vi bygger løsningen så alt kan kastes inn her. Får du en rapport fra Verdensbanken vil den være søkbar og i en kontekst med annen informasjon.

Til syvende og sist er det beslutningsstøtte det handler om. Det er i hvert fall målet på litt lengre sikt. Verktøyet er ment å gi bedre adgang til bakgrunnsinformasjon og analyser.

– Så langt er vi ikke kommet. Dette er ikke beslutningsstøtte ennå, men en kjempegod løsning for innrapporteringer. Til høsten også for mapper og flak. I løpet av 2020, hvis ingen slakter oss, så ønsker vi å ta opplysningene ut av dokumentene, totalt. Så kan du sy sammen rapporter basert på data i sanntid, sier fagdirektør Martinsen.

Kanskje blir det mindre epost

– Hvilke konkrete gevinster gir løsningen?

– Bare det å finne tilbake informasjon er en stor gevinst. For eksempel hva Norge har ment om avskoging i Sørøst-Asia de siste seks månedene, her kan du finne den informasjonen. Nå som vi skal begynne med automatisert arkivering vil det gi enda større gevinster, sier Berget.

– Vi startet med innrapporteringer, fordi det var en helhetlig prosess vi så at vi kunne gå etter. Utfordringen var om denne informasjon når fram til de som skal ha den, fordi det sendes på epost. Nå har vi en løsning som kan gi alle den informasjonen, sier Martinsen.

– Blir det mindre epost av dette?

– Jeg tror nok at folk fortsatt vil sende på samme måte, for å forsikre seg om at meldingene når fram til de rette menneskene, men på sikt håper vi på det. Samtidig har vi ikke ønsket å ta fra folk muligheten til å sende epost. Det tror jeg UD-ansatte er veldig avhengig av.

Hjelp fra Blindern

Alt er ikke laget internt i seksjonen, eller med bistand fra en håndfull konsulenter. Deler av løsningen har også Universitetet i Oslo laget.

UiO har bidratt med utvikling av moduler for kategorisering av norsk språk. Det handler blant annet om å kunne klassifisere et verb i ulike bøyninger, som at «gikk tilbake» er samme verb som det «å gå».

– Dette er viktig fordi maskinlæring ser etter samme ord. Alternativet er å fjerne -er, -re, -en, -a, og så videre på alle ord som vil gi statistisk støy, forklarer Martinsen.

UIO hadde ifølge ham allerede hadde lagd en multitagger. UD spurte om det var mulig å få programvaremodulen skrevet om til et rent Python-bibliotek, noe universitet gjorde for dem.

Koden er tilgjengelig på Github under en fri MIT-lisens, for de som ønsker å ta dette i bruk selv.

Valget av programmeringsspråk er ikke helt tilfeldig. UD drifter sin egen IT. Det er ikke aktuelt å ta i bruk eksterne driftstjenester.

Microsoft-miljø

– Alt må gjøres av våre folk av sikkerhetshensyn. Vi må gjøre alt «in house», og kan ikke bruke skyteknologi. Det har vært en kjempeutfordring å få teknologi også inn i huset vårt, sier Martinsen.

Ingen på driftsavdelingen jobber med verken Unix eller Linux. UD har en ren Microsoft-stack.

HAL-verktøyet har et grafisk grensesnitt og blir kjørt med Microsoft Sharepoint i bunn. I tillegg kommer en maskinlæringsmodul fra samme selskap for SQL Server.

– Vi benytter oss av mye skreddersøm. Først begynte vi med Microsofts maskinlærings-server, men den er sjeldent oppdatert på de nyeste bibliotekene. Derfor valgte vi å resette og bygge fra scratch. Alt er satt sammen av små komponenter, så det enkelt kan byttes ut.

Ny plattform truer

Midt oppe i dette har regjeringen satt i gang en prosess for å skape en felles IT-plattform på tvers av alle departementene. Det er uvant for UD, som tradisjonelt har oppfattet sine behov som så spesielle at de må kjøre noe eget.

– Dette er en utfordring for oss. Hvordan fortsette å ha tilgang til vår egen informasjon og fortsette å utvikle på løsningen. Vi vet ikke hvordan den nye plattformen kommer til å se ut. Det er vanskelig å fremme våre krav og behov inn i den prosessen, sier Martinsen.

I verste fall kan en sentralisering av teknologiplattformen ta livet av løsningen, frykter de, og kommer med en aldri så liten brannfakkel.

– Digitalisering i departementene er teknologistyrt og ikke strategistyrt. Kunnskapsforvaltning som vi jobber med er ikke tatt med i det hele tatt, for fortsatt tror man at det handler om teknologi og teknologivalg. Det blir som om forskning skulle handlet om biblioteker, sier Ole-Martin Martinsen.

– Har et innovasjonsmandat

Seksjonen de jobber i består ikke av mer enn rundt 10 ansatte, pluss noen innleide konsulenter. De sitter i en bygning vegg-i-vegg med det langt mer kjente UD-bygget på Vika i Oslo sentrum.

Martinsen og Berget er stolte over å ha laget en informasjonsløsning for 2500 ansatte, som de mener kan endre hvordan UD jobber som organisasjon. Foto: Marius Jørgenrud
Martinsen og Berget er stolte over å ha laget en informasjonsløsning for 2500 ansatte, som de mener kan endre hvordan UD jobber som organisasjon.

Maskinlæringsprosjektet ble startet tidlig i 2018. De anslår at utviklingen hittil har kostet om lag 5-6 millioner kroner.

– Dette er et rimelig prosjekt i forhold til hva vi leverer, sier Martinsen, tydelig stolt over en løsning han mener fungerer så godt at de «burde ha solgt det» eller tilbudt det på det åpne markedet, hvis det hadde vært mulig.

Avdelingen beskriver seg selv også som en lab, som jobber med å se på hvordan de kan ta i bruk mulighetene som ligger i ny teknologi.

– Vi har et eget innovasjonsmandat og skal utforske mulighetene. Et annet prosjekt vi har kjørt handler om å hente mening ut fra sosiale medier, men jeg er usikker på hvor mye vi kan si om det. Ikke fordi det er så skummelt, men folk har meninger om det, sier Martinsen.

Powered by Labrador CMS