kunstig intelligens

Nasjonalbiblioteket: Lovende resultater med kunstig intelligens som digital bibliotekar

Arrangerte egen AI-konferanse i Oslo.

Nasjonalbibliotekets satsing på kunstig intelligens og maskinlæring er liten, men framgangsrik. Bildet er fra en tidligere anledning.
Nasjonalbibliotekets satsing på kunstig intelligens og maskinlæring er liten, men framgangsrik. Bildet er fra en tidligere anledning.

Kunstig intelligens og maskinlæring er noe representanter for nær sagt alle bransjer er opptatt av, og biblioteksektoren er intet inntak.

I samarbeid med Stanford University Libraries, og i forbindelse med science fiction-utstillingen Fantastiske Fremtider, arrangerte derfor Nasjonalbiblioteket denne uken det som skal ha vært den første internasjonale konferansen om kunstig intelligens og maskinlæring i biblioteksektoren. Deltakere fra blant annet 80 av de største kulturinstitusjonene i verden skal ha deltatt.

Digital bibliotekar

Noe av den viktigste årsaken til at konferansen er lagt til Norge, er trolig arbeidet Nasjonalbiblioteket har gjort innen kunstig intelligens og da spesifikt den digitale bibliotekaren «Nancy».

Nancy er oppkalt etter den verdensberømte bibliotekaren Nancy Pearl, som til og med har sin egen actionfigur.

Arbeidet med Nancy har pågått i to år, men har utgangspunkt i beslutningen Nasjonalbiblioteket tok i 2005 om å digitalisere alt det har av materiale. Som digi.no tidligere har omtalt, har dette arbeidet kommet svært langt, selv om mye fortsatt gjenstår.

Arbeidet med Nancy ledes av Svein Arne Brygfjeld, som tidligere ledet utviklingen av nettbiblioteket til Nasjonalbiblioteket.

Brygfjeld var derfor blant foredragsholderne under konferansen. Han fortalte at Nasjonalbibliotekets KI-lab (Kunstig Intelligens) primært driver med eksperimenter i liten skala, men det allerede er innlysende at bruken av kunstig intelligens og maskinlæring passer svært godt sammen.

– Det vil endre ganske mye både når det gjelder hvordan vi gjør ting, og hva vi gjør, sa Brygfjeld.

– Vi går fra data til kunnskap. Vi kommer til å vite mer om innholdet, i tillegg til å metadataene om materialet vi har, fortsatte han.

«Godt nok»

Brygfjeld oppsummerte betydningen av maskinlæring som det å gå fra veldig forutsigbar programmering til en kontekst hvor ting er mer omtrentlige, læring basert på erfaring.

– Det opererer innenfor rammene av «godt nok», noe som er skremmende for et bibliotek, påpekte han.

Svein Arne Brygfjeld leder Nasjonalbibliotekets kunstig intelligens-lab. Foto: Harald Brombach
Svein Arne Brygfjeld leder Nasjonalbibliotekets kunstig intelligens-lab.

KI-laben trener Nancy med en kombinasjon av innhold og metadata. Dette gjør at den kunstige intelligensen lærer å klassifisere blant annet bøker og vitenskapelige artikler, blant annet etter det mye brukte systemet Deweys desimalklassifikasjon.

Ifølge Brygfjeld kunne Nancy i begynnelsen klassifisere artiklene med 70 prosents nøyaktighet. Etter hvert økte nøyaktigheten til over 90 prosent, og i enkelte tilfeller også til 100 prosent.

– Det er like godt som enhver bibliotekar, sa han.

Har et ansvar

Brygfjeld sa videre at digitale biblioteker er perfekte lekeplasser for å drive med kunstig intelligens.

– Vi har god forståelse for domenet, altså biblioteket, vi har et samfunnsansvar og masse data. Dessuten har vi nå programvare som er god nok, billig nok og som fungerer godt. Det vil si programvare som det er mulig for oss å bruke, uten å være eksperter på kunstig intelligens, sa Brygfjeld.

KI-laben har brukt Googles API-er for maskinlæring for å se hva de kan få til innenfor rammen av å lage et digitalt bibliotek basert kun på maskinlæring og definert innhold. I tillegg til mer tradisjonelle tjenester som optisk tegngjenkjenning (OCR), benyttes Google-tjenester for bildegjenkjenning, videoanalyse og tale til tekst.

Relasjoner

I et utvalg bestående av ulike typer innhold, har Nancy blitt bedt om finne personer, steder, organisasjoner og til en viss grad relasjoner, uten at metadata er tilgjengelige. Stedene geolokaliseres, slik at de kan finnes igjen på et kart.

Blant det som da kan bli mulig, er å finne fram til en uttalelse som en person sa i et tv-program, eller å finne hvilke relasjoner det er mellom for eksempel to personer eller en person og et sted, for eksempel ved å se hvor begge opptrer i den samme konteksten.

– Vi har lært at kunstig intelligens og biblioteker er en perfekt match. Kunstig intelligens kommer til å gjøre biblioteker til framtidsbiblioteker, sa Brygfjeld.

Anbefalinger til lånerne

Nasjonalbiblioteket er ikke alene om disse tankene. Danske DBC (Dansk BiblioteksCenter) har eksperimentert med maskinlæring siden 2011. Det fortalte Christian Boesgaard, som er chief data scientist ved senteret, under et separat foredrag.

Christian Boesgaard er dataviter ved Dansk BiblioteksCenter. Foto: Harald Brombach
Christian Boesgaard er dataviter ved Dansk BiblioteksCenter.

DBC eksperimenterer med maskinlæring i forbindelse med anbefaling av bøker, ikke så ulikt det aktører som Netflix og YouTube gjør med videobasert innhold.

Boesgaard fortalte om flere mulige tilnærminger til dette og hva som kan brukes av data. For helt nye bøker vil metadata være det mest aktuelle, men DBC har også sett lovende resultater knyttet til sammenligning av forsiden til bøkene, altså om bøkene ser nokså like ut.

Tekstanalyse er en mulighet, men det er ikke trivielt, ifølge Boesgaard.

For bøker som allerede har blitt utlånt og lest en del, vil brukerdata fra for eksempel utlån og sosiale medier, som «likes», rangering og anmeldelser, også kunne brukes.

Ved hjelp av vektordata med kanskje hundre dimensjoner for hver bok, kan man finne ut hvor like eller forskjellige bøker er. Boesgaard kaller dette for avstanden mellom bøker.

– Ikke undervurder kraften i brukerfeedback. Det kan være bedre enn selv kvalitetsmetadata i tilsvarende søk, sa Boesgaard.

Det ble også holdt flere foredrag om bruk av kunstig intelligens og maskinlæring innen forskning.

Bedre ordbøker

Barbara McGillivray, en spesialist på klassiske språk ved The Alan Turing Institute, University of Cambridge, fortalte at kunstig intelligens blant annet vil kunne brukes til å lage bedre ordbøker. For eksempel har mange ord har ulik betydning, avhengig av kontekst eller sjanger. I tillegg skjer det at ord over tid både får nye betydninger og mister gamle.

Barbara McGillivray er både matematiker og ekspert på utdødde språk. Foto: Harald Brombach
Barbara McGillivray er både matematiker og ekspert på utdødde språk.

– Tidligere betydde «to follow» bare å gå bak noen. Med sosiale medier har det fått en ny mening. Som ordbokforfatter bruker du intuisjonen til å komme med eksempler som beskriver atferden til et ord. Som leser vil du vite hvordan disse eksemplene er valgt, hva som er mest vanlig og hvilke faktorer som endrer atferden, sa McGillivray.

– Ved å gi alt dette til en datamaskin, kan den hente ut den informasjonen vi er interessert i. Ved hjelp av syntaktisk analyse. Vi vil fortsatt lage fortsatt ordbøker, men på en ny måte fordi vi har fullstendig oversikt over dataene, inkludert statistikk, sa hun.

Miljøarkeologi

Det siste av foredragene digi.no overvar, ble holdt av Krish Seetah, miljøarkeolog og universitetslektor ved Stanford University. Han forsker blant annet på bakgrunnen for malariaepidemiene på øya Mauritius og hvilken betydning klimaendringer kan ha hatt. Han bruker kunstig intelligens til å forutse sykdommer, både i framtiden og fortiden.

– Med kunstig intelligens kan man se på malaria og temperatur i et større perspektiv, sa Seetah.

Krish Seetah er miljøarkeolog ved Stanford University. Foto: Harald Brombach
Krish Seetah er miljøarkeolog ved Stanford University.

Mauritius var ubebodd fram til 1500-tallet, så det fantes nødvendigvis ikke menneskelig malaria der før den tid. I 1867 omkom rundt 40 000 mennesker på øya, over ti prosent av befolkningen, i en malariaepidemi. Hvorfor skjedde dette voldsomme utbruddet akkurat da? Hadde dette noe med menneskelig atferd å gjøre? Dette er blant spørsmålene Seetah forsøker å svare.

Enorme datamengder

For å finne svar på dette, henter han data fra svært mange kilder, blant annet skipslogger, karanteneinformasjon, DNA-rester på gravsteder, historiske endringer i blant annet temperatur, noe som påvirke visse typer bånd som finnes i koraller. I tillegg kommer fakta som at Mauritius har vært under både nederlandsk, frank og britisk styre, at slaveriet tok slutt under det briske styret, noe som førte til betydelig befolkningsvekst på øya som stod for mer enn 10 prosent av verdens sukkerproduksjon.

Disse datasettene er til sammen både store og komplekse.

– Vi har valgt å bruke AI til å håndtere dette. Vi har datasiloer hvor vi vil se etter mønstre innen og teste dataene, for å finne ut hvilke hendelser som førte til ting, sa Seetah.

Malaria er fortsatt en alvorlig sykdom som mange hundre tusen dør av hvert år. Det finnes ingen effektiv vaksine.

Et opptak fra konferansen er tilgjengelig her.

Leste du denne? Nasjonalbiblioteket må på Ebay for å skaffe utstyr til digitaliseringen

Powered by Labrador CMS