kunstig intelligens
Millioner av norske, håndskrevne dokumenter kan bli søkbare og enklere å lese
Å lese gamle, håndskrevne dokumenter er en jobb for spesialister, men nå arbeider forskere med å trene opp kunstig intelligens slik at disse dokumentene kan bli mer tilgjengelige.
Gamle, håndskrevne dokumenter finnes i store mengder fra flere århundrer tilbake. Både ved Høgskolen i Østfold, Nasjonalbiblioteket og Arkivverket arbeider forskere med å gjøre kunstig intelligens i stand til å forstå den bedre. Lykkes de, vil mer av norsk historie bli tilgjengelig for mange flere. Oppgaven er imidlertid svært kompleks.
Prosjektet Hugin-Munin, som ledes av førsteamanuensis Sukalpa Chanda ved Høgskolen i Østfold, har som formål å lage et system, basert på kunstig intelligens, som kan gjenkjenne historisk norsk håndskrift. Dette vil bli det første systemet i sitt slag.
Chanda forteller til Digi at prosjektets hovedmål er å lage et system som kan gjenkjenne historisk norsk håndskrift som systemet ikke har sett før, og som ikke er inkludert i treningen.
– Dette målet passer svært godt med Nasjonalbibliotekets rolle som et senter for kulturarvsdigitalisering, noe som inkluderer håndskriftsgjenkjenning, samt for norske gallerier, biblioteker, arkiver og museer, påpeker han.
Chanda forteller at det ikke finnes et slikt generelt håndskriftsgjenkjenningssystem for norsk i dag, til tross for at det har vært en rivende utvikling i kunstig intelligens, datalingvistikk og nevrale nett.
– Det finnes bare spesialiserte systemer som bare kan gjenkjenne håndskrift fra skribenter i treningssettet med tilstrekkelig kvalitet.
Samarbeid med Nasjonalbiblioteket
Andre Kåsen ved Nasjonalbiblioteket, som er involvert i arbeidet som samarbeidspartner, forteller at forskerne allerede har laget en modell som hvem som helst kan gå inn og teste. På denne siden kan man laste opp et bilde med gammel håndskrift, som så vil bli transkribert til latinske bokstaver.
Kåsen forteller at det er forskjellige typer vanskeligheter med et prosjekt av denne typen.
– Vi har mange eldre håndskrifter. Det er mye gammelt materiale med skader av forskjellige slag. Både lesing og bevaring er vanskelig, sier han.
Vanskeligheten knytter seg også til at håndskrifter både er forskjellige individuelt samtidig som de forandrer seg.
– Det er store variasjoner, også gjennom et livsløp. Håndskriften utvikler seg fra man er ung og i løpet av livet, sier Kåsen.
Han forteller at de allerede har laget en prototyp der man kan søke i håndskrevne brev og manuskripter.
– Sånn sett er prototypen allerede ferdig, og vi arbeider vi nå mot en dokumentert og velfungerende digitaliseringsløype før håndskrifter, forklarer Kåsen.
Prototypen inneholder så langt 20.000 dokumentsider og en AI-modell trent på i overkant av én million ord. Et system for automatisk transkribering vil gjøre de resterende delene av samlingen tilgjengelig.
– Vårt mål er ikke feilfrie transkripsjoner, men tekstgjenkjenning som gjør det mulig å søke i materialet og som kan brukes som lesestøtte ved siden av bildene, legger han til.
Samtidig er det andre vanskeligheter enn bare selve transkriberingen.
– Språkfaktoren spiller også inn. Vi må passe på at teknologien er tilpasset alle de språklige variasjonene som finnes i privatkorrespondanse – og før det begynte å komme rettskrivingsreformer på løpende bånd, sier Kåsen.
Han legger til at utviklingen av språket har fortsatt også etter unionsoppløsningen i 1905.
Mange millioner sider med håndskrift
Hos Arkivverket er man også opptatt av å ta i bruk kunstig intelligens i arbeidet med de enorme mengdene med håndskrevne dokumenter som finnes der. Avdelingsdirektør Kristin Jacobsen forteller til Digi at Arkivverket estimerer at de har så mye som to milliarder sider med historiske dokumenter. Det meste av dette er maskinskrevet, men det er beregnet at omtrent 600 millioner sider av dette er håndskrevet med ulike typer av håndskrift.
I mange tilfeller er det også lite av hver type håndskrift. Det er også et problem at mye av teksten står i skjemaer, og innholdet må hentes ut derfra.
– Ikke bare er hver håndskrift personlig, men håndskriftene forandrer seg også med tiden, spesielt over noen hundre år. Språket har jo også endret seg, og det kreves tolking og ikke bare transkripsjon, fremholder Jacobsen.
Middelalderdokumenter kan være lettere å lese, for håndskriften er veldig pen og endrer seg mindre fra person til person, men dokumentene er likevel ikke alltid så enkle å forstå.
– I middelalderen var det gjerne egne skrivere som skrev, men det ble skrevet på latin eller norrønt, og det er ikke så lett å forstå i dag. Vi må også tolke og forstå det, sier hun.
Ofte er det å tolke middelaldertekster en jobb for eksperter. Dermed er det flere trinn i det å lese og forstå gamle håndskrevne dokumenter.
Av det enorme materialet som bevares i Arkivverkets magasiner, er over 100 millioner sider digitalisert. Hun anslår at omtrent 25 millioner av dem er håndskrevne sider.
– Vi vet jo hva slags dokumenter dette er, men innholdet er ikke kjent, og det er vanskelig tilgjengelig, sier hun.
Hver side er fotografert, men uten transkribering må hvert bilde leses manuelt, noe som er tidkrevende og vanskelig.
Eget AI-team for håndskriftlesning
Avdelingsdirektøren ved Arkivverket tror det vil være en stor fordel om dette arkivmaterialet kunne bli tilgjengelig for mange flere, og hun forteller at de også har et eget team som jobber på området. AI-teamet og håndskriftskoordinatorer ved Arkivverket arbeider nemlig også med å trene opp kunstig intelligens til å lese håndskrevne dokumenter, sammen med fageksperter innen historie og arkiv.
– Vi ser på hvilke metoder og modeller som finnes der ute og hvordan vi kan bruke dem, sier Jacobsen. Ofte er det en kombinasjon av ulike modeller og teknikker som gir best resultat.
Hun tror en utvikling på dette området er noe alle kan ha nytte av og hilser prosjektet Hugin-Munin velkommen.
–Derfor satser vi også på dette selv. Jo flere som jobber med det, jo lengre kommer vi, forteller Jacobsen.
– Vi kommer til å jobbe med dette kontinuerlig framover. Det er et enormt stort materiale. Vi har også samarbeid med internasjonale miljøer om dette.
Samtidig understreker hun at det er et komplekst arbeid og det kan ta en stund før man får det til hundre prosent.
Ifølge Jacobsen bruker Arkivverket kunstig intelligens ikke bare til å lese og forstå gamle håndskrevne dokumenter, men også til blant annet å kategorisere innhold og automatisk sladde informasjon.
– Vi har en stor fordel og store ambisjoner for vårt arbeid med maskinell lesing av håndskrift, for vi har svært mye materiale, både dokumenter fra middelalderen, dokumenter med eiendomsinformasjon, gamle folkeregisterkort og mye mer, forteller hun.