artikler

Norge betaler for språkmodeller trent på aviser

De første gratis, norskutviklede språkmodellene på bokmål og nynorsk er lansert. Prosjektet har vært mye stanging av «hue i veggen».

Opphavsrettsbeskyttet tekst fra norske aviser brukt i både grunntrening og fintrening av språkmodeller på bokmål og nynorsk. Wilfred Østgulen, IT-direktør i Nasjonalbiblioteket forteller hvordan de har utviklet språkmodellene. I første rekke kultur- og likestillingsminister Lubna Jaffery og digitaliserings- og forvaltningsminister Karianne Tung.
Opphavsrettsbeskyttet tekst fra norske aviser brukt i både grunntrening og fintrening av språkmodeller på bokmål og nynorsk. Wilfred Østgulen, IT-direktør i Nasjonalbiblioteket forteller hvordan de har utviklet språkmodellene. I første rekke kultur- og likestillingsminister Lubna Jaffery og digitaliserings- og forvaltningsminister Karianne Tung. Eirik Helland Urke

Det som er spesielt med den nye språkmodellen i Nasjonalbibliotekets Borealis-serie, er at den er trent opp ved hjelp av opphavsrettsbeskyttede data fra norske aviser. Regjeringen har over statsbudsjettet bevilget penger til å betale for denne bruken.

Digitaliseringsminister Karianne Tung, kultur- og likestillingsminister Lubna Jaffrey og Heather Broomfield i KI Norge tror Norge er først i verden med å gjøre det på akkurat denne måten. Senere skal også en modell for samiske språk leveres.

Karianne Tung understreket at det nå er på tide å gå fra testing til å ta i bruk kunstig intelligens. Hun mener både sykehus, politiet og norske bedrifter nå får et verktøy for å ta i bruk kunstig intelligens på norsk. Resultatet skal bli bedre tjenester.

Hue i veggen

IT-direktør Wilfred Østgulen i Nasjonalbiblioteket sa at prosjektet har vært mye stanging av «hue i veggen», eller prøving og feiling. Han beskrev en prosess som skiller seg fra tradisjonell programvareutvikling.

– Vi har hatt få svar på forhånd. Mer håndverk og magefølelse enn ingeniørfag, egentlig. Det eneste vi vet helt sikkert er at vi bruker opp all regnekraften vi har, for vi kan ikke sjekke resultatet før modellene er ferdige, sa Østgulen.

Han forteller at modellene som nå blir tilgjengelige kan kjøres lokalt i det datamiljøet man ønsker, enten det er på en bærbar datamaskin eller i en skytjeneste.

At et forholdsvis lite IT-miljø kan bygge slike språkmodeller skyldes at de benytter de store språkmodellenes erfaringer, i dette tilfellet Google-løsninger til treningen. Men løsningene mates med retningslinjer for atferd for å skape norske språkmodeller som er gode for norske virksomheter.

– Det vi ser når vi trener modellene på godt kuraterte data, som er gode på norsk, er at dette gir oss suverenitet. Vi vet hva de er trent på, sier Østgulen.

Ideen er å bygge språkmodellene inn i andre løsninger, som komponenter.

IT-direktør Wilfred Østgulen i Nasjonalbiblioteket sier deres 14-15 årsverk er lite kapasitet for å jobbe med språkmodeller, og at det også er utfordrende å få tilgang til nok GPU-kapasitet. Foto: Eirik Helland Urke
IT-direktør Wilfred Østgulen i Nasjonalbiblioteket sier deres 14-15 årsverk er lite kapasitet for å jobbe med språkmodeller, og at det også er utfordrende å få tilgang til nok GPU-kapasitet.

Bygger KI-kunnskap

IT-sjefen trekker også fram en annen effekt av arbeidet de har gjort:

– Vi skaper også systemisk en evne for å forstå dette fagområdet. Mange som vet vi jobber med dette kommer til oss og spør hvordan vi jobber. Vi blir et kompetansesenter.

Sammen med universitetene skaffer Nasjonalbiblioteket seg kompetanse fra arbeidet med språkmodellene som gjør at Østgulen mener landet vil kunne lage modeller fra bunnen av. Det er først og fremst kapasiteten til å gjøre et slikt arbeid det skorter på, forklarer han. Og da snakker han både om kapasitet i form av mennesker og tilgang til KI-utstyret, altså GPU-er.

Østgulen forteller at de i stigende grad har brukt superdatamaskinen Olivia i arbeidet med språkmodellen. Det sier han er en enkel teknologi å bruke.

– Vi trenger å følge med på utviklingen, og ikke få teknologiske overraskelser. Det vil vi helst ikke oppleve som nasjon, sier Østgulen.

Han sier til Digi at han forventer at de vil lage nye modeller kanskje en gang i halvåret. Foreløpig er arbeidet deres teknologidrevet, men han forventer at tilbakemeldinger fra brukerne vil påvirke hvordan fintreningen av modellene vil skje.

Og lurer du på når de nye språkmodellene er klar til bruk, forteller presseansvarlig Nina Mari Bræin i Nasjonalbiblioteket at den første modellen er ferdig trent.

IT-direktør Wilfred Østgulen i Nasjonalbiblioteket fortalte en tydelig fornøyd digitaliserings- og forvaltningsminister Karianne Tung om arbeidet med en norsk språkmodell trent på opphavsrettsbeskyttet materiale. Foto: Eirik Helland Urke
IT-direktør Wilfred Østgulen i Nasjonalbiblioteket fortalte en tydelig fornøyd digitaliserings- og forvaltningsminister Karianne Tung om arbeidet med en norsk språkmodell trent på opphavsrettsbeskyttet materiale.

– På grunn av ferieavvikling gjenstår noen oppgaver rundt evaluering og dokumentasjon som må fullføres før den legges ut i neste uke. Modellene vil legges ut på Hugging Face, sier Bræin til Digi.

Alle vil kunne laste ned og bruke modellene, både enkeltpersoner, og private og offentlige virksomheter.

Powered by Labrador CMS