kunstig intelligens
Lanserte tre nye norske KI-språkmodeller som alle kan bruke
Viktig med norske språkmodeller som ivaretar norsk språk, holdninger, kultur og verdier, sier næringsministeren. Hun advarer mot å gjøre seg avhengig av utenlandske aktører som i mindre grad er opptatt av god norsk.
Onsdag 15. mai presenterte næringsminister Cecilie Myrseth de neste utgavene av NorLLM («Norwegian Large Language Models») i Schibsteds lokaler i Akersgata i Oslo.
Næringsministeren var tydelig på at det er viktig for både norsk næringsliv og offentlig sektor å være sikret at vi har en egen infrastruktur for kunstig intelligens.
– Det er all grunn til å tro at KI blir en sentral del av hverdagen til folk og bedrifter, på måter vi i dag fortsatt jobber med å finne ut av. Overlater vi dette til store utenlandske kommersielle aktører, vil det også gjøre oss avhengig av noen som i mindre grad er opptatt av god norsk.
Hun påpekte at god norsk stil handler om mer enn bare ordvalg.
– Modellene som lanseres i dag, er ikke bare bygget på solide norskspråklige kilder, de er også bygget med respekt for opphavsretten.
Og det er ikke bare språk og kildematerialet som er viktig: De nye modellene skal også i større grad passe med gjeldende normer og holdninger i Norge.
Nettopp dette uttalte også Nvidia-visedirektør Bea Longworth at Norge burde satse på, i et nylig Digi-intervju.
Dugnadsarbeid
– I dag er dere egentlig vitne til en milepæl i arbeidet med norske språkmodeller, sa Jon Atle Gulla i sin presentasjon.
Han er professor ved NTNU og direktør for NorwAI, og beskrev prosjektet som et ordentlig dugnadsarbeid fra fryktelig mange aktører i Norge. Både folk fra industrien, forskningsmiljøer og folk som sitter på store datamengder som kunne komme til nytte i treningen. Politisk har det også vært vist stor velvilje mot prosjektet.
Schibsted har blant annet stilt sitt arkiv til disposisjon, og i morgen signeres også en slik avtale med NRK, kunne NorwAIs folk fortelle.
Tre versjoner
NorwAI lanserte ikke mindre enn tre ulike versjoner, basert på forskjellige modeller.
NorwAI-Mistral-7B bruker den franskutviklede Mistral-arkitekturen, og skal ha 7 milliarder parametere. Tokenizeren skal være norsk, og har et vokabular på 67.993 ord. Det er viktig å merke seg at det ikke er kjent hvordan Mistral-arkitekturen ble trent i basen, og hvilket datasett som ligger i bunnen av den.
Kanskje derfor har NorwAI også valgt å lage en versjon basert på Metas Llama2-arkitektur. Denne heter NorwAI-Lama2-7B og har de samme 7 milliarder parametrene, og det samme vokabularet på 67.993 ord, men er videreutviklet fra en base med 2 milliarder tokens. Denne skal være basert på 89,7 prosent engelsk og 0,003 prosent norsk.
Disse to modellene skal ha et kontekstvindu på henholdsvis cirka 32.000 og 4096, og treningen har beslaglagt henholdsvis 24 og 23 dager på Idun-superdatamaskinen, med åtte stykk Nvidia H100 GPUer hver.
Disse har vært tilgjengelig for forskere og studenter en stund, men skal nå bli åpent tilgjengelig for allmuen.
Ny arkitektur
Den tredje modellen, NorwAI-Mixtral-8x7B, ble ferdigstilt samme dag som presentasjonen.
– Det er altså en helt ny arkitektur, der modellen har blitt splittet opp i ulike lag av eksperter, forteller Thaulow.
– Det har vist seg at dette er modeller som fungerer veldig raskt og effektivt i inferensen – altså når du spør modellen – men også har veldig effektiv opptrening. For første gang er en slik laget med en stor mengde norske data.
Og ytelsen skal være fremragende. Den skal blant annet på flere målinger ha slått Metas Lama-modell som har 70 milliarder parametere, forteller Thaulow.
– Denne modellen står ferdig i dag, og vil være tilgjengelig for nedlasting på Hugging Face.
Norsk språk og avklarte rettigheter
En av fordelene ved de nye modellene, er at man har kunnet være mer nøye med hvilket grunnlag de er trent på. Det norskspråklige grunnlaget for modellene er 51,15 milliarder tokens, eller 30,33 milliarder ord – hvorav norsk står for 60 prosent. Svensk er inne med 26 prosent, og dansk 11 prosent. Engelsk er kun representert med 2 prosent.
Av de 60 prosentene som er norsk, er dessverre hele 94,8 prosent bokmål (17,3 milliarder ord). Bare 5,2 prosent er nynorsk (952 millioner ord) og så lite som 0,004 prosent er samisk (0,68 millioner ord).
En annen viktig prioritering var at de nye modellene skulle ha avklart forhold til rettigheter til materialet de er trent på, og være så små at man kan kjøre dem lokalt, slik at de kan lastes ned, tilpasses og kjøres på lokal infrastruktur, sier Sven Størmer Thaulow fra Schibsted. Han er også styreleder i NorwAI.
Ikke NorGPT
NorwAI viste tidligere frem et norsk alternativ til ChatGPT på Arendalsuka, men denne kalles NorGPT og har sitt eget løp – den skal ikke erstatte eller overlappe med NorLLM. Planen er at arbeidet med NorGPT skal fortsette, og den skal i 2025 få totalt 40 milliarder parametere.