kunstig intelligens

River seg løs fra Open AI: Dette er Microsofts første, egne KI-modeller

Avduket sine første to modeller.

En av Microsofts nye KI-modeller fokuserer på stemmegenerering og kan testes som en egen Copilot-funksjon.
En av Microsofts nye KI-modeller fokuserer på stemmegenerering og kan testes som en egen Copilot-funksjon.

Microsoft investerte store summer i Open AI og lånte mye av selskapets KI-teknologi. Siden den gang har Microsoft imidlertid trappet opp satsingen på egenutviklet KI, og nå de har et par nykommere å presentere.

På nettsidene sine avduket Microsoft nylig sine to første, egne KI-modeller, døpt MAI-Voice-1 og MAI-1-preview.

Den førstnevnte modellen er, som navnet antyder, beregnet på stemmegenerering. Det er imidlertid ikke en hvilken som helst stemmemodell, da Microsoft insisterer på at den er i stand til særs «uttrykksfulle» og naturlige stemmer.

Lager ett minutts audio på ett sekund

Ifølge Microsoft vil fremtidens interaksjon med KI-kompanjonger være stemmebaserte, og MAI-Voice-1 skal representere selskapets første, store bidrag i så måte.

Modellen skal operere med høy ytelse, og er i stand til å generere ett fullt minutt med audio på så lite som under ett sekund med én enkelt GPU. Microsoft påstår dette gjør modellen til en av de mest effektive i sitt slag på markedet i dag.

MAI-Voice-1 kan allerede testes ut som et Copilot Labs-eksperiment på denne siden, hvor man få stemmemodellen til å snakke i ulike stemmetyper og stiler ved hjelp av enkle tekstinstrukser.

Flere andre aktører jobber med KI-basert stemmegenerering, med litt ulik innfallsvinkel. Open AI har tidligere kunngjort et produkt kalt Voice Engine, en KI-modell som kan lage stemmer basert på korte lydklipp, men denne har ennå ikke fått en bred lansering på grunn av blant annet faren for misbruk.

I tillegg har Amazon utviklet en modell de kaller «Nova Sonic», en såkalt grunnmodell som kombinerer talegjenkjenning og talegenerering i én og samme modell. Amazon sa målet er å muliggjøre «menneskelignende» samtaler i sanntid i KI-applikasjoner.

Slipper også Chat GPT-konkurrent

Den andre modellen Microsoft lanserer, MAI-1, er en mer konvensjonell KI-språkmodell basert på den såkalte MOE-arkitekturen (mixture-of-experts). Det innebærer at modellen opererer med mange små «eksperter», og når man stiller et spørsmål, aktiveres bare de ekspertene som passer best til oppgaven – i stedet for alle på én gang.

Arkitekturen har den fordelen at datakraften utnyttes mer effektivt, og er også skalerbar ved at man kan utvide med stadig flere eksperter. Modellen er ellers trent på cirka 15.000 H100-brikker fra Nvidia, opplyses det.

– Denne modellen er designet for å levere kraftige ferdigheter til forbrukere som ønsker å dra nytte av modeller som spesialiserer i å følge instrukser og gi hjelpsomme svar på spørsmål i hverdagen, skriver Microsoft om den nye modellen.

MAI-1 skal rulles ut i løpet av de neste ukene i en tidlig testversjon og skal benyttes til bestemte oppgaver i Copilot. Tanken er å få tilbakemeldinger fra brukere som skal brukes til å forbedre og bygge modellen videre ut, og det er uvisst når den får en bred lansering.

Modellen er lagt ut på LMArena, en nettside som rangerer KI-modeller basert på blindtester og tilbakemeldinger fra brukere. Der ligger den i skrivende stund på en delt 15. plass med Googles potente Gemini 2.5 Flash, men et stykke bak toppmodellene fra Google, Open AI, Anthropic og Deepseek. Dette kan selvsagt endre seg etter hvert som modellen blir mer avansert.

Powered by Labrador CMS