kunstig intelligens
Glem språkmodeller: Verdensmodeller er KI-industriens nye frontlinje
Det tyske oppstartsselskapet Spaitial vil ta opp kampen med tekgigantene.
Selskapets teknologi kan skape en interaktiv 3D-verden ut fra en tekstprompt.
Spaitial utvikler for tiden en SFM, eller en romlig grunnmodell (spatial foundation model). I motsetning til verktøy som Sora eller Veo lager Spaitial en KI-modell, kalt Echo, som ikke bare genererer bilder av en scene, men en sammenhengende 3D-representasjon som kan utforskes og redigeres.
Med en tekstprompt eller et bilde kan Echo generere et 3D-miljø der brukeren kan bevege kameraet fritt og få nye visninger der alt henger sammen.
Ifølge selskapet forutsier Echo «en 3D-scene som bygger på geometri i metrisk skala». Teknologien fungerer dessuten i en nettleser, uten krav til kostbar maskinvare.
Har hentet rundt 130 millioner kroner
Spaitial hentet inn rundt 130 millioner kroner i en finansieringsrunde i mai, og Echo ble lansert 15. desember.
Medgründer Matthias Niessner, professor ved det tekniske universitetet i München, er tidligere beskrevet som «en av Europas mest fremtredende forskere innen KI for 3D-modeller».
Hans forrige selskap, KI-avatarutvikleren Synthesia, ble tidligere i år verdsatt til 21 milliarder kroner.
I grunnleggerteamet finner vi også Ricardo Martin-Brualla og David Novotny, med erfaring fra henholdsvis Google og Meta.
Gammelt begrep i ny drakt
Verdensmodeller har blitt et mye brukt begrep det siste året, men mangler en tydelig definisjon.
Opprinnelig – begrepet ble introdusert allerede på 1940-tallet – beskrev det en mental modell som kan forutsi hvordan et miljø endres, inkludert hva som skjer dersom en aktør utfører en bestemt handling.
Det kan sammenlignes med et slags planleggingsverktøy. Vi mennesker bruker stadig slike mentale representasjoner av verden som forberedelse på framtidige hendelser.
I dag brukes begrepet også om generative modeller som skaper troverdige og sammenhengende miljøer over tid. Håpet er at KI-modeller skal få bedre forståelse av hvordan virkeligheten fungerer – med fysiske lover, objektkonstans og årsakssammenhenger.
Spaitials teknologi hører foreløpig mest hjemme i den sistnevnte kategorien, men selskapets ambisjon er at Echo etter hvert skal få evne til å resonnere om de genererte 3D-verdenes dynamiske og fysiske egenskaper.
Ifølge selskapet skal modellen da kunne brukes til interaktive simuleringer, robottesting og «rikere applikasjoner» for digitale tvillinger.
Allerede nå kan teknologien tenkes å være interessant for 3D-design og virtuelle miljøer, for eksempel innen AR og VR.
Interessen for verdensmodeller har økt kraftig det siste året og har ført til flere oppsiktsvekkende investeringsrunder:
World Labs, grunnlagt av AI-pioneren Fei-Fei Li, hentet i fjor inn drøyt 2,3 milliarder kroner for å utvikle det selskapet kaller LWM (large world models).
Google Deepmind satser
I november i år ble det kjent at en annen AI-pioner, Yann LeCun, forlot stillingen som AI-sjef i Meta for å starte sitt eget selskap, AMI (Advanced Machine Intelligence), i Paris.
LeCun har lenge snakket om og arbeidet med verdensmodeller som minner om den opprinnelige definisjonen av begrepet. Ifølge LeCun er det ikke mulig å oppnå kunstig generell intelligens (AGI) bare ved å skalere opp språkmodeller.
Mange av de store teknologiselskapene satser også på verdensmodeller, blant dem Google Deepmind.
I en episode av selskapets podkast, publisert 16. desember, sa sjefen Demis Hassabis at språkmodeller «ikke er tilstrekkelige» for AGI.
Google Deepmind arbeider for tiden med verdensmodellen Genie, som kombineres med agenter og simuleringer.
Artikkelen ble først publisert på Ny Teknik for deres abonnenter. Den er tilgjengelig på norsk for Digis abonnenter gjennom vår samarbeidsavtale.