kunstig intelligens
Google viser ny KI-teknologi: Kan lage realistiske videoer med enkle tekstkommandoer
Skal være mer avansert enn andre løsninger, hevder selskapet.
Den raske utviklingen innen generativ kunstig intelligens har allerede gitt oss både tekstgeneratorer og bildegeneratorer som kan lage innhold med enkle, tekstbaserte instrukser.
Nå har Google presentert en ny KI-teknologi som også kan produsere svært realistisk video med enkle instrukser. Det rapporterer blant andre Ars Technica.
Ny metode
«Lumiere» er navnet på Googles nye KI-baserte videogenerator, som er designet for å generere korte videoer på fem sekunder til ulike bruksområder.
Det finnes riktignok andre KI-baserte videogeneratorer der ute, men Google bedyrer at deres metode, som beskrives i teknisk detalj i dette forskningsdokumentet, representerer et betydelig fremskritt innen realisme.
Lumiere er laget for å generere videoklipp både fra stillbilder og tekst, og i tillegg kan teknologien også brukes til å redigere eksisterende videoer på ulike, kreative måter.
Modellen kan også benyttes til å animere bestemte regioner av et stillbilde, som definert av brukeren selv. Den kan attpåtil «fylle inn» animerte regioner av en video som er tildekket i originalvideoen.
Google har vedlagt en rekke eksempelvideoer i alle de ovennevnte kategoriene, og resultatet må sies å være overbevisende.
Selskapet sier i forskningsdokumentet at de har trent Lumiere-modellen på 30 millioner eksisterende videoer med en lengde på fem sekunder og 16 bilder per sekund. Det er uvisst hvor Google har hentet videoene fra, da dette ikke er presisert av selskapet.
Klar over faren
Denne type teknologi er selvsagt alltid å fare for å bli utnyttet på manipulativt vis av ondsinnede aktører, for eksempel til «deepfake»-svindel, og dette er også noe Google er klar over.
– Vårt hovedmål med dette arbeidet er å sette uerfarne brukere i stand til å generere visuelt innhold på en kreativ og fleksibel måte. Det finnes imidlertid en risiko for misbruk ved å lage falskt eller skadelig innhold med vår teknologi, og vi tror det er avgjørende at det utvikles og iverksettes verktøy for å oppdage fordommer og ondsinnede brukstilfeller for å sikre trygg og rettferdig anvendelse, skriver Google.
Enn så lenge er Lumiere kun på forskningsstadiet, og det er uvisst når modellen eventuelt blir tilgjengelig for vanlige brukere, og på hvilken måte.
Google er ikke alene om teknologien. Blant øvrige aktører som har forsøkt seg på tekst-til-video-teknologi tidligere er Facebooks moderselskap Meta, som i 2022 lanserte Make-a-Video – en KI-modell som lager korte videoklipp av ledetekster.