kunstig intelligens
Norsk selskap er i verdenstoppen på opprensking av lyd: – Jeg synes ingeniører gjør ting på veldig rare måter
Hance lager sine egne maskinlæringsmodeller for støyfjerning og opprensking av lyd. Digi ga dem en liten utfordring. Resultatet ser du i videoen nedenfor.
Et lite selskap i Oslo er ukjent for de fleste, men er verdensledende på å renske opp lyd.
De bruker sine egne KI-algoritmer og maskinlæringsbiblioteker for å fjerne støy fra lydopptak som ellers kanskje hadde blitt avskrevet som ubrukelige.
De kaller seg Hance og holder til i et loftslokale i de gamle industribyggene ved Akerselva i Oslo.
Når Digi er på besøk står det ennå bare Soundly på døren.
– Du kan godt si det slik at Hance sprang ut fra Soundly, sier Peder Jørgensen, som startet sistnevnte sammen med Christian Schaanning.
Digi har skrevet om Soundly før, og da spesielt historien om at de klekket ut ny programvare i fylla.
Hundre tusen lydklipp
Har du sett en Hollywood-film de siste årene, er sjansene gode for at du har hørt lyder fra akkurat Soundlys lydbibliotek.
– Når Brad Pitt åpner en dør i en Hollywood-produksjon, er det ikke usannsynlig at lyden av den kommer fra ett eller annet sted i Oslo.
Lydbiblioteket passerte nylig 100.000 lydklipp, og fortsetter å vokse jevnt og trutt. Når Digi er på besøk, har flere ansatte nettopp vært i Nord-Norge for å ta opp hvalsang.
Lydbibliotek
Men der Soundly skaffer til veie ønskede lyder, er Hance mer opptatt av å fjerne de uønskede. For eksempel støy, romklang, og så videre.
Og da trengs et lydbibliotek å trene KI-en på.
– Når det gjelder å rense opp lyd, vil nesten en hvilken som helst annen lyd effektivt utgjøre «støy». Fuglekvitter, for eksempel, kan være et stort problem for utendørsproduksjoner med mange scener og mye klipping.
Men med fuglekvitter av ulike slag i biblioteket, kan man trene datasettet på det og automatisk filtrere det ut av senere lydopptak der denslags bare er «i veien».
– Det er heller ikke slik at en lyd bare kan trenes på én gang. Jeg kan gjøre en masse mindre endringer på en eksisterende lyd, og slik lage en ny en.
En sammenligning kan være å trene en KI til ansiktsgjenkjenning. Ta et portrettbilde, men lag en versjon med briller, en med annen hårfarge, en med kortklipt hår, en med skjegg, og så videre. Alle disse kan man trene på, og slik kan det også gjøres med lyd.
– Et barn som skriker, skriker kanskje bare i en viss pitch, men jeg kan ta det skriket og justere og endre litt her og der, og få kanskje hundre ulike skrik ut av originalopptaket.
Sanntid
I praksis kan Hance da gjøre det samme som Peter Jackson gjorde da han laget «The Beatles: Get Back» for et par år siden.
Fra et enkelt opptak med for eksempel diverse vokaler og musikkinstrumenter, kan man nå som da benytte maskinlæring for å identifisere og skille ut hvert lydspor, for så å regulere dem uavhengig av hverandre.
Men i motsetning til Peter Jackson, kan Hance gjøre det i sanntid, selv på så enkle enheter som en Raspberry Pi.
Maskinlæringsmodellene Hance har laget, varierer i størrelse, og de spesialbygger også noen for kunder som har spesielle ønsker.
De minste modellene skal kunne kjøre fint i sanntid på selv små enheter med begrenset prosesseringskraft, men ytelsen skal likevel være nesten like god som med de større modellene, forteller Peder.
– De gjør ting på veldig rare måter
Noe av fordelen Hance har, mener Peder, er at de har god kjennskap til lyd og hvordan lyd fungerer rent praktisk, mens de fleste som tidligere har prøvd seg på noe lignende gjerne har vært ingeniører som har en veldig god forståelse av den tekniske delen av det.
– Men ingeniører og lignende har kanskje ikke like god forståelse for den «funksjonelle» delen av lyd, om du skjønner hva jeg mener. Jeg har lest masse teknisk dokumentasjon på dette, og synes de gjør ting på veldig rare måter.
Partnere og gründere, ikke ansatte
Hance har allerede fått en støtterunde fra Innovasjon Norge, og nå skal de søke om en runde til.
Pengene fra første runde ble brukt til å kjøpe lisenser på lydressurser, og å knytte til seg ytterligere kompetanse innen lyd og kunstig intelligens.
– Vi syntes jo det bare var gøy å sitte og klusse med algoritmene våre. Vi trengte en daglig leder som kunne stå litt på, og hjelpe oss med å kommersialisere selskapet.
Dermed ble Joote Hika ansatt for et halvt år siden. Det vil si, ansatt er han egentlig ikke – han er partner.
– Han skal egentlig ikke jobbe fulltid, men det hender jeg tror han jobber rundt 120 prosent, ler Peder.
Joote hever ikke lønn, men investerer seg inn i selskapet. Foruten ham, består Hance av to gründere, i tillegg til Peder:
Erling Hoff er i likhet med Peder utdannet lyddesigner fra Liverpool Institute of Performing Arts (LIPA), hvor de to opprinnelig møttes.
Til sist kommer Stian Aagedal som er utvikler, med utdanning fra universitetet i Karlsruhe. Også møtet mellom Stian og Peder var en tilfeldighet, kan Peder fortelle.
– Vi møttes to dager før Korona stengte ned hele landet i 2020, og fant bokstavlig talt tonen. Vi ble raskt enige om at vi måtte gjøre noe med maskinlæring og lyd.
– Det var egentlig opplagt. Stian er en racer på algoritmer, og Soundly har det store lydbiblioteket, så da gikk vi sammen og startet opp Hance.
– Det er Stian som har gjort kjempejobben med å programmere dette i C++ og han har en veldig god oversikt over hvordan dette funker. Jeg har jobbet med ham i tre år, men her kommer jeg fremdeles litt til kort. Jeg later som jeg forstår det når jeg snakker med ham, men ting går veldig fort over hodet på meg.
Forskningsprosjekt
Det neste for Hance, forteller Peder, er å komme i kontakt med en kringkaster for å se på muligheten til å utnytte teknologien for å gi hørselshemmede en bedre opplevelse av TV og film hjemme.
– Vi ønsker å kjøre et forskningsprosjekt på dette, siden vi allerede har teknologi som kan isolere stemmer og dialog fra resten av lydene i et opptak.
– Da kan vi også fremheve dem og gjøre dem tydeligere i sanntid, slik at det blir lettere for folk som har problemer med hørselen å oppfatte hva som blir sagt.
Og skrytevideoen som gjorde at vi ville snakke med Hance i utgangspunktet, finner du her.