sikkerhet

Google Magika blir åpen kildekode

Den skal ha vært betydelig bedre enn tradisjonelle metoder til å analysere innholdet av filer og finne ut om de er hva de utgir seg for å være.

Googles egne løsninger skal allerede bruke Magika til å sjekke hva filene egentlig er for noe, men nå kan også andre ta modellen i bruk i sine egne løsninger. Dette bildet er fra Googles kontor i Oslo.
Googles egne løsninger skal allerede bruke Magika til å sjekke hva filene egentlig er for noe, men nå kan også andre ta modellen i bruk i sine egne løsninger. Dette bildet er fra Googles kontor i Oslo.

Google har nylig kunngjort at de gjør Magika til åpen kildekode, slik at andre kan benytte løsningen til å sikre sine produkter og tjenester.

Magika er Googles maskinlæringssystem for å identifisere filtyper. Dette er selvsagt praktisk for enkle ting som for eksempel å vite hva man skal åpne en fil med, og hvordan den skal behandles.

Men det er også en helt vital del av å finne og identifisere skadevare som ofte utgir seg for å være noe annet enn det den faktisk er.

Hva er egentlig i filen?

Filtyper kan angis som en del av filnavnet - .exe, .txt, og så videre - eller som en del av selve filen i form av ulike typer «merkelapper» internt som beskriver hva slags fil det er.

Men alt dette kan forfalskes, slik at skadevare kan snike seg inn i systemet under dekke av å være en uskyldig fil. Og filene kan for den del også være 99% ufarlige, men ha en «blindpassasjer» som er et virus eller andre uhumskheter. Blant annet er det tidligere påvist at JPG-bildefiler kan bære med seg virus.

Så mye bedre mener Google at Magika skal være til å gjenkjenne ulike filtyper, uavhengig av hva filnavnet kan indikere. «n/a» betyr at løsningen ikke er i stand til å identifisere den filtypen. Foto: Google
Så mye bedre mener Google at Magika skal være til å gjenkjenne ulike filtyper, uavhengig av hva filnavnet kan indikere. «n/a» betyr at løsningen ikke er i stand til å identifisere den filtypen.

Det Magika - og andre løsninger - gjør, er å analysere filenes struktur, altså forsøke å gjennomlese filen og se om den finner noen kjente mønstre som kan angi hvilken filtype det egentlig er, uansett hva den gir seg ut for å være.

Maskinlæring

Fordelen med Magika, er imidlertid nettopp det at den er basert på maskinlæring. De andre eksisterende analysemetodene er ikke det, og er dermed kanskje litt raskere, men også langt mindre presist.

Magika bruker «Keras» til trening og «Onnx» til inferens. Keras skal ikke være større enn rundt 1 MB, og Onnx skal være rask nok til å gi svar på millisekunder, hevder Google i en bloggpost. Dette skal være nesten like raskt som en automatisert løsning som ikke er basert på maskinlæring, og samtidig langt mer presist.

Magikas presisjon er så god at den rager rundt 20 prosent bedre enn andre automatiske løsninger, skriver Google.

Der Magika ifølge Googles egne tall skal ligge på fra 89 til 99 prosent nøyaktighet, varierer andre mye brukte modeller fra å ikke kunne kjenne igjen visse filtyper i det hele tatt, til 100 prosent nøyaktighet.

Allerede i bruk på Googles egne løsninger

Magika brukes allerede til å sikkerhetssjekke Gmail, Google Drive og nettleserfilteret i Chrome. Ifølge Google skal det ha gitt dem et vurderingsgrunnlag på flere hundre milliarder filer på ukentlig basis, og fra det har de konkludert med at Magika tilbyr en forbedring i nøyaktighet på 50 prosent over de tradisjonelle metodene med spesiallagde kriterier for hver filtype. Ifølge Google skal denne økningen medføre at de kan sjekke 11 prosent flere filer enn før, og redusere andelen uidentifiserbare filer til rundt tre prosent.

Magika skal også være så lett å kjøre at den ikke krever egen KI-prosessor, men skal kjøre greit på en vanlig CPU, heter det.

Det finnes et web-grensenitt av Magika på Github, som lar deg sjekke filer fra din egen PC, og Digi tok en kjapp test av noen tilfeldige filer. Både når det gjaldt kjørbare filer, såvel som tekstfiler og ulike dokumentformater klarte Magica å identifisere filen riktig med 99 prosent oppgitt treffsikkerhet. Eneste tilfelle vi fant av en fil som ikke lot seg identifisere, var et lydopptak i AAC-format.

Powered by Labrador CMS