nettverk og infrastruktur
Menneskehjernen er inspirasjon når det skal utvikles nye KI-brikker
Veien til mer energieffektive brikker kan være å fjerne det klassiske skillet mellom prosessor og hukommelse og la seg inspirere av hjernens struktur.
Kunstig intelligens er en enorm energisluker. I en kommentar i det vitenskapelige tidsskriftet Joule har den nederlandske forskeren Alex de Vries nylig r3gnet eg frem til at verdens totale strømforbruk ved bruk av kunstig intelligens i 2027 kan komme opp i 134 terawattimer per år – som omtrent tilsvarer Nederlands totale strømforbruk i dag.
Anslaget er svært usikkert, så man bør ikke henge seg for mye opp i det nøyaktige tallet, men det er sikkert og visst at kunstig intelligens krever mye energi – enda mer enn andre former for elektronisk databehandling – og dette er et reelt problem.
MAC og MMA
Når kunstig intelligens er energikrevende, er det blant annet fordi den i stor grad er basert på omfattende beregninger etter multipliser og adder-prinsippet kjent som MAC (multiply-accumulate) eller MMA (matrix multiply-accumulate).
Multiplikasjoner og spesielt matrisemultiplikasjoner er svært krevende for datamaskiner å utføre, sammenlignet med addisjon.
Når markedsverdien til brikkeprodusenten Nvdia har tidoblet seg på tre år til i overkant av 1000 milliarder dollar, er det fordi selskapet leverer de brikkene som i dag kan utføre slike oppgaver mest effektivt og raskt.
Det siste tilskuddet fra Nvidia – H100 med 80 milliarder transistorer produsert i Taiwan med markedets mest avanserte produksjonsteknologi i form av såkalt 4 nm-teknologi – er designet akkurat for MMA-beregninger.
Brikken er ikke billig, enhetsprisen er rundt 30.000 dollar – drøyt 330.000 kroner. Ifølge den amerikanske investeringsbanken Raymond James koster den bare en tidel å produsere. Så Nvidia nærmerst skyfler inn penger. Dette forklarer selskapets enorme markedsverdi.
Hjernen er effektiv
Det forskes ivrig på å optimalisere dagens design slik at brikkene blir mer energieffektive, og samtidig går en lang rekke forskere og bedrifter helt nye veier for å utvikle brikker med mindre energiforbruk.
De lar seg blant annet inspirere av hvordan hjernen lagrer informasjon og gjør beregninger og prøver å gjenskape noen av de samme prinsippene i silisiumkomponenter. For med et strømforbruk på 12 watt er den menneskelige hjernen en ekstremt effektiv datamaskin når det gjelder energi – Nvidia H100 kan bruke opptil 700 watt!
Et av disse selskapene er IBM, som på Hot Chips 2023-konferansen i California i august lanserte en ny prosessor kalt NorthPole.
I en artikkel i Science har IBM-forskerne, med Dharmendra S. Modha i spissen, beskrevet hvordan denne brikken skiller seg fra forgjengeren TrueNorth fra 2014.
Navnene er ikke tilfeldig valgt. I tillegg til å bety retningen til den geografiske nordpolen i motsetning til magnetisk nord, er True North også et uttrykk for å være på rett kurs mot et veldefinert mål.
Modha har selv forklart at han på en helt bestemt dag, 16. juli 2004, satte seg fore å revolusjonere dataindustrien ved å utvikle en hjerneinspirert datamaskin. Han har forfulgt det målet siden.
Første steg var TrueNorth med 5,4 milliarder transistorer og med en arkitektur som tilsvarer en hjerne med én million nevroner og 256 millioner synapser. Til sammenligning har den menneskelige hjerne ca. 100 milliarder nevroner og mer enn 100.000 milliarder synapser.
Navneinspirasjon fra IBM
Også hovedideen om hvordan man kan forbedre TrueNorth har Modha spesifisert til en bestemt dag, 30. mai 2015. Tre år senere gikk gruppen hans seg veldig lavt. De avsto fra å publisere og holdt ideene tett inntil seg. Inntil nå.
Med intern støtte fra IBM og en kontrakt fra det amerikanske forsvarsdepartementet har de lyktes i å oppnå det Modha selv beskriver som en Inorganic Brain-inspired Machine (uorganisk hjerne-inspirert maskin – et navn som nok er valgt fordi det har en godt egnet forkortelse på tre bokstaver!
Når brikken har fått det offisielle navnet NorthPole, kan det sees på som en indikasjon på at målet nå er nådd. Det er i hvert fall ikke mulig å komme lenger nord etter Nordpolen.
Det er imidlertid neppe endestasjonen.
Modha tillater seg å bruke Winston Churchills kommentar etter de første britiske seirene over de tyske styrkene i november 1942: «Dette er ikke slutten. Det er ikke engang begynnelsen på slutten. Men det kan være slutten på begynnelsen.»
I IBMs offisielle pressemelding står det at brikken er produsert i 12 nm-teknologi, mens Nvidia H100 altså er produsert i 4 nm-teknologi. Neste generasjon, kalt 2 nm-teknologi, forventes å bli innført i 2024/2025.
Det vil derfor være mye å vinne på å bruke NorthPole-arkitekturen med mer avansert produksjonsteknologi.
Von Neumanns flaskehals
Det helt avgjørende steget for både TrueNorth og NorthPole er at de bryter med den såkalte von Neumann-arkitekturen.
Den har vært grunnlaget for dataindustrien helt siden de første elektroniske datamaskinene ble bygget etter slutten av andre verdenskrig – etter prinsippene beskrevet av John von Neumann i et utkast til en aldri fullført rapport i 1945.
Både i de første elektronrør-datamaskinene og i dagens PC-er er det, som John von Neumann beskrev, et klart skille mellom minne og beregninger. Dette betyr at prosessoren selv hele tiden må hente og lagre informasjon og data i dedikerte minnekretser.
Dette prinsippet har vist seg svært velegnet for kompliserte beregninger hvor resultatet skal være kjent med stor nøyaktighet.
I andre sammenhenger – inkludert kunstig intelligens – kan denne inndelingen gi opphav til en form for forstoppelse eller en såkalt von Neumann-flaskehals i utvekslingen av data mellom beregningselementet og minneelementer.
Det fungerer ikke hvis systemet f.or eksempel må handle svært raskt, slik tilfellet for eksempel er for en selvkjørende eller en halvautomatisk bil som må reagere på input den får fra kameraer eller sensorer. Er det kameraene og sensorene oppdager, bare en ufarlig gjenstand – som en papirpose som flyr over veien – eller er det et barn?
Å bestemme innholdet i et bilde kalles inferens.
Hvis datasystemet skal utføre denne oppgaven raskt, er ikke en sentral prosessor og tilhørende von Neumann-flaskehalser optimalt. Beregningen må så å si utføres på «kanten» nær kilden. På fagspråk kaller man det edge inference. Når Nvidia-prosessorene er etterspurt, er det fordi de er bedre til dette enn tradisjonelle CPU-er som vi kjenner fra PC-er.
NorthPole-brikken er optimalisert for edge inference. Det betyr at minne og beregninger er ganske jevnt fordelt over hele brikken med 256 kjerner, som både inneholder data og kan utføre beregninger. De er koblet til hverandre på kryss og tvers.
Sett fra innsiden er det snakk om minne tett på beregning. Sett fra utsiden er dette en form for aktiv hukommelse. Man leser data inn på brikken og leser deretter ut resultatet.
Sammenlignet medTrueNorth er det blant annet det interne nettverket som forbinder de mange kjernene, som gjør NorthPole beregningsmessig 3000 ganger mer effektiv enn forgjengeren, til tross for at de 22 milliarder transistorene bare er fire ganger så mange som i forgjengeren.
Det finnes en rekke standardtestdata man kan bruke til å sammenligne ulike systemer med.
Ved å bruke disse testdataene er NorthPole 25 ganger mer energieffektiv enn andre systemer basert på samme halvlederteknologi (12 nm teknologi). Den er fem ganger mer effektiv når det gjelder areal og 22 ganger bedre når det kommer til latency, eller forsinkelse.
«NorthPole utkonkurrerer alle mye brukte arkitekturer, selv de som bruker mer avanserte teknologier», skriver Modha og de andre IBM-forskerne i sin forskningsartikkel.
Analogt kan være bedre
NorthPole er på mange måter en bemerkelsesverdig prosessor, bemerker Subramanian S. Iyer og Vwani Roychowdhury fra University of California, Los Angeles (UCLA) i en kommentar i Science.
De fester seg blant annet ved at brikken, arkitekturen og programvaren er optimalisert for edge inference og at den kan produseres med standard halvlederteknologi.
«Siden NorthPole er et digitalt system, er det heller ikke plaget av støy og drift som analoge systemer», skriver de.
De peker på at den kan være egnet for bruk i selvkjørende biler eller i forbindelse med KI-systemer i fly og militære kjøretøy. De legger imidlertid til at det er et problem at strømforbruket ved oppskalering til større KI-systemer fortsatt vil være relativt høyt.
De viser til at et alternativ med lavere strømforbruk kan være såkalte CIM-systemer (computer in memory) – et område de to forskerne forøvrig selv har forsket på.
CIM er tilgjengelig i både analoge og digitale utgaver.
De to UCLA-forskerne påpeker at ikke minst analoge systemer kan være interessante for multiply-accumulate-beregninger. Med Ohms lov kan man utføre multiplikasjon direkte, siden strømstyrken er produktet av ledningsevne og en påført spenning. Det er også enkelt å legge til strømstyrke.
Veien mot Nordpolen
Det er imidlertid fortsatt en del problemer som må løses, både når det gjelder digital og analog CIM, før disse metodene kan tas i bruk i praksis.
«Innovativ brikkearkitektur og digitale tilganger, som beskrevet av Modha, vil spille en viktig rolle på kort sikt i utviklingen av edge inference i mindre systemer. Analoge tilnærminger kan til slutt bringe sanntids KI til håndholdte enheter», konkluderer Iyer og Roychowdhury.
Hvorvidt Modha med denne brikken virkelig har nådd målet eller «Nordpolen» er dermed like usikkert som hvem som først satte sin fot på den geografiske Nordpolen. Var det amerikaneren Frederick A. Cook i 1908 eller briten Robert E. Peary året etter? Eller var verken Cook eller Peary, som mange mistenker i dag, på rett sted? I så fall ble Nordpolen først nådd i 1968 av amerikaneren Ralph Plaisted.
Hvorvidt NorthPole er den virkelige Nordpolen for brikker til kunstig intelligens, må nok ettertiden avgjøre.
Artikkelen ble først publisert på Ingeniøren for deres abonnenter. Den er tilgjengelig på norsk for abonnenter av Ekstra gjennom vår samarbeidsavtale.