maskinvare
Ni europeiske land bygger gigantisk superdatamaskin
Norge er med på å bygge en superdatamaskin i pre-exascale som blir en av verdens største. Men mange av de forskerne som bruker superdatamaskiner i dag, vil ikke kunne bruke den nye LUMI-superdatamaskinen.
Om ett år får forskere i ni europeiske land tilgang til en hittil usett regnekraft når det gjelder både mengde og hastighet, når Norge i samarbeid med åtte andre nordeuropeiske land kan feire installasjonen av LUMI-superdatamaskinen i Finland. Den blir en av verdens kraftigste datamaskiner i en såkalt pre-exascale med en svimlende yteevne på 200 petaflops; altså 200 millioner milliarder beregninger i sekundet.
For å oppnå så mange beregninger, har konsortiet bak prosjektet valgt å basere den nye High Performance Computing-klyngen (HPC) overveiende på grafikkort, GPU-er (Graphics Processing Unit), i stedet for de mer konvensjonelle prosessorene som er kjent som CPU-er (Central Processing Unit).
CPU-en kjennetegnes ved å være generell og ha tilgang til et stort arbeidslager, slik at den passer til alle problemtyper. GPU-en krever derimot at beregningene uttrykkes som vektor-operasjoner. I tillegg har den et mindre arbeidslager, fordi beregningene blir foretatt parallelt på samme tid.
– Det aller meste av regnekraften til LUMI blir basert på grafikkort (GPU), og det er langt fra alle forskere som direkte kan benytte denne metoden. Faktisk vet vi for tiden ikke hvem og hvor mange danske forskere som har den nødvendige koden for denne teknologien, sier Brian Vinter, som er professor i grid computing, superdatamaskiner og multikjerne-arkitekturer på Københavns Universitet og leder av Sciences HPC-Center på Københavns Universitet. Han er også Danmarks tekniske representant i LUMI-konsortiet, som i tillegg til Danmark består av Finland, Belgia, Tsjekkia, Estland, Norge, Polen, Sverige og Sveits.
Superrask – men bare til bestemte problemer
Dette innebærer at selv om Danmark hvert år betaler omkring 7,5 millioner danske kroner til etablering og drift av LUMI-superdatamaskinen i Finland, vil mange av de forskningsprosjektene som i dag benytter seg av superdatamaskiner ikke kunne ha noen nytte av LUMI-superdatamaskinen.
Dette skyldes ikke at Brian Vinter har noe imot bruken av GPU-er innen High Performance Computing. Han understreker at man må være oppmerksom på begrensningene, selv om antallet flops – antall beregninger per sekund – er høyt.
– For å oppnå veldig mange beregninger i sekundet, er det nødvendig å bruke GPU-er. På LUMI har man valgt å prioritere en svært høy peak performance, mens andre av de nye europeiske superdatamaskinene har valgt å bruke flere CPU-er, og kan på den måten løse et bredere spekter av vitenskapelige problemer, sier Brian Vinter.
Danske Ingeniøren har tidligere beskrevet hvordan de danske forskningsmiljøene ivrig har tatt til seg bruken av superdatamaskiner i løpet av de siste årene. Faktisk er de eksisterende anleggene i Danmark fullbooket, ofte langt inn i fremtiden. Og hvis aktivitetsnivået skal fortsette i samme tempo, vurderte det danske Uddannelses- og Forskningsministeriet i fjor at det er behov for opptil 125 millioner danske kroner (ca. 169 millioner norske) ekstra hvert år til formålet.
En del av det økende behovet for regnekraft blir nå forsøkt dekket i det europeiske superdatamaskin-samarbeidet EuroHPC, som LUMI-superdatamaskinen er en del av.
Har prøvd seg med GPU-er
En GPU fungerer ved hjelp av mer enn 5000 parallelle beregninger. Dette fungerer fint når du jobber med lineære beregninger, og blir generelt oppfattet som den beste tekniske løsningen for å kjøre mange av de nye maskinlærings-algoritmene. Men det forårsaker problemer når man skal ha løst numeriske ligninger.
Ett eksempel er fysikere som bruker superdatamaskiner til å regne ut kvantemekaniske egenskaper i forskjellige to-dimensjonale materialer. Her har GPU-ene vist seg ikke å være egnede til den typen beregninger. Og det er ikke fordi de danske forskerne ikke har prøvd å omstille seg til bruken av GPU-er.
– Vi begynte å se nærmere på GPU-er for 20 år siden, og i løpet av de siste årene har bruken av GPU-er til parallelle beregninger virkelig skutt fart. Så det er ikke fordi de danske forskningsmiljøene er inkompetente eller late, men snarere fordi mange vitenskapelige problemer ikke kan løses eller beregnes parallelt, fordi de har flere dimensjoner, sier Brian Vinter.
Allerede i 2018 ble mesteparten av flops på verdens 500 kraftigste superdatamaskiner foretatt med GPU-er fra den amerikanske produsenten NVIDIA Tesla og ikke CPU-er. Det viser en redegjøring fra TOP500-listen.
For noen forskningsmiljøer vil det være mulig å justere prosjektene og programmene til å bli kjørt på den nye LUMI-klyngen i Finland, mens andre antakelig må droppe den nye regnekraften som Danmark betaler omkring 7,5 millioner danske kroner for hvert år i de neste fem til seks årene.
– Man har valgt den GPU-baserte modellen for å oppnå så stor regnekraft som mulig for pengene. Men det innebærer også at mange prosjekter må tenkes på nytt og redefineres hvis de skal ha en mulighet til å kunne utnytte den nye regnekraften på den riktige måten, forteller Brian Vinter.
Forventes å dele nye superdatamaskiner
Hos de finske prosjektlederne av LUMI-konsortiet er man oppmerksomme på problemet med manglende kompetanser.
«Min oppfatning er at de danske og de finske forskningsmiljøene ligner på hverandre. Dermed er vi oppmerksomme på at det er en problemstilling i forhold til hvor forberedte vi er i forbindelse med kode til GPU-teknologien», sier administrerende direktør Kimmo Koski hos CSC i Finland, som har ansvar for hosting av den kommende LUMI-superdatamaskin i en artikkel hos DeiC – Danish e-Infrastructure Cooperation, som står for infrastrukturen bak de danske superdatamaskinene.
LUMI-superdatamaskinen er en av i alt åtte nye, store europeiske superdatamaskiner som blir satt i drift i løpet av de kommende årene som et ledd i EuroHPC-samarbeidet. Tre av dem ligger helt i toppen når det gjelder beregningskraft, blant annet LUMI med dansk deltakelse, mens fem har en litt lavere yteevne. Flere av dem benytter seg av mer CPU-baserte klynger, og vil derfor kunne benyttes til de danske forskningsprosjektene som har behov for en kraftig superdatamaskin, men som ikke kan bruke GPU-er.
Men dette krever at de europeiske landene blir enige om hvordan man rent praktisk fordeler regnekraften mellom seg.
– Jeg tror at dette kommer til å gå seg til i det lange løp. Det er enighet om at vi må trekke i samme retning for å få hevet Europa opp fra det sorte hullet vi har befunnet oss i når vi snakker som high performance computing. Men det gjenstår å få avtalt hvordan man konkret kan utveksle timer mellom de forskjellige klyngene i fremtiden, sier Brian Vinter.
Den samme meldingen kommer fra Finland, hvor man også håper på en løsning med å bytte timer på den nordeuropeiske LUMI-superdatamaskinen til timer i for eksempel Barcelona, hvor en av de andre nye superdatamaskinene blir bygd akkurat nå.
«Vi jobber med løsninger hvor man for eksempel kan bytte regnetimer mellom LUMI og andre europeiske superdatamaskiner som benytter CPU-teknologi. På den måten kan vi dekke bredere og dekke flere behov», heter det fra Kimmo Koski.
Anbudsprosess i gang
Hvis danske forskerne gjerne vil dra nytte av den kommende superdatamaskinen, må de i gang med å lære GPU-programmering ganske så kjapt. For LUMI skal være klar allerede ved utgangen av 2020, og forventes å ha en levetid på fem år.
For tiden er LUMI-konsortiet i gang med å gjennomgå de tilbudene som en rekke leverandører har sendt inn via en anbudsprosess som fungerer som en såkalt skjønnhetskonkurranse hvor det samlede anbudsbeløpet ligger fast på 150 millioner euro, altså over 1,5 milliarder norske kroner. Dermed må leverandørene komme med bud på hvor mye regnekraft de kan levere til den prisen.
I dag er verdens kraftigste superdatamaskin Summit-anlegget, som står i Department of Energy’s Oak Ridge National Laboratory (ORNL) i Tennessee og er bygd av IBM. Den har en maksimal yteevne på opptil 200 petaflops. Så den nye LUMI-superdatamaskinen kommer opp i den samme kategorien. Det neste skrittet innenfor superdatamaskiner er en ytelse i exascale (det vil si minst 10¹⁸ eller 1 milliard milliarder beregninger per sekund), noe som man forventer å komme opp i omkring 2022.
Saken ble først publisert på danske Ingeniøren, og gjøres tilgjengelig på norsk for abonnenter av Digi Ekstra gjennom vår samarbeidsavtale med Teknologiens mediehus/Ingeniøren.