maskinvare
Klynger med ekstreme grafikkort danner noen av verdens raskeste superdatamaskiner
Det får flere miljøer i Norge nå glede av.
Universitetet i Agder er i ferd med å bygge en superdatamaskin i verdensklasse til bruk innen forskning på kunstig intelligens.
Nå har de bestilt de fire siste av i alt åtte stykk Nvidia DGX-2, som blir levert og installert rundt juletider. Det er harde pakker som forskningsmiljøet ved Centre for Artificial Intelligence Research (CAIR) kan glede seg til.
Klyngen med en total ytelse på 16,8 petaflops vil da omsider være komplett. Samlet har anskaffelsen kostet drøyt 20 millioner kroner.
For distributør Nextron AS er det gode nyheter.
– Dette er det kraftigste enkeltsystemet for trening av kunstig intelligens (AI) og såkalt dyp læring som finnes i verden, sier salgssjef for GPU og AI-løsninger Lasse Sandstone til digi.no.
Nextron har vært gjennom det han kaller en omfattende godkjennings- og sertifiseringsprosess hos Nvidia for å kunne selge produktet. Det er de hittil alene om her til lands.
10 maskiner i Norge
Markedet for DGX-2 ser ut til å være temmelig smalt. Anskaffelsen til forskningssenteret i Grimstad utgjør en stor andel av alle bestillingene.
– Det er solgt tretten stykker i hele Norden, konstaterer Sandstone i Nextron.
NTNU er på den eksklusive listen, med et tidlig innkjøp av én slik tallknuser i fjor høst, da produktet kom på markedet. Gløshaugen har beskrevet ytelsen som rå og grensesprengende. I tillegg har Simula på Fornebu gått til anskaffelse av en maskin.
Universitetet i Aalborg har kjøpt tre stykk DGX-2 til sin satsing, forteller Sandstone. Dette setter kjempeanskaffelsen til UiA og norsk satsing på AI-forskning i et interessant perspektiv.
Sandstone er kjent med at det er solgt enheter også til svensk industri, noe vi antar må tillegges en annen distributør i Sverige. Ellers går ikke regnestykket opp. I tillegg skal det være solgt en del mer av lilleboren, forløper DGX-1, som har omtrent halvparten av ytelsen.
En hinsides regnekraft
Hver av de gullfargede boksene består av et par Intel Xeon Platinum-prosessorer med 24 kjerner og en klokkefrekvens på 2,7 GHz, men disse er knapt statister.
Hovedrollen og den virkelige kraften ligger i de 16 svært kraftige grafikkortene av typen Tesla «Volta» V100, som har en listepris på godt over 100.000 kroner stykket.
Slik får hver boks til sammen 81.920 CUDA-kjerner og 10.240 Tensor-kjerner. Noe som kan ganges opp ytterligere med en klyngekonfigurasjon, som den til forskningsmiljøet på Sørlandet.
– Ytelsen er så enorm at det ikke gir noen mening for folk flest, og heller ikke meg. De åtte boksene kan utføre 640.000 operasjoner eller regnestykker i parallell på én gang. Det gjør at vi kan kjøre gjennom enorme mengder med forskningsdata, har CAIR-direktør og professor Ole-Christoffer Granmo tidligere sagt til digi.no.
Hjerteforskning
Tore Heide Larsen er senior forskningsingeniør ved Simula Research Laboratory, som har kjøpt inn DGX-2 som del av en langt større satsing på tungregning for kunstig intelligens, nærmere bestemt eX3-prosjektet.
– Det er mange grupper her på huset som jobber med maskinlæring. Jeg sitter i gruppa innen scientific computing, som jobber med å prøve å skalere opp kode opp mot alle 16 GPU-ene og flere bokser over Infiniband-nettet som knytter dem sammen, sier han.
Larsen har selv satt opp DGX-2, som er tilgjengelig for en lang rekke forskere og Phd-studenter i landet – i alt 58 personer per i dag. Bruksområdet er særlig knyttet til maskinlæring innen helse.
– Det er innen hjerteforskning. Blant annet prøver vi å lage en elektrokjemisk modell av hjertet. Det tar utgangspunkt i API-er utviklet her på Simula under FEniCS-prosjektet.
Svitsjen er krumtappen
DGX-2 har 30 terabyte intern lagring eller hurtigminne (cache). Dette er flashbasert lagring satt opp med RAID 0 eller såkalt disk striping, altså en ren ytelseskonfigurasjon.
– Dette benyttes til dataene du jobber aktivt på. Hvis du for eksempel jobber med å analysere røntgenbilder, så vil hvert bilde være på mange megabyte. I tillegg kommer arbeidsminnet som for hver DGX-2 er på 1,5 terabyte med RAM, forklarer Lasse Sandstone i Nextron.
Kanskje enda viktigere, slik han ser det, er det innebygde minnet i hver GPU med 32 gigabyte lynraskt HBM2-minne. Alle de seksten GPU-ene i en boks kan opptre som ett digert grafikkort.
Nvidias nye NVSwitch-teknologi åpner for at alle kortene kan dele det samme grafikkminnet, som da teller romslige 0,5 terabyte.
Selv så høy båndbredde som PCI-portene har fått med tiden, så er det langt ifra nok til å forsyne så mange grafikkort som det her er snakk om. Den nevnte svitsjeteknologien gjør det mulig å skape én enkelt virtualisert GPU, som altså yter opptil 2,1 petaflops fra en og samme server.
800 Gbps
Egentlig er det ingen grense for hvor mange DGX-2 som kan kobles sammen i et system, men nettverksytelse kan fort bli en flaskehals, ifølge Sandstone.
– Jobbene må deles ut til nodene som skal gjøre kalkulasjonene og sende data tilbake igjen. Dette går over Infiniband (høyhastighetsnettverk) på opptil 100 Gbps. En DGX-2 har åtte slike tilkoblinger, forklarer salgssjefen i Nextron.
Nvidia satte i sommer en foreløpig rekord, da de koblet sammen 96 slike enheter med referansearkitektur de kaller SuperPOD. I juni var det nok til å kapre 22. plassen på listen over verdens 500 raskeste superdatamaskiner.
Klyngen i Grimstad får en svitsjeløsning som gir det Sandstone kaller «1 til 1 non-blocking», det vil si full hastighet inn og ut. Det skal bety at svitsjen ikke legger noen begrensninger på systemets ytelse.
– Du får da 800 Gbps nettverksytelse hvis du har behov for det. Når DGX-2 er koblet sammen på denne måten, kan klyngen presenteres som en samlet ressurs til brukerne.
Linux i bunn
Nvidia tilbyr akkurat den samme kraftpakken i en variant kalt HGX-2, men den mangler noen av tilleggene som gjør DGX-2 til et mer attraktivt valg for enkelte kunder.
Dette er for øvrig en av flere implementasjoner av en åpen standard under Open Compute Project, en stiftelse Facebook i sin tid tok initiativ til å starte opp. Nvidia er ikke alene om å tilby dette, blant annet har også Supermicro et lignende produkt.
– HGX-2 er i hovedsak basert på veldig mye av den samme teknologien som DGX-2, men uten Nvidias programvare og uten kundestøtte. Da må du selv ta ansvar for at programvaren og funksjonaliteten er slik som du ønsker at den skal være. For en industrikunde kan HGX-2 være en rimeligere løsning, men for et forskningsmiljø er ikke regnestykket like klart, mener Sandstone.
Det hører med til historien at offentlig forskning og utdanningsinstitusjoner kan få innvilget rabatt på disse produktene, og prisavslaget vil da være vesentlig høyere for DGX-2 enn for varianten uten programvare og support.
Superdatamaskinen blir levert med et eget operativsystem fra Nvidia som heter DGX OS, som igjen er basert på Linux-distribusjonen Ubuntu 18.04 LTS, med en del tillegg.
– Det følger med en rekke biblioteker fra Nvidia til det du kan kalle dyp læring og AI-løsninger. I tillegg til blant annet grafikkdriverne deres. Det er en ganske rikholding pakke, mener senioringeniør Tore Heide Larsen i Simula.
Han har også gode erfaringer med en administrasjonsløsning fra Bright Computing i arbeidet med superdatamaskinen, som heter Cluster Manager for HPC.
– Det er et rammeverk for kjapt å kunne bringe opp nye noder og få det opp i clusteret. Det gjør det mulig å administrere en rekke ulike arkitekturer og GPU-er fra ett cluster management-verktøy.
Heterogene superdatamaskiner
DGX-2 eller Volta 100-beregningsprosessorer er imidlertid langt ifra det eneste som inngår i eX3-prosjektet hos Simula.
Her er målet å tilby et heterogent miljø med en lang rekke ulike typer arbeidsjern, inkludert også AMD Epyc, Xeon Scalable Platinum, AMD Vega 20, samt HPC-tilpassede nettverksteknologier som Mellanox HDR 200 Gbps Infiniband og Dolphin Interconnect Solution PCIe Gen3 x16.
– Vi prøver derfor å ha et knippe «top-bin»-noder slik at brukerne kan utvikle hybride programvarer basert på for eksempel OpenMP og MPI, men også mer GPGPU-spesifikt som OpenCL, OpenACC, Cuda, AMD ROCm, AMD HIP, for bruk på kommende generasjoner av superdatamaskiner, forteller Tore H. Larsen i Simula.
Han viser til oversikten over verdens raskeste superdatamaskiner, top500.org, og sier at maskinene der ikke lenger er så homogene.
Nå består de gjerne av en miks av serverprosessorer og spesielle beregningsprosessorer eller GPU-er med svært mange kjerner.
– I neste fase av eX3-prosjektet skal vi anskaffe enda mer dedikert maskinvare for kunstig intelligens og maskinlæring, det vil si maskinvare som er god på INT8- og BFloat16 type aritmetikk, som oftest brukes på denne type workloads.