kunstig intelligens
Denne KI-prosessoren skal kunne generere tilsvarende hele Wikipedia på bare 18 timer
Spesiallaget for generativ KI. Skal være enormt mye bedre til det enn tidligere brukte prosessorer.
Deres satsing på prosessorer for bruk til kunstig intelligens har gjort Nvidia til ett av verdens mest verdifulle selskap. Nvidias H100 og A100 raker inn penger, men nå har de brått fått heftig konkurranse fra oppstartsselskapet d-Matrix, i alle fall innen generativ KI.
D-Matrix har vært aktive i noen år, men har inntil nå kun hatt prototyper og konseptmodeller å vise frem. Nylig lanserte de imidlertid sitt første kommersielle produkt, Corsair C8.
Kun for generativ KI
C8 er en prosessor som er spesielt designet for å drive generative KI-modeller, mens man hittil for det meste har brukt grafikkprosessorer – GPU-er – med spesialfunksjoner og -komponenter for KI-prosessering.
Disse gir god ytelse både til KI og en rekke andre intensive regneoppgaver, og har derfor vært det beste kompromisset enn så lenge, selv om de til generativ KI er det d-Matrix beskriver som «suboptimale».
C8 er derimot kun tiltenkt generativ KI. Den skal dermed ha enormt bedre ytelse til akkurat slik bruk, til mindre penger og med et svært mye lavere strømforbruk.
Dette er mye av grunnen til at Microsoft tidligere har finansiert selskapet med 44 millioner dollar og nå, sammen med andre investorer, har spyttet inn ytterligere 110 millioner dollar.
Altså på et øyeblikk betydelig mer enn den nylig annonserte norske KI-satsingen over fem år.
Konkurrent eller ikke?
Ifølge produsentens egne målinger (som derfor selvsagt skal tas med en klype salt) skal C8 være over ni ganger så rask som Nvidias toppmodell H100 og over 27 ganger så rask som Nvidias rimeligere A100-modell.
Disse tallene gjelder imidlertid kun for bruk innen generativ KI, og Nvidia selv sier d-Matrix ikke er en konkurrent til dem, siden Nvidias brikker er laget for et bredere spekter av tallknusing enn C8.
Corsair C8 skal ifølge d-Matrix klare 86.770 tokens per sekund, sammenlignet med A100 på 3184 og H100 med 9552.
For å sette tallene i perspektiv: ChatGPT-3 benytter nesten 29.000 A100 og H100-enheter fra Nvidia, til en daglig kostnad på nesten 700.000 dollar, ifølge en studie fra februar 2023.
Billigere i drift skal den også være:
C8 skal være god for nesten 22 millioner tokens per dollar, mens A100 og H100 til sammenligning skal ligge på henholdsvis 0,8 og 1,6.
Imponerende tall
Selve C8-prosessoren består av åtte såkalte «chiplets» som er montert på samme plate, med baner som sørger for kommunikasjon mellom dem. Dette er samme metode som først AMD og senere også Intel har benyttet for å bygge prosessorer. Det er svært mye rimeligere å produsere på denne måten, siden man ikke trenger å kassere en stor prosessor dersom noe skulle gå galt akkurat der, men i stedet kan produsere mange flere og mindre biter som så settes sammen senere.
Og de øvrige tallene d-Matrix lover er imponerende:
- Minnebåndbredde på 150 TB/s mot den mer vanlige HBM-teknologiens 3–4 TB/s.
- Båndbredde mellom chiplets på 8 TB/s.
- Opptil 20 ganger bedre ytelse per watt enn dagens ledende løsninger.
- Ett enkelt C8-kort har 2048 DIMC-kjerner med totalt 130 milliarder transistorer og ikke mindre enn 256 GB LPDDR5-minne.
- 2400–9600 TFLOPS, avhengig av oppgaven.
Det skal etter sigende også komme billigere versjoner av Corsair, med henholdsvis to og fire chiplets per kort.
18 timer på å generere Wikipedia
Med en slik mengde minne kan ett enkelt C8-kort holde en komplett KI-modell i minnet samtidig.
At man da slipper å lese og skrive til eller fra tregere lagringsmedium, er én av grunnene til at C8 skal være så mye raskere og mindre strømkrevende enn eksisterende toppmodeller.
I dagens KI-prosessorer må prosessorene ofte vente på data fra tregere minne, noe som koster både store mengder strøm og redusert ytelse.
Alt i alt bidrar dette til at ett enkelt Corsair C8-kort skal kunne generere mer enn tilsvarende hele Wikipedia på rundt 18 timer, lover d-Matrix i sin «whitepaper» for C8 (PDF). Totalt snakker man da om omkring 5,7 milliarder tokens og 4,3 milliarder ord som skal genereres.
Eksportrestriksjoner
Både H100 og A100 har for rask overføringshastighet til at Nvidia får lov til å selge dem til Kina, så derfor har selskapet lansert en versjon ved navn A800. Denne har en overføringshastighet som er nedskalert fra A100s 600 gigabytes per sekund, til «bare» 400 gigabytes per sekund for å komme under terskelen for eksportrestriksjoner til Kina.
Det er derfor lite trolig at C8 vil kunne selges til Kina, som dermed må se på andre løsninger dersom de ikke skal sakke ytterligere akterut.