De hardware die nu zinnen schrijft en tumoren herkent, dankt een deel van zijn loopbaan aan een ouder probleem: heel veel pixels tekenen voordat een gamer merkt dat het landschap te laat verschijnt.
GPU's werden centraal in moderne AI omdat neurale netwerken enorme hoeveelheden rekenwerk bevatten die kunnen worden opgesplitst en parallel uitgevoerd. Voor graphics was dezelfde brede vaardigheid nodig. Software veranderde een gespecialiseerde beeldprocessor vervolgens in een programmeerbare motor voor matrices, modellen en data.
Eerst kwamen de pixels
Een moderne game verwerkt voortdurend geometrie, texturen, belichting, kleur en schaduwen over miljoenen pixels. Veel van dat werk kan worden opgesplitst in talloze vergelijkbare berekeningen. In plaats van één extreem capabele medewerker te vragen het scherm van links naar rechts te schilderen, organiseert hardware voor graphics een enorme werkplaats en houdt die veel kleinere medewerkers tegelijk bezig.
Een CPU is anders ontworpen. Het kleinere aantal krachtige, flexibele kernen verwerkt besturingssysteemwerk, applicatielogica, vertakkingsbeslissingen en taken waarbij de volgende stap afhangt van het resultaat van de vorige. Geen van beide architecturen is universeel superieur. Een rechtszaal en een koekjesfabriek hebben allebei mensen in dienst; dat betekent niet dat ze baat hebben bij hetzelfde personeelsplan.
Toen werden de pixels tensors
Neurale netwerken combineren herhaaldelijk grote reeksen getallen, passen bewerkingen toe en voeren de resultaten door vele lagen. Tijdens het trainen wordt het model aangepast; tijdens inferentie wordt het gebruikt. Het onderliggende werk kan uiterst geavanceerd zijn, maar veel van de zware rekenkunde kan nog steeds over een parallelle processor worden verdeeld.
Een CPU kan deze berekeningen uitvoeren. Het voordeel van de GPU wordt zichtbaar wanneer de taak voldoende geschikt werk bevat om de parallelle bronnen bezet te houden. Dat is het verband:
- bij graphics gaat het om gerelateerde berekeningen die over pixels, geometrie en samples zijn verspreid;
- bij AI gaat het om gerelateerde berekeningen die over modelgewichten, activaties en data zijn verspreid;
- een GPU is gebouwd om een grote parallelle werklast door de machine te verplaatsen.
De carrièreswitch gebeurde in vier bedrijven
- Vaste hardware voor graphics: vroege GPU's versnelden het gespecialiseerde werk dat nodig was om afbeeldingen en 3D-scènes te tekenen.
- Programmeerbare shaders en algemene berekeningen: de hardware werd flexibel genoeg om ontwikkelaars bredere parallelle problemen te laten formuleren.
- Praktische softwareplatforms: systemen zoals CUDA en ROCm leverden programmeermodellen, compilers, bibliotheken en tools.
- Deep learning op schaal: onderzoek, waaronder AlexNet in 2012, liet zien hoe GPU-computing het praktisch kon maken om een groot beeldherkenningsnetwerk te trainen.
De lus versterkte zichzelf vervolgens. Meer onderzoekers gebruikten GPU-computing; software verbeterde; chipontwerpers voegden functies toe voor machine-learningbewerkingen; grotere werklasten werden praktisch; de vraag betaalde voor de volgende generatie hardware.
Software is de reden dat een snelle chip nuttig werd
Ruwe parallelle rekenkracht vormt nog geen bruikbaar ecosysteem. Ontwikkelaars hebben compilers, runtimes, profilers en versnelde bibliotheken nodig; onderzoekers hebben frameworks nodig waarmee ze een model kunnen formuleren zonder elke bewerking op laag niveau zelf te schrijven.
De CUDA Programming Guide van NVIDIA beschrijft het programmeermodel en uitvoeringsplatform. De ROCm-documentatie van AMD behandelt de overeenkomstige open softwarestack voor ondersteunde AMD-hardware. Ondersteuning door frameworks is de reden waarom twee theoretisch capabele GPU's voor één toepassing een heel verschillende praktische waarde kunnen hebben.
VRAM is de ruimte waarin het werk gebeurt
Een model en de tijdelijke werkdata ervan moeten in het beschikbare geheugen passen. Afhankelijk van de taak omvat dat gewichten, prompts, afbeeldingen, batches en tussenresultaten. Een GPU kan in theorie snel genoeg zijn en er toch niet in slagen een werklast uit te voeren omdat er nergens ruimte voor is.
Dit zorgt voor een eigenaardigheid bij gebruikte hardware: een oudere professionele kaart met meer geheugen kan nuttig blijven voor een model dat niet op een nieuwere, snellere gamingkaart past. Het omgekeerde geldt ook. Als de beoogde software weinig geheugen gebruikt en profiteert van nieuwere rekenfuncties, is capaciteit kopen die nooit wordt benut een dure manier om een specificatie te bewonderen.
Geheugenbandbreedte is ook belangrijk. Duizenden parallelle medewerkers zijn niet productief wanneer de data via een brievenbus bij hen aankomt.
Heeft elke AI-taak een GPU nodig?
Nee. Kleine modellen kunnen op CPU's draaien. Telefoons en recente computers bevatten steeds vaker NPU's die zijn ontworpen om ondersteunde neurale bewerkingen efficiënt uit te voeren. Grote spelers bouwen ook doelgerichte accelerators, zoals Google's Tensor Processing Units.
De GPU blijft belangrijk omdat die hoge parallelle prestaties, programmeerbaarheid, lokaal geheugen en volwassen tooling combineert. Die combinatie past bij veel taken, zonder dat dit het juiste antwoord maakt op elke taak waarin de letters A en I voorkomen.
Een gaming-GPU kan AI uitvoeren - wanneer de software meewerkt
Geschikte gamingkaarten kunnen lokaal beeldgeneratie, transcriptie, upscaling en kleinere taalmodellen verwerken. Controleer de exacte toepassing in plaats van een algemene claim als "AI-ready":
- Worden de GPU en het besturingssysteem ondersteund?
- Hoeveel VRAM heeft het gekozen model en de batch nodig?
- Welke numerieke formaten en versnellingspaden zijn beschikbaar?
- Kunnen de voeding, behuizing en koeling de kaart ondersteunen?
- Is de verwachte snelheid het daadwerkelijk waard om hardware voor te kopen?
Een praktisch voorbeeld: een interview transcriberen
Stel dat je opnamen in tekst wilt omzetten zonder ze te uploaden. Je kiest een transcriptietoepassing, een modelgrootte, aanvaardbare nauwkeurigheid en verwerkingstijd - niet simpelweg een "AI-grafische kaart". De Whisper-repository geeft geschatte geheugenvereisten voor de modelgroottes. Die vormen een uitgangspunt voor die implementatie, geen universele belofte voor elke toepassing die eromheen is gebouwd.
Een groter model heeft mogelijk meer geheugen nodig. Een kleiner model kan al nauwkeurig genoeg klaar zijn. Als de CPU een incidentele opname afhandelt voordat je die nodig hebt, zou een nieuwe GPU een planningsprobleem oplossen dat niet bestaat.
Het nuttige historische toeval
Vroege hardware voor graphics was niet ontworpen met moderne taalmodellen in gedachten. De hardware werd nuttig omdat de architectuur die was gebouwd om pixels te tekenen ook geschikt bleek voor veel van de parallelle wiskunde achter neurale netwerken. Programmeerbare software stelde wetenschappers en ontwikkelaars in staat dit toevallige raakvlak te benutten; tientallen jaren aan vraag naar graphics bleven de technologie verbeteren.
GPU's dreven de AI-boom niet alleen aan omdat ze snel waren. Ze waren parallel, programmeerbaar en omringd door software die deze structuur kon omzetten in nuttig werk.
Bekijk de AI- en machine-learning-GPU's die GPUsed verwerkt, lees wat een NPU doet, of vergelijk VRAM-capaciteit en de beperkingen ervan. Als de vraag over een aankoop gaat, begin dan met de werklast, niet met de grootste modelnaam.