Hardware-ul care scrie acum propoziții și recunoaște tumori își datorează o parte din parcurs unei probleme mai vechi: redarea unui număr foarte mare de pixeli înainte ca jucătorul să observe că decorul a apărut cu întârziere.
GPU-urile au devenit esențiale pentru AI-ul modern deoarece rețelele neuronale conțin cantități enorme de calcule matematice care pot fi împărțite și executate în paralel. Grafica necesita aceeași capacitate generală. Apoi, software-ul a transformat un procesor specializat pentru imagini într-un motor programabil pentru matrici, modele și date.
Mai întâi au fost pixelii
Un joc modern procesează în mod repetat geometrie, texturi, iluminare, culori și umbre pentru milioane de pixeli. O mare parte din această activitate poate fi împărțită în numeroase calcule similare. În loc să ceri unui singur lucrător extrem de capabil să picteze ecranul de la stânga la dreapta, hardware-ul grafic organizează un atelier vast și ține ocupați împreună numeroși lucrători mai mici.
Un CPU este conceput diferit. Numărul său mai mic de nuclee puternice și flexibile se ocupă de activitățile sistemului de operare, logica aplicațiilor, deciziile condiționale și sarcinile în care pasul următor depinde de rezultatul celui anterior. Niciuna dintre arhitecturi nu este universal superioară. Atât o sală de judecată, cât și o fabrică de biscuiți angajează oameni; asta nu înseamnă că beneficiază de același plan de personal.
Apoi pixelii au devenit tensori
Rețelele neuronale combină în mod repetat matrice mari de numere, aplică operații și transmit rezultatele prin numeroase straturi. Antrenarea ajustează modelul; inferența îl folosește. Activitatea de bază poate fi extrem de sofisticată, însă o mare parte din calculele intensive poate fi în continuare împărțită între procesoare paralele.
Un CPU poate efectua aceste calcule. Avantajul GPU-ului apare atunci când sarcina conține suficientă activitate potrivită pentru a-și menține ocupate resursele paralele. Aceasta este legătura:
- grafica implică calcule asociate, distribuite între pixeli, geometrie și eșantioane;
- AI implică calcule asociate, distribuite între ponderi ale modelului, activări și date;
- un GPU este construit pentru a transporta o sarcină paralelă mare prin sistem.
Schimbarea de carieră s-a produs în patru acte
- Hardware grafic fix: primele GPU-uri accelerau activitățile specializate necesare pentru redarea imaginilor și a scenelor 3D.
- Shader-e programabile și calcul general: hardware-ul a devenit suficient de flexibil pentru ca dezvoltatorii să exprime probleme paralele mai ample.
- Platforme software practice: sisteme precum CUDA și ROCm au furnizat modele de programare, compilatoare, biblioteci și instrumente.
- Învățare profundă la scară largă: cercetări precum AlexNet din 2012 au demonstrat cum calculul pe GPU putea face practică antrenarea unei rețele mari de recunoaștere a imaginilor.
Apoi, bucla s-a autoalimentat. Mai mulți cercetători au folosit calculul pe GPU; software-ul s-a îmbunătățit; proiectanții de cipuri au adăugat funcții pentru operațiuni de învățare automată; sarcini de lucru mai mari au devenit practice; cererea a finanțat o nouă generație de hardware.
Software-ul este motivul pentru care un cip rapid a devenit util
Calculele paralele brute nu constituie un ecosistem utilizabil. Dezvoltatorii au nevoie de compilatoare, medii de execuție, profilere și biblioteci accelerate; cercetătorii au nevoie de cadre care să permită exprimarea unui model fără scrierea manuală a fiecărei operațiuni de nivel scăzut.
Ghidul de programare CUDA al NVIDIA descrie modelul său de programare și platforma de execuție. Documentația ROCm de la AMD prezintă stiva software open-source corespunzătoare pentru hardware AMD compatibil. Compatibilitatea cu cadrele este motivul pentru care două GPU-uri capabile, cel puțin teoretic, pot avea valori practice foarte diferite pentru aceeași aplicație.
VRAM-ul este spațiul în care se desfășoară activitatea
Un model și datele sale temporare de lucru trebuie să încapă în memoria disponibilă. În funcție de sarcină, acestea includ ponderi, prompturi, imagini, loturi și rezultate intermediare. Un GPU poate fi suficient de rapid în teorie și totuși să nu poată rula o sarcină deoarece nu există loc pentru datele necesare.
Aceasta creează o particularitate a hardware-ului second-hand: o placă profesională mai veche, cu mai multă memorie, poate rămâne utilă pentru un model care nu încape pe o placă de gaming mai nouă și mai rapidă. Și invers este valabil. Dacă software-ul vizat folosește puțină memorie și beneficiază de funcții de calcul mai noi, să cumperi o capacitate pe care nu o folosește niciodată este un mod costisitor de a admira specificațiile.
Lățimea de bandă a memoriei contează și ea. Mii de lucrători paraleli nu sunt productivi când datele ajung la ei printr-o cutie poștală.
Are nevoie orice sarcină de AI de un GPU?
Nu. Modelele mici pot rula pe CPU-uri. Telefoanele și computerele recente includ tot mai des NPU-uri concepute pentru a executa eficient operațiuni neuronale compatibile. Operatorii mari construiesc, de asemenea, acceleratoare specializate, precum Tensor Processing Units de la Google.
GPU-ul rămâne important deoarece combină performanță paralelă ridicată, programabilitate, memorie locală și instrumente mature. Această combinație se potrivește multor sarcini, fără a-l transforma în răspunsul corect pentru orice sarcină care conține literele A și I.
Un GPU de gaming poate rula AI - atunci când software-ul este compatibil
Plăcile de gaming potrivite pot gestiona local generarea de imagini, transcrierea, redimensionarea și modelele lingvistice mai mici. Verifică aplicația exactă, nu o afirmație generică de tipul „pregătit pentru AI”:
- Sunt compatibile GPU-ul și sistemul de operare?
- De câtă VRAM are nevoie modelul și lotul ales?
- Ce formate numerice și căi de accelerare sunt disponibile?
- Pot sursa, carcasa și răcirea să suporte placa?
- Merită efectiv viteza estimată să cumperi hardware pentru ea?
Un exemplu practic: transcrierea unui interviu
Să presupunem că vrei să transformi înregistrările în text fără să le încarci online. Alegi o aplicație de transcriere, o dimensiune a modelului, nivelul de acuratețe acceptabil și timpul de procesare - nu pur și simplu o „placă grafică pentru AI”. Depozitul Whisper oferă cerințe aproximative de memorie pentru dimensiunile sale de model, care reprezintă un punct de pornire pentru acea implementare, nu o promisiune universală pentru fiecare aplicație construită în jurul ei.
Un model mai mare poate necesita mai multă memorie. Unul mai mic poate finaliza deja suficient de precis. Dacă CPU-ul poate procesa o înregistrare ocazională înainte să ai nevoie de ea, un GPU nou ar rezolva o problemă de programare care nu există.
Accidentul istoric util
Hardware-ul grafic timpuriu nu a fost conceput având în vedere modelele lingvistice moderne. A devenit util deoarece arhitectura construită pentru redarea pixelilor se potrivea și unei mari părți din matematica paralelă din spatele rețelelor neuronale. Software-ul programabil a deschis acest accident de compatibilitate pentru cercetători și dezvoltatori; decenii de cerere pentru grafică au continuat să îmbunătățească mecanismele.
GPU-urile nu au alimentat explozia AI doar pentru că erau rapide. Erau paralele, programabile și înconjurate de software capabil să transforme această structură în activitate utilă.
Vezi GPU-urile pentru AI și învățare automată gestionate de GPUsed, citește ce face un NPU sau compară capacitatea VRAM și limitele sale. Dacă întrebarea este despre o achiziție, începe cu sarcina de lucru, nu cu cel mai mare nume de model.