Průvodce GPUsed

Proč se GPU staly motorem moderní umělé inteligence

Zkontroloval z hlediska faktické a provozní přesnosti.

Hardware, které nyní píše věty a rozpoznává nádory, vděčí za část své kariéry staršímu problému: vykreslit obrovské množství pixelů dříve, než si hráč všimne, že se scenérie načetla pozdě.

GPU se staly ústřední součástí moderní umělé inteligence, protože neuronové sítě obsahují obrovské množství matematických operací, které lze rozdělit a provádět paralelně. Grafika vyžadovala stejnou obecnou schopnost. Software pak proměnil specializovaný obrazový procesor v programovatelný engine pro matice, modely a data.

Nejprve přišly pixely

Moderní hra opakovaně zpracovává geometrii, textury, osvětlení, barvy a stíny přes miliony pixelů. Velkou část této práce lze rozdělit na mnoho podobných výpočtů. Místo toho, aby jeden mimořádně schopný pracovník maloval obrazovku zleva doprava, grafický hardware uspořádá obrovskou dílnu a zaměstná mnoho menších pracovníků současně.

CPU je navrženo jinak. Jeho menší počet výkonných a flexibilních jader se stará o práci operačního systému, logiku aplikací, rozhodování podle větvení a úlohy, u nichž další krok závisí na výsledku předchozího. Žádná architektura není univerzálně lepší. Soudní síň i továrna na sušenky zaměstnávají lidi; neznamená to však, že těží ze stejného personálního plánu.

Poté se z pixelů staly tenzory

Neuronové sítě opakovaně kombinují velká pole čísel, provádějí operace a předávají výsledky mnoha vrstvami. Trénování upravuje model, inference jej používá. Základní práce může být mimořádně sofistikovaná, přesto lze velkou část náročné aritmetiky stále rozdělit mezi paralelní procesor.

CPU tyto výpočty provádět dokáže. Výhoda GPU se projeví, když úloha obsahuje dostatek vhodné práce, aby jeho paralelní zdroje zůstaly vytížené. Tím je dáno spojení:

  • grafika zahrnuje související výpočty rozprostřené mezi pixely, geometrii a vzorky;
  • AI zahrnuje související výpočty rozprostřené mezi váhy modelu, aktivace a data;
  • GPU je navrženo tak, aby strojem prohnalo rozsáhlou paralelní zátěž.

Změna kariéry proběhla ve čtyřech dějstvích

  1. Grafický hardware s pevnou funkcí: první GPU urychlovala specializovanou práci potřebnou k vykreslování obrazů a 3D scén.
  2. Programovatelné shadery a obecné výpočty: hardware se stal dostatečně flexibilním, aby vývojáři mohli vyjadřovat širší paralelní problémy.
  3. Praktické softwarové platformy: systémy jako CUDA a ROCm poskytly programovací modely, kompilátory, knihovny a nástroje.
  4. Hluboké učení ve velkém měřítku: výzkum včetně AlexNetu z roku 2012 ukázal, jak může GPU computing umožnit praktické trénování rozsáhlé sítě pro rozpoznávání obrazu.

Cyklus se poté sám posiloval. Více výzkumníků využívalo GPU computing, software se zlepšoval, návrháři čipů přidávali funkce pro operace strojového učení, větší zátěže se stávaly prakticky zvládnutelnými a poptávka financovala další generaci hardwaru.

Software je důvodem, proč se rychlý čip stal užitečným

Čistá paralelní aritmetika není použitelný ekosystém. Vývojáři potřebují kompilátory, běhová prostředí, profilery a akcelerované knihovny; výzkumníci potřebují frameworky, které dokážou vyjádřit model bez ručního psaní každé nízkoúrovňové operace.

Programovací příručka CUDA společnosti NVIDIA popisuje její programovací model a platformu pro provádění. Dokumentace ROCm společnosti AMD popisuje odpovídající otevřený softwarový zásobník pro podporovaný hardware AMD. Právě podpora frameworků vysvětluje, proč mohou mít dvě teoreticky schopná GPU pro jednu aplikaci velmi odlišnou praktickou hodnotu.

VRAM je místnost, kde práce probíhá

Model a jeho dočasná pracovní data se musí vejít do dostupné paměti. V závislosti na úloze sem patří váhy, prompty, obrázky, dávky a mezivýsledky. GPU může být teoreticky dostatečně rychlé, a přesto nedokáže zátěž spustit, protože data není kam uložit.

To vytváří zvláštnost použitého hardwaru: starší profesionální karta s větší pamětí může zůstat užitečná pro model, který se nevejde na novější a rychlejší herní kartu. Platí to i obráceně. Pokud zamýšlený software využívá málo paměti a těží z novějších výpočetních funkcí, kupovat kapacitu, které se nikdy nedotkne, je drahý způsob, jak obdivovat specifikaci.

Na propustnosti paměti také záleží. Tisíce paralelních pracovníků nejsou produktivní, když se k nim data dostávají poštovní schránkou.

Potřebuje každá úloha AI GPU?

Ne. Malé modely mohou běžet na CPU. Telefony a novější počítače stále častěji obsahují NPU navržené pro efektivní provádění podporovaných neuronových operací. Velcí provozovatelé také vytvářejí specializované akcelerátory, jako jsou Tensor Processing Units společnosti Google.

GPU zůstává důležité, protože kombinuje vysoký paralelní výkon, programovatelnost, lokální paměť a vyspělé nástroje. Tato kombinace vyhovuje mnoha úlohám, aniž by představovala správnou odpověď na každou úlohu obsahující písmena A a I.

Herní GPU může provozovat AI - pokud s tím software souhlasí

Vhodné herní karty zvládnou lokálně generování obrazu, přepis, upscaling i menší jazykové modely. Ověřte konkrétní aplikaci, nikoli obecné tvrzení „připraveno pro AI“:

  • Je GPU a operační systém podporováno?
  • Kolik VRAM potřebuje zvolený model a dávka?
  • Které numerické formáty a akcelerační cesty jsou k dispozici?
  • Dokáže napájecí zdroj, skříň a chlazení kartu podporovat?
  • Vyplatí se očekávaná rychlost skutečně kvůli ní kupovat hardware?

Praktický příklad: přepis rozhovoru

Představte si, že chcete převést nahrávky na text, aniž byste je nahrávali na internet. Vybíráte aplikaci pro přepis, velikost modelu, přijatelnou přesnost a dobu zpracování - nikoli jednoduše „AI grafickou kartu“. Repozitář Whisper uvádí přibližné požadavky na paměť pro jednotlivé velikosti modelu. Ty jsou výchozím bodem pro tuto implementaci, nikoli univerzálním příslibem pro každou aplikaci, která na ní staví.

Větší model může potřebovat více paměti. Menší může být dostatečně přesný a dokončit práci dříve. Pokud CPU zvládne příležitostnou nahrávku zpracovat dříve, než ji potřebujete, nové GPU by řešilo plánovací problém, který neexistuje.

Užitečná historická náhoda

První grafický hardware nebyl navržen s ohledem na moderní jazykové modely. Stal se užitečným proto, že architektura vytvořená pro vykreslování pixelů vyhovovala také velké části paralelní matematiky stojící za neuronovými sítěmi. Programovatelný software otevřel tuto náhodnou vhodnost vědcům a vývojářům; desetiletí poptávky po grafice přitom neustále zdokonalovala příslušné technologie.

GPU nepoháněla boom AI jen proto, že byla rychlá. Byla paralelní, programovatelná a obklopená softwarem schopným proměnit tuto strukturu v užitečnou práci.

Prohlédněte si GPU pro AI a strojové učení, se kterými GPUsed pracuje, přečtěte si co dělá NPU nebo porovnejte kapacitu VRAM a její omezení. Pokud řešíte nákup, začněte u zátěže, nikoli u největšího názvu modelu.

More Blog GPUsed