Die Hardware, die heute Sätze schreibt und Tumore erkennt, verdankt einen Teil ihrer Entwicklung einem älteren Problem: sehr viele Pixel zu zeichnen, bevor ein Spieler bemerkt, dass die Landschaft verspätet erschienen ist.
GPUs wurden zu einem zentralen Bestandteil moderner KI, weil neuronale Netze enorme Mengen mathematischer Arbeit enthalten, die aufgeteilt und parallel ausgeführt werden können. Grafiken erforderten dieselbe grundlegende Fähigkeit. Software machte aus einem spezialisierten Bildprozessor anschließend eine programmierbare Engine für Matrizen, Modelle und Daten.
Zuerst kamen die Pixel
Ein modernes Spiel verarbeitet wiederholt Geometrie, Texturen, Beleuchtung, Farben und Schatten über Millionen von Pixeln hinweg. Ein großer Teil dieser Arbeit lässt sich in viele ähnliche Berechnungen aufteilen. Statt eine einzige äußerst leistungsfähige Arbeitskraft zu bitten, den Bildschirm von links nach rechts zu bemalen, organisiert die Grafikhardware eine riesige Werkstatt und hält viele kleinere Arbeitskräfte gleichzeitig beschäftigt.
Eine CPU ist anders ausgelegt. Ihre kleinere Zahl leistungsfähiger, flexibler Kerne übernimmt Aufgaben des Betriebssystems, Anwendungslogik, Verzweigungsentscheidungen und Aufgaben, bei denen der nächste Schritt vom Ergebnis des vorherigen abhängt. Keine der beiden Architekturen ist grundsätzlich überlegen. Sowohl ein Gerichtssaal als auch eine Keksfabrik beschäftigen Menschen; das bedeutet nicht, dass sie vom gleichen Personaleinsatz profitieren.
Dann wurden aus den Pixeln Tensoren
Neuronale Netze kombinieren wiederholt große Zahlenarrays, wenden Operationen an und leiten die Ergebnisse durch viele Schichten. Beim Training wird das Modell angepasst; bei der Inferenz wird es verwendet. Die zugrunde liegende Arbeit kann äußerst anspruchsvoll sein, doch ein großer Teil der rechenintensiven Aufgaben lässt sich weiterhin auf einen Parallelprozessor verteilen.
Eine CPU kann diese Berechnungen ausführen. Der Vorteil der GPU zeigt sich, wenn die Aufgabe genügend geeignete Arbeit enthält, um ihre parallelen Ressourcen auszulasten. Das ist der Zusammenhang:
- Grafik umfasst miteinander verbundene Berechnungen, die über Pixel, Geometrie und Samples verteilt sind;
- KI umfasst miteinander verbundene Berechnungen, die über Modellgewichte, Aktivierungen und Daten verteilt sind;
- Eine GPU ist dafür ausgelegt, eine große parallele Arbeitslast durch das System zu bewegen.
Der berufliche Wandel vollzog sich in vier Akten
- Fest verdrahtete Grafikhardware: Frühe GPUs beschleunigten die spezialisierte Arbeit, die zum Zeichnen von Bildern und 3D-Szenen erforderlich war.
- Programmierbare Shader und allgemeine Berechnungen: Die Hardware wurde flexibel genug, damit Entwickler umfangreichere parallele Probleme ausdrücken konnten.
- Praxistaugliche Softwareplattformen: Systeme wie CUDA und ROCm stellten Programmiermodelle, Compiler, Bibliotheken und Tools bereit.
- Deep Learning im großen Maßstab: Forschungsarbeiten wie AlexNet aus dem Jahr 2012 zeigten, wie GPU-Computing das Training eines großen Bilderkennungsnetzes praktikabel machen konnte.
Der Kreislauf verstärkte sich anschließend selbst. Mehr Forscher nutzten GPU-Computing; die Software wurde besser; Chipdesigner ergänzten Funktionen für Machine-Learning-Operationen; größere Arbeitslasten wurden praktikabel; die Nachfrage finanzierte die nächste Hardwaregeneration.
Software ist der Grund, warum ein schneller Chip nützlich wurde
Rohe parallele Rechenleistung ist noch kein nutzbares Ökosystem. Entwickler benötigen Compiler, Laufzeitumgebungen, Profiler und beschleunigte Bibliotheken; Forscher brauchen Frameworks, die ein Modell ausdrücken können, ohne jede Low-Level-Operation von Hand zu schreiben.
NVIDIAs CUDA Programming Guide beschreibt sein Programmiermodell und seine Ausführungsplattform. Die ROCm-Dokumentation von AMD behandelt den entsprechenden offenen Software-Stack für unterstützte AMD-Hardware. Die Framework-Unterstützung erklärt, warum zwei theoretisch leistungsfähige GPUs für eine Anwendung einen sehr unterschiedlichen praktischen Wert haben können.
VRAM ist der Raum, in dem die Arbeit stattfindet
Ein Modell und seine temporären Arbeitsdaten müssen in den verfügbaren Speicher passen. Je nach Aufgabe umfasst das Gewichte, Prompts, Bilder, Batches und Zwischenergebnisse. Eine GPU kann theoretisch schnell genug sein und eine Arbeitslast trotzdem nicht ausführen, weil kein Platz für sie vorhanden ist.
Das führt zu einer Besonderheit bei gebrauchter Hardware: Eine ältere professionelle Karte mit mehr Speicher kann für ein Modell weiterhin nützlich sein, das nicht auf eine neuere, schnellere Gaming-Karte passt. Umgekehrt gilt dasselbe. Wenn die vorgesehene Software wenig Speicher verwendet und von neueren Rechenfunktionen profitiert, ist es eine teure Art, eine technische Spezifikation zu bewundern, Kapazität zu kaufen, die sie nie nutzt.
Auch die Speicherbandbreite spielt eine Rolle. Tausende parallele Arbeitskräfte sind nicht produktiv, wenn die Daten sie durch einen Briefkastenschlitz erreichen.
Benötigt jede KI-Aufgabe eine GPU?
Nein. Kleine Modelle können auf CPUs ausgeführt werden. Smartphones und neuere Computer enthalten zunehmend NPUs, die dafür ausgelegt sind, unterstützte neuronale Operationen effizient auszuführen. Große Anbieter entwickeln außerdem zweckgebundene Beschleuniger wie Googles Tensor Processing Units.
Die GPU bleibt wichtig, weil sie hohe parallele Leistung, Programmierbarkeit, lokalen Speicher und ausgereifte Tools kombiniert. Diese Kombination eignet sich für viele Aufgaben, macht sie aber nicht zur richtigen Antwort auf jede Aufgabe, in der die Buchstaben A und I vorkommen.
Eine Gaming-GPU kann KI ausführen - wenn die Software mitspielt
Geeignete Gaming-Karten können Bildgenerierung, Transkription, Hochskalierung und kleinere Sprachmodelle lokal verarbeiten. Prüfe die konkrete Anwendung statt einer allgemeinen Aussage wie „KI-ready“:
- Werden die GPU und das Betriebssystem unterstützt?
- Wie viel VRAM benötigen das ausgewählte Modell und der Batch?
- Welche numerischen Formate und Beschleunigungspfade sind verfügbar?
- Können Netzteil, Gehäuse und Kühlung die Karte unterstützen?
- Ist die erwartete Geschwindigkeit den Kauf von Hardware tatsächlich wert?
Ein praktisches Beispiel: ein Interview transkribieren
Angenommen, du möchtest Aufnahmen in Text umwandeln, ohne sie hochzuladen. Du wählst eine Transkriptionsanwendung, eine Modellgröße, eine akzeptable Genauigkeit und eine Bearbeitungszeit - nicht einfach eine „KI-Grafikkarte“. Das Whisper-Repository nennt ungefähre Speicheranforderungen für seine Modellgrößen. Diese sind ein Ausgangspunkt für diese Implementierung und kein universelles Versprechen für jede darauf aufbauende Anwendung.
Ein größeres Modell benötigt möglicherweise mehr Speicher. Ein kleineres ist vielleicht bereits genau genug. Wenn die CPU eine gelegentliche Aufnahme noch rechtzeitig verarbeitet, würde eine neue GPU ein Terminplanungsproblem lösen, das gar nicht existiert.
Der nützliche historische Zufall
Frühe Grafikhardware wurde nicht im Hinblick auf moderne Sprachmodelle entwickelt. Sie wurde nützlich, weil die zum Zeichnen von Pixeln entwickelte Architektur auch für einen großen Teil der parallelen Mathematik hinter neuronalen Netzen geeignet war. Programmierbare Software machte diesen Zufall der Eignung für Wissenschaftler und Entwickler zugänglich; jahrzehntelange Nachfrage nach Grafik verbesserte die Technik kontinuierlich.
GPUs trieben den KI-Boom nicht allein deshalb an, weil sie schnell waren. Sie waren parallel und programmierbar und verfügten über ein Softwareumfeld, das diese Struktur in nützliche Arbeit verwandeln konnte.
Sieh dir die von GPUsed angebotenen GPUs für KI und Machine Learning an, lies, was eine NPU macht, oder vergleiche VRAM-Kapazität und ihre Grenzen. Wenn es um einen Kauf geht, beginne mit der Arbeitslast, nicht mit dem größten Modellnamen.