O hardware que agora escreve frases e reconhece tumores deve parte da sua carreira a um problema mais antigo: desenhar um grande número de píxeis antes de um jogador reparar que o cenário chegou atrasado.
As GPUs tornaram-se centrais na IA moderna porque as redes neuronais contêm enormes quantidades de trabalho matemático que podem ser divididas e executadas em paralelo. Os gráficos exigiam a mesma competência geral. Depois, o software transformou um processador de imagem especializado num motor programável para matrizes, modelos e dados.
Primeiro vieram os píxeis
Um jogo moderno processa repetidamente geometria, texturas, iluminação, cor e sombras em milhões de píxeis. Grande parte desse trabalho pode ser dividida em muitos cálculos semelhantes. Em vez de pedir a um único trabalhador extremamente capaz que pinte o ecrã da esquerda para a direita, o hardware gráfico organiza uma enorme oficina e mantém muitos trabalhadores mais pequenos ocupados em conjunto.
Uma CPU é concebida de forma diferente. O seu número mais reduzido de núcleos potentes e flexíveis trata do trabalho do sistema operativo, da lógica das aplicações, de decisões condicionais e de tarefas em que o passo seguinte depende do resultado do anterior. Nenhuma das arquiteturas é universalmente superior. Um tribunal e uma fábrica de bolachas empregam pessoas; isso não significa que beneficiem do mesmo plano de pessoal.
Depois, os píxeis tornaram-se tensores
As redes neuronais combinam repetidamente grandes matrizes de números, aplicam operações e passam os resultados por muitas camadas. O treino ajusta o modelo; a inferência utiliza-o. O trabalho subjacente pode ser extremamente sofisticado, mas grande parte da aritmética pesada continua a poder ser dividida por um processador paralelo.
Uma CPU pode executar estes cálculos. A vantagem da GPU surge quando a tarefa contém trabalho suficiente e adequado para manter os seus recursos paralelos ocupados. Essa é a ligação:
- os gráficos envolvem cálculos relacionados distribuídos por píxeis, geometria e amostras;
- a IA envolve cálculos relacionados distribuídos por pesos do modelo, ativações e dados;
- uma GPU é construída para fazer passar uma grande carga de trabalho paralelo pela máquina.
A mudança de carreira aconteceu em quatro atos
- Hardware gráfico fixo: as primeiras GPUs aceleravam o trabalho especializado necessário para desenhar imagens e cenas 3D.
- Shaders programáveis e computação geral: o hardware tornou-se suficientemente flexível para que os programadores expressassem problemas paralelos mais abrangentes.
- Plataformas de software práticas: sistemas como o CUDA e o ROCm forneceram modelos de programação, compiladores, bibliotecas e ferramentas.
- Aprendizagem profunda em escala: investigação como a do AlexNet em 2012 demonstrou como a computação em GPU podia tornar prática a formação de uma grande rede de reconhecimento de imagens.
O ciclo reforçou-se a si próprio. Mais investigadores utilizaram computação em GPU; o software melhorou; os designers de chips acrescentaram funcionalidades para operações de aprendizagem automática; cargas de trabalho maiores tornaram-se práticas; a procura financiou outra geração de hardware.
O software é a razão pela qual um chip rápido se tornou útil
A aritmética paralela em bruto não constitui um ecossistema utilizável. Os programadores precisam de compiladores, ambientes de execução, ferramentas de análise de desempenho e bibliotecas aceleradas; os investigadores precisam de estruturas que permitam expressar um modelo sem escrever manualmente todas as operações de baixo nível.
O CUDA Programming Guide da NVIDIA descreve o seu modelo de programação e a plataforma de execução. A documentação do ROCm da AMD abrange a correspondente pilha de software aberta para hardware AMD compatível. O suporte das estruturas de software explica por que razão duas GPUs teoricamente capazes podem ter valores práticos muito diferentes para uma aplicação.
A VRAM é a sala onde o trabalho acontece
Um modelo e os seus dados temporários de trabalho têm de caber na memória disponível. Dependendo da tarefa, isso inclui pesos, prompts, imagens, lotes e resultados intermédios. Uma GPU pode ser suficientemente rápida em teoria e, ainda assim, não conseguir executar uma carga de trabalho por não haver espaço para a colocar.
Isto cria uma particularidade do hardware usado: uma placa profissional mais antiga com mais memória pode continuar a ser útil para um modelo que não cabe numa placa gaming mais recente e rápida. O inverso também é verdade. Se o software pretendido utilizar pouca memória e beneficiar de funcionalidades de computação mais recentes, comprar capacidade que nunca utiliza é uma forma dispendiosa de admirar uma especificação.
A largura de banda da memória também é importante. Milhares de trabalhadores paralelos não são produtivos quando os dados lhes chegam através de uma caixa de correio.
Todos os trabalhos de IA precisam de uma GPU?
Não. Os modelos pequenos podem ser executados em CPUs. Os telemóveis e os computadores recentes incluem cada vez mais NPUs concebidas para executar operações neuronais compatíveis de forma eficiente. Os grandes operadores também constroem aceleradores específicos, como as Tensor Processing Units da Google.
A GPU continua a ser importante porque combina elevado desempenho paralelo, programabilidade, memória local e ferramentas maduras. Essa combinação é adequada para muitas tarefas, sem fazer dela a resposta certa para todas as tarefas que contenham as letras A e I.
Uma GPU gaming pode executar IA - quando o software concorda
Placas gaming adequadas podem processar localmente geração de imagens, transcrição, aumento de resolução e modelos linguísticos mais pequenos. Verifique a aplicação exata em vez de confiar numa alegação genérica de “preparada para IA”:
- A GPU e o sistema operativo são compatíveis?
- De quanta VRAM precisa o modelo e o lote escolhidos?
- Que formatos numéricos e caminhos de aceleração estão disponíveis?
- A fonte de alimentação, a caixa e a refrigeração conseguem suportar a placa?
- A velocidade esperada justifica realmente comprar hardware para esse fim?
Um exemplo prático: transcrever uma entrevista
Suponha que quer transformar gravações em texto sem as carregar para a Internet. Está a escolher uma aplicação de transcrição, um tamanho de modelo, o nível de precisão aceitável e o tempo de processamento - não simplesmente uma “placa gráfica de IA”. O repositório do Whisper fornece requisitos aproximados de memória para os seus tamanhos de modelo, que constituem um ponto de partida para essa implementação, não uma promessa universal para todas as aplicações construídas à sua volta.
Um modelo maior pode precisar de mais memória. Um modelo mais pequeno pode já terminar com precisão suficiente. Se a CPU tratar de uma gravação ocasional antes de precisar dela, uma GPU nova resolveria um problema de agendamento que não existe.
O acidente histórico útil
O hardware gráfico inicial não foi concebido a pensar nos modelos linguísticos modernos. Tornou-se útil porque a arquitetura criada para desenhar píxeis também se adequava a grande parte da matemática paralela subjacente às redes neuronais. O software programável abriu esse acidente de adequação a cientistas e programadores; décadas de procura por gráficos continuaram a melhorar a maquinaria.
As GPUs não impulsionaram o boom da IA apenas por serem rápidas. Eram paralelas, programáveis e rodeadas de software capaz de transformar essa estrutura em trabalho útil.
Consulte as GPUs de IA e aprendizagem automática que a GPUsed comercializa, leia o que faz uma NPU ou compare a capacidade da VRAM e os seus limites. Se a questão for uma compra, comece pela carga de trabalho, não pelo nome do modelo maior.