Nesta aula
A máquina entra no fim do projeto, não no começo.
Toda semana alguém me manda a foto de um computador caro e pergunta "serve para IA?". A resposta honesta é sempre a mesma: serve para qual tarefa, com qual modelo, para quantas pessoas ao mesmo tempo? Sem isso, não existe "serve". Nesta aula eu te dou as três peças que importam de verdade, as referências práticas do que cabe em cada tipo de máquina, e um método para dimensionar sem comprar por impulso. No fim, você vai olhar a ficha do seu próprio computador e saber o que ele aguenta.
- Ao final, você vai entender o papel da memória, da banda de memória e da GPU, e por que a memória vem primeiro.
- Vai saber o que cabe num notebook comum, num desktop com placa de vídeo, num Mac com memória unificada e numa máquina dedicada.
- Vai sair com um entregável: a ficha de dimensionamento do seu computador, com a faixa de modelo que ele roda.
As três peças: memória, banda e processamento
Pense na cozinha de um restaurante. A memória é o tamanho da bancada: define quantos ingredientes cabem ao mesmo tempo. A banda de memória é a velocidade com que o ajudante traz os ingredientes da despensa até a bancada. E o processamento (a GPU ou o processador) é o número de cozinheiros cortando e mexendo.
Um modelo de IA é um ingrediente que precisa estar inteiro na bancada enquanto trabalha. Por isso a memória vem primeiro: se o modelo não cabe, nada mais importa. Depois, para cada token que o modelo escreve, ele precisa reler os seus bilhões de parâmetros. Isso é tráfego de despensa para bancada o tempo todo. Quanto maior a banda, mais tokens por segundo. E os cozinheiros (a GPU) fazem a conta em si; eles importam mais na hora de ler um documento longo de uma vez do que na hora de escrever a resposta.
Três tipos de memória
- RAM comum, a do computador. Todo modelo pode rodar nela, só que devagar, porque a banda da RAM comum é modesta e o processador não foi feito para isso.
- Memória da placa de vídeo (VRAM). É onde um modelo roda rápido num computador com placa dedicada. O limite é o tamanho dela: 8, 12, 16, 24 GB e por aí vai.
- Memória unificada, dos Macs com chip Apple e de máquinas como o DGX Spark. Processador e GPU compartilham a mesma memória, então o modelo pode usar quase tudo o que a máquina tem. É o que permite rodar modelos grandes numa caixa pequena.
Dica
Quando for olhar uma máquina, pergunte primeiro "quanta memória fica disponível para o modelo?" e só depois "qual é a banda?". Preço vem por último. Uma máquina cara com pouca memória de vídeo é um erro comum e caro.
O que cabe em cada tipo de máquina
Vou usar as referências dos guias técnicos de 2026 e das fichas oficiais dos fabricantes, que são as fontes que eu confio. Números fora disso, confira na página do modelo.
| Máquina | Memória para o modelo | Faixa de modelo | Para que serve |
|---|---|---|---|
| Notebook comum | 8 a 16 GB de RAM | Modelos pequenos; com 16 GB, cerca de 8B | Aprender, piloto de uma pessoa, tarefas simples |
| Desktop com placa de vídeo | Placa de 24 GB | 27 a 30B | Equipe pequena, documentos, atendimento interno |
| Estação de trabalho | Placa de 32 a 48 GB | Cerca de 30B com folga para contexto e usuários | Servidor interno de uma empresa média |
| Mac Studio (chip M5 Ultra) | Até 512 GB unificados | Modelos muito grandes, inteiros no dispositivo | Rodar modelo de ponta em casa; até quatro máquinas ligadas por Thunderbolt 5 |
| Máquina dedicada (ex.: DGX Spark) | 128 GB unificados | Modelos de até 200B; ajuste fino até 70B; quatro unidades chegam a 700B | Quem trabalha no ecossistema NVIDIA e quer treinar ou ajustar |
Dois detalhes que as análises independentes apontam e que mudam a decisão. O DGX Spark tem banda de memória modesta e gera texto em ritmo mais lento que placas dedicadas, apesar de caber modelos grandes; é o caminho natural para quem já trabalha com as ferramentas da NVIDIA. O Mac Studio aposta em muita memória e banda, o que favorece rodar modelos grandes para uso, não para treinar. Nenhum dos dois é "o melhor": são respostas a perguntas diferentes.
Exemplo real
Um escritório de advocacia com quinze pessoas queria uma IA para ler contratos de cinquenta páginas. O sócio tinha uma proposta de servidor pronta na mesa. Antes de assinar, testou num computador de mesa que já existia, com uma placa de 24 GB, um modelo de 27B com janela de contexto longa. Ficou lento para dez pessoas ao mesmo tempo, mas resolveu para as três que de fato leem contrato. O servidor não foi comprado. A máquina que existia foi promovida.
A conta de guardanapo
Você não precisa de fórmula. Precisa de três linhas.
- Tamanho do modelo carregado. A biblioteca do Ollama mostra, para cada versão, o tamanho do download. Esse número é uma boa aproximação do que o modelo ocupa em memória quando carregado.
- Folga para o contexto. Conversa longa e documento anexado ocupam memória além do modelo. Quanto maior a janela que você pretende usar, maior a folga. Um contrato inteiro na conversa pede bem mais do que uma pergunta de uma linha.
- Folga para o sistema e as outras pessoas. O sistema operacional e os outros programas também precisam de memória. E cada pessoa conversando ao mesmo tempo com o modelo pede o seu próprio contexto.
Some as três linhas. Se o resultado passa da memória disponível, ou você escolhe um modelo menor, ou uma versão mais quantizada, ou reduz a janela de contexto, ou aceita que a máquina vai usar a RAM comum e ficar lenta. Todas são escolhas válidas; a ruim é não escolher e descobrir na frente da equipe.
Velocidade: quando ela importa e quando não
Para uso interativo, o que importa é o modelo escrever mais rápido do que a pessoa lê. Um modelo de 8B num notebook razoável costuma dar conta disso; um de 30B na RAM comum, não. Para processamento em lote, tipo classificar mil notas fiscais de madrugada, velocidade vira tempo total: se cada nota leva alguns segundos, mil notas cabem numa noite; se leva um minuto, não cabem. Meça na sua máquina, com o seu modelo, na aula 6. Não confie em número de terceiro.
Cuidado
Quantas pessoas ao mesmo tempo? Uma máquina que responde bem para uma pessoa pode engasgar com cinco. Se a IA vai servir a equipe inteira pelo navegador (aula 5), dimensione para o pico, não para a média, ou combine horários.
Dimensionar sem comprar por impulso
O método é simples e chato, o que é um elogio em infraestrutura.
1. Tarefa e modelo
Você já tem: a tabela da aula 1 e os dois candidatos da aula 2. Eles definem a faixa de memória.
2. Teste no que existe
Instale o Ollama na máquina que você já tem (aula 4) e rode o modelo candidato. Se não cabe, rode a versão menor da mesma família.
3. Meça
Qualidade na sua tarefa, velocidade, quantas pessoas. Anote. É a aula 6.
4. Só então compre
Se o piloto provou valor e a máquina atual limita, agora você sabe exatamente o que falta: memória, banda ou os dois.
Uma alternativa para o passo 2 quando o modelo candidato é grande demais para qualquer máquina que você tem: alugar uma máquina com GPU por hora num provedor de nuvem só para o teste, usando documentos de exemplo, nunca os reais. Você mede a qualidade do modelo grande sem comprar nada, e decide se o ganho sobre o modelo pequeno justifica a máquina.
Se quiser ajuda para interpretar a ficha do seu computador, o assistente de nuvem serve bem, porque a ficha não tem dado sensível:
Repare no "não invente números de velocidade". Assistente adora dar um "tokens por segundo" com cara de certeza. Peça o que medir, e meça você.
Prática · 10 min
Preencha a ficha de dimensionamento do seu computador
- Descubra a memória RAM e o processador. Windows: Configurações, Sistema, Sobre. Mac: menu Apple, Sobre este Mac. Linux: no terminal,
free -hmostra a memória. - Descubra se há placa de vídeo dedicada e quanta memória ela tem. Windows: Gerenciador de Tarefas, aba Desempenho, GPU. Linux com placa NVIDIA:
nvidia-smi. Mac com chip Apple: a memória é unificada, use o total da máquina. - Anote o espaço livre em disco. Cada modelo ocupa alguns gigabytes; você vai querer dois ou três instalados.
- Abra a ficha dos dois modelos candidatos da aula 2 em ollama.com e anote o tamanho do download de cada versão que te interessa.
- Faça a conta de guardanapo: modelo + folga de contexto + folga de sistema e pessoas. Conclua a faixa que cabe com conforto.
- Escreva uma linha final: "esta máquina serve para o piloto? sim / não / só com modelo menor". Se a resposta for "não", anote o que falta, sem ainda comprar.
Resumo da aula
- Memória define o que cabe; banda de memória define a velocidade; processamento ajuda a ler documentos longos.
- Referências: 16 GB de RAM roda cerca de 8B; placa de 24 GB roda 27 a 30B; placa de 32 a 48 GB, 30B com folga.
- Memória unificada (Mac Studio até 512 GB, DGX Spark com 128 GB) permite modelos grandes numa caixa pequena, cada uma com sua vantagem.
- Conta de guardanapo: modelo carregado + contexto + sistema e pessoas simultâneas.
- Ordem: tarefa, teste na máquina que existe, medição, e só então compra.
- Peça ao assistente o que medir, não números de velocidade.
Quiz da aula
Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.
Isaque Victor cursos gratuitos