Módulo 1 · Por que local

Requisitos de máquina: o que cabe em cada computador

Aula 3 de 15 Aula de 32 min Atualizado em 29 de setembro de 2026
Progresso no curso20%

Nesta aula

A máquina entra no fim do projeto, não no começo.

Toda semana alguém me manda a foto de um computador caro e pergunta "serve para IA?". A resposta honesta é sempre a mesma: serve para qual tarefa, com qual modelo, para quantas pessoas ao mesmo tempo? Sem isso, não existe "serve". Nesta aula eu te dou as três peças que importam de verdade, as referências práticas do que cabe em cada tipo de máquina, e um método para dimensionar sem comprar por impulso. No fim, você vai olhar a ficha do seu próprio computador e saber o que ele aguenta.

As três peças: memória, banda e processamento

Pense na cozinha de um restaurante. A memória é o tamanho da bancada: define quantos ingredientes cabem ao mesmo tempo. A banda de memória é a velocidade com que o ajudante traz os ingredientes da despensa até a bancada. E o processamento (a GPU ou o processador) é o número de cozinheiros cortando e mexendo.

Um modelo de IA é um ingrediente que precisa estar inteiro na bancada enquanto trabalha. Por isso a memória vem primeiro: se o modelo não cabe, nada mais importa. Depois, para cada token que o modelo escreve, ele precisa reler os seus bilhões de parâmetros. Isso é tráfego de despensa para bancada o tempo todo. Quanto maior a banda, mais tokens por segundo. E os cozinheiros (a GPU) fazem a conta em si; eles importam mais na hora de ler um documento longo de uma vez do que na hora de escrever a resposta.

Três tipos de memória

Dica

Quando for olhar uma máquina, pergunte primeiro "quanta memória fica disponível para o modelo?" e só depois "qual é a banda?". Preço vem por último. Uma máquina cara com pouca memória de vídeo é um erro comum e caro.

O que cabe em cada tipo de máquina

Vou usar as referências dos guias técnicos de 2026 e das fichas oficiais dos fabricantes, que são as fontes que eu confio. Números fora disso, confira na página do modelo.

MáquinaMemória para o modeloFaixa de modeloPara que serve
Notebook comum8 a 16 GB de RAMModelos pequenos; com 16 GB, cerca de 8BAprender, piloto de uma pessoa, tarefas simples
Desktop com placa de vídeoPlaca de 24 GB27 a 30BEquipe pequena, documentos, atendimento interno
Estação de trabalhoPlaca de 32 a 48 GBCerca de 30B com folga para contexto e usuáriosServidor interno de uma empresa média
Mac Studio (chip M5 Ultra)Até 512 GB unificadosModelos muito grandes, inteiros no dispositivoRodar modelo de ponta em casa; até quatro máquinas ligadas por Thunderbolt 5
Máquina dedicada (ex.: DGX Spark)128 GB unificadosModelos de até 200B; ajuste fino até 70B; quatro unidades chegam a 700BQuem trabalha no ecossistema NVIDIA e quer treinar ou ajustar

Dois detalhes que as análises independentes apontam e que mudam a decisão. O DGX Spark tem banda de memória modesta e gera texto em ritmo mais lento que placas dedicadas, apesar de caber modelos grandes; é o caminho natural para quem já trabalha com as ferramentas da NVIDIA. O Mac Studio aposta em muita memória e banda, o que favorece rodar modelos grandes para uso, não para treinar. Nenhum dos dois é "o melhor": são respostas a perguntas diferentes.

Exemplo real

Um escritório de advocacia com quinze pessoas queria uma IA para ler contratos de cinquenta páginas. O sócio tinha uma proposta de servidor pronta na mesa. Antes de assinar, testou num computador de mesa que já existia, com uma placa de 24 GB, um modelo de 27B com janela de contexto longa. Ficou lento para dez pessoas ao mesmo tempo, mas resolveu para as três que de fato leem contrato. O servidor não foi comprado. A máquina que existia foi promovida.

A conta de guardanapo

Você não precisa de fórmula. Precisa de três linhas.

  1. Tamanho do modelo carregado. A biblioteca do Ollama mostra, para cada versão, o tamanho do download. Esse número é uma boa aproximação do que o modelo ocupa em memória quando carregado.
  2. Folga para o contexto. Conversa longa e documento anexado ocupam memória além do modelo. Quanto maior a janela que você pretende usar, maior a folga. Um contrato inteiro na conversa pede bem mais do que uma pergunta de uma linha.
  3. Folga para o sistema e as outras pessoas. O sistema operacional e os outros programas também precisam de memória. E cada pessoa conversando ao mesmo tempo com o modelo pede o seu próprio contexto.

Some as três linhas. Se o resultado passa da memória disponível, ou você escolhe um modelo menor, ou uma versão mais quantizada, ou reduz a janela de contexto, ou aceita que a máquina vai usar a RAM comum e ficar lenta. Todas são escolhas válidas; a ruim é não escolher e descobrir na frente da equipe.

Velocidade: quando ela importa e quando não

Para uso interativo, o que importa é o modelo escrever mais rápido do que a pessoa lê. Um modelo de 8B num notebook razoável costuma dar conta disso; um de 30B na RAM comum, não. Para processamento em lote, tipo classificar mil notas fiscais de madrugada, velocidade vira tempo total: se cada nota leva alguns segundos, mil notas cabem numa noite; se leva um minuto, não cabem. Meça na sua máquina, com o seu modelo, na aula 6. Não confie em número de terceiro.

Cuidado

Quantas pessoas ao mesmo tempo? Uma máquina que responde bem para uma pessoa pode engasgar com cinco. Se a IA vai servir a equipe inteira pelo navegador (aula 5), dimensione para o pico, não para a média, ou combine horários.

Dimensionar sem comprar por impulso

O método é simples e chato, o que é um elogio em infraestrutura.

1. Tarefa e modelo

Você já tem: a tabela da aula 1 e os dois candidatos da aula 2. Eles definem a faixa de memória.

2. Teste no que existe

Instale o Ollama na máquina que você já tem (aula 4) e rode o modelo candidato. Se não cabe, rode a versão menor da mesma família.

3. Meça

Qualidade na sua tarefa, velocidade, quantas pessoas. Anote. É a aula 6.

4. Só então compre

Se o piloto provou valor e a máquina atual limita, agora você sabe exatamente o que falta: memória, banda ou os dois.

Uma alternativa para o passo 2 quando o modelo candidato é grande demais para qualquer máquina que você tem: alugar uma máquina com GPU por hora num provedor de nuvem só para o teste, usando documentos de exemplo, nunca os reais. Você mede a qualidade do modelo grande sem comprar nada, e decide se o ganho sobre o modelo pequeno justifica a máquina.

Se quiser ajuda para interpretar a ficha do seu computador, o assistente de nuvem serve bem, porque a ficha não tem dado sensível:

Contexto: quero rodar um modelo de linguagem aberto localmente com o Ollama, para uma equipe de 4 pessoas de uma imobiliária, resumindo contratos de até 30 páginas. Tarefa: com base na ficha abaixo, diga qual faixa de tamanho de modelo (em bilhões de parâmetros) cabe com folga nesta máquina, se ela vai rodar na placa de vídeo ou na memória comum, e o que limitaria primeiro: memória, banda ou número de usuários simultâneos. Não invente números de velocidade; diga o que eu deveria medir. Ficha: sistema Windows 11; processador de 8 núcleos; 32 GB de RAM; placa de vídeo com 12 GB de memória; disco com 400 GB livres. Formato: 3 parágrafos curtos: o que cabe, o que limita, o que medir.

Repare no "não invente números de velocidade". Assistente adora dar um "tokens por segundo" com cara de certeza. Peça o que medir, e meça você.

Prática · 10 min

Preencha a ficha de dimensionamento do seu computador

  1. Descubra a memória RAM e o processador. Windows: Configurações, Sistema, Sobre. Mac: menu Apple, Sobre este Mac. Linux: no terminal, free -h mostra a memória.
  2. Descubra se há placa de vídeo dedicada e quanta memória ela tem. Windows: Gerenciador de Tarefas, aba Desempenho, GPU. Linux com placa NVIDIA: nvidia-smi. Mac com chip Apple: a memória é unificada, use o total da máquina.
  3. Anote o espaço livre em disco. Cada modelo ocupa alguns gigabytes; você vai querer dois ou três instalados.
  4. Abra a ficha dos dois modelos candidatos da aula 2 em ollama.com e anote o tamanho do download de cada versão que te interessa.
  5. Faça a conta de guardanapo: modelo + folga de contexto + folga de sistema e pessoas. Conclua a faixa que cabe com conforto.
  6. Escreva uma linha final: "esta máquina serve para o piloto? sim / não / só com modelo menor". Se a resposta for "não", anote o que falta, sem ainda comprar.
Entregável: a ficha de dimensionamento do seu computador: sistema, processador, memória, placa de vídeo, disco livre, faixa de modelo que cabe e a decisão sobre o piloto.

Resumo da aula

Quiz da aula

Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.

Aula 3 de 15

Antes de seguir para a próxima aula

Coloque em prática o que viu. As caixas ficam marcadas neste navegador, para você voltar depois.

Ficou com dúvida nesta aula? O time da IV Help responde pessoalmente no WhatsApp.

Perguntar no WhatsApp