Módulo 1 · Por que local

O mapa dos modelos abertos

Aula 2 de 15 Aula de 30 min Atualizado em 29 de setembro de 2026
Progresso no curso13%

Nesta aula

Há dois anos, "modelo aberto" queria dizer "modelo mais fraco". Isso acabou.

Em setembro de 2026, os modelos cujos pesos qualquer um pode baixar estão entre os mais capazes do mundo em código, raciocínio e leitura de imagem. Para o seu negócio, isso abre uma porta que antes não existia: usar IA de ponta sem ficar preso a um único fornecedor e, quando precisar, sem mandar dado nenhum para fora. Mas o mapa é confuso de propósito: nomes parecidos, tamanhos que não dizem o que parecem, licenças com letra miúda. Esta aula é o mapa. No fim dela, você vai olhar uma ficha de modelo e entender o que está lendo.

O que é, afinal, um modelo

Um modelo de linguagem é um arquivo grande. Dentro dele há bilhões de números, chamados de parâmetros ou pesos, ajustados durante o treino para prever qual palavra vem depois da outra. Quando você digita uma pergunta, o programa que roda o modelo (no nosso caso, o Ollama) quebra o texto em pedaços chamados tokens, mais ou menos sílabas ou palavras curtas, passa por esses números e produz a resposta, token a token.

Três medidas importam para quem vai rodar isso em casa:

"Pesos abertos" não é "código aberto"

Aqui vai uma distinção que a própria comunidade faz questão de lembrar: a maioria dos modelos que chamamos de abertos é de pesos abertos. Você pode baixar o arquivo e usar. Mas nem sempre tem acesso a tudo que gerou o modelo: os dados de treino, a receita completa. Isso não é um problema para uma empresa que quer usar o modelo; é um problema só para quem quer reproduzi-lo. Mas muda uma coisa: a licença continua valendo, e é ela que diz o que você pode fazer.

Dica

Quando alguém disser "esse modelo é open source", pergunte: "qual é a licença?". Se a pessoa não souber responder, ela ainda não leu a ficha. E se ela não leu, você vai ler.

As famílias que você vai encontrar

Não existe "o melhor modelo". Existem famílias, cada uma com vários tamanhos e versões, publicadas por empresas e laboratórios diferentes. As que aparecem o tempo todo na biblioteca do Ollama e no Hugging Face são estas:

Llama

A família que popularizou os modelos abertos. Vários tamanhos, muito material de apoio na internet, boa para começar. Licença própria: leia as condições antes de usar em produto.

Qwen

Família com tamanhos que vão do minúsculo ao enorme, forte em código e em vários idiomas. Costuma se sair bem em português nas minhas comparações.

Gemma

Família derivada da pesquisa do Google, com tamanhos pequenos e médios que cabem em notebook. Termos de uso próprios, que também merecem leitura.

DeepSeek

Conhecida pelos modelos de raciocínio e por publicar sob licença MIT. O V4.1 Flash, de setembro, tem 552 bilhões de parâmetros no total, mas só 8 a 16 bilhões ativos, janela de 1 milhão de tokens e lê imagens.

Mistral

Família europeia, com modelos compactos e eficientes, muito usados em empresas que querem velocidade num hardware modesto.

Phi

Família de modelos pequenos, pensados para rodar com pouca memória. Bons para tarefas bem definidas: classificar, extrair, resumir.

Há ainda os gigantes que dominam os rankings de setembro: o Kimi K3, com 2,8 trilhões de parâmetros e licença derivada da MIT, apontado como o mais forte no geral e em código; e o GLM-5.2, com 744 bilhões, licença MIT, que lidera os testes abertos de programação de longa duração. Esses não vão rodar no computador da sua contabilidade. Eles importam por outro motivo: como são abertos, vários provedores oferecem os mesmos modelos por API, o que quebra a dependência de um fornecedor só. Você pode trocar de provedor sem trocar de modelo.

Exemplo real

Uma escola de idiomas queria uma IA para corrigir redações dos alunos, em português e inglês, sem mandar o texto dos adolescentes para fora. A lista inicial tinha seis modelos. A ficha eliminou três na hora: um só entendia inglês bem, um tinha licença que excluía o uso pretendido, um era grande demais para o computador da secretaria. Sobraram três, de famílias diferentes, e o teste da aula 6 escolheu entre eles.

Tamanho: o número que engana

A primeira coisa que todo mundo olha é o "B" do nome. Ele importa, mas não sozinho.

O que cabe onde

Os guias deste ano dão referências práticas: um notebook com 16 GB de memória roda modelos de cerca de 8 bilhões de parâmetros; uma placa de vídeo de 24 GB roda modelos de 27 a 30 bilhões; uma estação de trabalho com placa de 32 a 48 GB fica nessa mesma faixa de 30 bilhões com mais folga. Acima disso, estamos falando de máquinas especiais ou de vários computadores ligados, assunto da próxima aula.

Parâmetros ativos e totais

Modelos recentes usam uma arquitetura em que só uma parte dos parâmetros "acorda" para cada token. O DeepSeek V4.1 Flash é o exemplo do momento: 552 bilhões no total, 8 bilhões ativos na leitura, 16 na escrita. Na prática, ele responde com a velocidade de um modelo pequeno. Mas a memória precisa comportar o conjunto inteiro. Um detalhe honesto que a própria fonte registra: a DeepSeek não publicou os requisitos de hardware para rodar esse modelo por conta própria. Ou seja, velocidade e memória são duas contas separadas, e o nome do modelo só conta metade da história.

Quantização: a versão compactada

Quase todo modelo que você baixa pelo Ollama vem quantizado: os números internos foram arredondados para ocupar menos espaço. Perde-se um pouco de precisão e ganha-se muito em memória. Para a maioria das tarefas de escritório a diferença não aparece; para cálculo fino ou texto muito técnico, pode aparecer. É por isso que a mesma família tem várias versões na biblioteca: escolha a que cabe na sua máquina e teste.

Modelos de raciocínio

Alguns modelos "pensam antes de responder": escrevem um raciocínio interno e só depois a resposta. São melhores em problemas de várias etapas e piores em velocidade. Para classificar notas fiscais, você não quer isso. Para analisar um contrato cheio de condições cruzadas, talvez queira.

Cuidado

Ranking mede tarefas genéricas, quase sempre em inglês. A sua tarefa é específica, em português, com o vocabulário da sua área. Um modelo bem colocado no ranking pode ir mal no seu caso, e um "menor" pode resolver com folga. Ficha filtra; teste decide.

Licença: o que "aberto" permite

Aberto tem graus. As licenças que você vai encontrar cabem em três grupos:

GrupoExemplosO que costuma permitirO que fazer
PermissivasMIT, Apache 2.0Uso comercial livre, modificar, redistribuir, com poucas obrigações (manter o aviso de licença)Ler uma vez, seguir em frente
Próprias da famíliaLicenças da Llama, termos da Gemma e outrasUso comercial em geral, mas com condições: limites de escala, usos proibidos, política de uso aceitávelLer com atenção; anotar as condições no seu registro
Restritas"Só pesquisa", "não comercial"Testar e estudar; não usar em produto ou atendimento ao clienteDescartar para uso na empresa

A lição do Radar de setembro vale repetir: licença MIT permite uso comercial livre; outras têm restrições que precisam ser lidas antes de colocar em produção. E as armadilhas que os guias apontam são justamente estas: pular a leitura da licença, tratar modelo antigo como seguro, e não medir a qualidade continuamente.

Onde ler a ficha

Dois lugares bastam. A biblioteca de modelos em ollama.com mostra, para cada modelo, os tamanhos disponíveis, a janela de contexto, se lê imagem e a licença. O Hugging Face é o repositório maior, onde os laboratórios publicam os pesos com um "cartão do modelo": descrição, idiomas, uso pretendido, limitações e licença. Se a ficha for vaga sobre a licença, isso já é informação: desconfie.

Você pode pedir a um assistente de nuvem para organizar a comparação, mas com uma regra: ele resume, você confere na fonte. Este é o pedido que eu uso:

Contexto: tenho uma oficina mecânica e quero um modelo aberto para rodar no computador da recepção, com 16 GB de memória, para transformar a descrição falada do cliente em ordem de serviço estruturada, em português. Tarefa: liste 3 famílias de modelos abertos que costumam ter versões de até 8 bilhões de parâmetros, com bom desempenho em português, e para cada uma diga: tamanho sugerido, se tem versão de raciocínio, e o tipo de licença (permissiva, própria ou restrita). Marque com "confirmar" qualquer informação que possa ter mudado desde o seu treinamento. Formato: tabela com as colunas Família, Tamanho sugerido, Raciocínio (sim/não), Licença, Observação.

A coluna "confirmar" é o que separa uso responsável de uso ingênuo. O assistente não sabe o que mudou desde o treino dele; o mercado de modelos muda a cada trimestre. Você abre a ficha e confere.

Prática · 10 min

Escolha dois candidatos para uma tarefa e justifique

  1. Pegue a tabela da aula 1 e escolha uma tarefa classificada como local ou híbrido. Escreva a tarefa em uma frase.
  2. Anote a memória do computador em que a tarefa rodaria (Windows: Configurações, Sistema, Sobre; Mac: menu Apple, Sobre este Mac). Isso define o tamanho máximo do modelo, seguindo as referências desta aula.
  3. Abra a biblioteca de modelos em ollama.com e escolha três famílias diferentes. Para cada uma, abra a ficha e anote: tamanho que cabe na sua máquina, janela de contexto, se lê imagem, licença.
  4. Elimine o que não serve: licença restrita, modelo grande demais, sem bom suporte a português.
  5. Fique com dois candidatos. Escreva, para cada um, uma justificativa de duas frases: por que este tamanho e por que esta licença é aceitável para o seu uso.
Entregável: uma ficha com a tarefa, a memória disponível e dois modelos candidatos, cada um com tamanho, licença e justificativa. Na aula 6 você vai testá-los de verdade.

Resumo da aula

Quiz da aula

Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.

Aula 2 de 15

Antes de seguir para a próxima aula

Coloque em prática o que viu. As caixas ficam marcadas neste navegador, para você voltar depois.

Ficou com dúvida nesta aula? O time da IV Help responde pessoalmente no WhatsApp.

Perguntar no WhatsApp