Nesta aula
Há dois anos, "modelo aberto" queria dizer "modelo mais fraco". Isso acabou.
Em setembro de 2026, os modelos cujos pesos qualquer um pode baixar estão entre os mais capazes do mundo em código, raciocínio e leitura de imagem. Para o seu negócio, isso abre uma porta que antes não existia: usar IA de ponta sem ficar preso a um único fornecedor e, quando precisar, sem mandar dado nenhum para fora. Mas o mapa é confuso de propósito: nomes parecidos, tamanhos que não dizem o que parecem, licenças com letra miúda. Esta aula é o mapa. No fim dela, você vai olhar uma ficha de modelo e entender o que está lendo.
- Ao final, você vai saber o que é um modelo, um parâmetro e uma janela de contexto sem precisar de matemática.
- Vai reconhecer as principais famílias de modelos abertos e o que diferencia uma da outra.
- Vai sair com um entregável: dois modelos candidatos para uma tarefa da sua empresa, com a justificativa escrita.
O que é, afinal, um modelo
Um modelo de linguagem é um arquivo grande. Dentro dele há bilhões de números, chamados de parâmetros ou pesos, ajustados durante o treino para prever qual palavra vem depois da outra. Quando você digita uma pergunta, o programa que roda o modelo (no nosso caso, o Ollama) quebra o texto em pedaços chamados tokens, mais ou menos sílabas ou palavras curtas, passa por esses números e produz a resposta, token a token.
Três medidas importam para quem vai rodar isso em casa:
- Tamanho em parâmetros. Aparece como "3B", "8B", "70B": 3, 8 ou 70 bilhões. Mais parâmetros costumam significar mais capacidade e, com certeza, mais memória necessária.
- Janela de contexto. Quanto texto o modelo consegue "segurar" de uma vez, contando a sua pergunta, os documentos que você anexa e a resposta. Alguns modelos recentes chegam a 1 milhão de tokens; para um escritório, isso significa colocar um contrato inteiro e mais os anexos numa só conversa.
- Modalidade. Só texto, ou texto e imagem. Um modelo que lê imagem consegue olhar a foto de uma nota fiscal ou de um laudo escaneado.
"Pesos abertos" não é "código aberto"
Aqui vai uma distinção que a própria comunidade faz questão de lembrar: a maioria dos modelos que chamamos de abertos é de pesos abertos. Você pode baixar o arquivo e usar. Mas nem sempre tem acesso a tudo que gerou o modelo: os dados de treino, a receita completa. Isso não é um problema para uma empresa que quer usar o modelo; é um problema só para quem quer reproduzi-lo. Mas muda uma coisa: a licença continua valendo, e é ela que diz o que você pode fazer.
Dica
Quando alguém disser "esse modelo é open source", pergunte: "qual é a licença?". Se a pessoa não souber responder, ela ainda não leu a ficha. E se ela não leu, você vai ler.
As famílias que você vai encontrar
Não existe "o melhor modelo". Existem famílias, cada uma com vários tamanhos e versões, publicadas por empresas e laboratórios diferentes. As que aparecem o tempo todo na biblioteca do Ollama e no Hugging Face são estas:
Llama
A família que popularizou os modelos abertos. Vários tamanhos, muito material de apoio na internet, boa para começar. Licença própria: leia as condições antes de usar em produto.
Qwen
Família com tamanhos que vão do minúsculo ao enorme, forte em código e em vários idiomas. Costuma se sair bem em português nas minhas comparações.
Gemma
Família derivada da pesquisa do Google, com tamanhos pequenos e médios que cabem em notebook. Termos de uso próprios, que também merecem leitura.
DeepSeek
Conhecida pelos modelos de raciocínio e por publicar sob licença MIT. O V4.1 Flash, de setembro, tem 552 bilhões de parâmetros no total, mas só 8 a 16 bilhões ativos, janela de 1 milhão de tokens e lê imagens.
Mistral
Família europeia, com modelos compactos e eficientes, muito usados em empresas que querem velocidade num hardware modesto.
Phi
Família de modelos pequenos, pensados para rodar com pouca memória. Bons para tarefas bem definidas: classificar, extrair, resumir.
Há ainda os gigantes que dominam os rankings de setembro: o Kimi K3, com 2,8 trilhões de parâmetros e licença derivada da MIT, apontado como o mais forte no geral e em código; e o GLM-5.2, com 744 bilhões, licença MIT, que lidera os testes abertos de programação de longa duração. Esses não vão rodar no computador da sua contabilidade. Eles importam por outro motivo: como são abertos, vários provedores oferecem os mesmos modelos por API, o que quebra a dependência de um fornecedor só. Você pode trocar de provedor sem trocar de modelo.
Exemplo real
Uma escola de idiomas queria uma IA para corrigir redações dos alunos, em português e inglês, sem mandar o texto dos adolescentes para fora. A lista inicial tinha seis modelos. A ficha eliminou três na hora: um só entendia inglês bem, um tinha licença que excluía o uso pretendido, um era grande demais para o computador da secretaria. Sobraram três, de famílias diferentes, e o teste da aula 6 escolheu entre eles.
Tamanho: o número que engana
A primeira coisa que todo mundo olha é o "B" do nome. Ele importa, mas não sozinho.
O que cabe onde
Os guias deste ano dão referências práticas: um notebook com 16 GB de memória roda modelos de cerca de 8 bilhões de parâmetros; uma placa de vídeo de 24 GB roda modelos de 27 a 30 bilhões; uma estação de trabalho com placa de 32 a 48 GB fica nessa mesma faixa de 30 bilhões com mais folga. Acima disso, estamos falando de máquinas especiais ou de vários computadores ligados, assunto da próxima aula.
Parâmetros ativos e totais
Modelos recentes usam uma arquitetura em que só uma parte dos parâmetros "acorda" para cada token. O DeepSeek V4.1 Flash é o exemplo do momento: 552 bilhões no total, 8 bilhões ativos na leitura, 16 na escrita. Na prática, ele responde com a velocidade de um modelo pequeno. Mas a memória precisa comportar o conjunto inteiro. Um detalhe honesto que a própria fonte registra: a DeepSeek não publicou os requisitos de hardware para rodar esse modelo por conta própria. Ou seja, velocidade e memória são duas contas separadas, e o nome do modelo só conta metade da história.
Quantização: a versão compactada
Quase todo modelo que você baixa pelo Ollama vem quantizado: os números internos foram arredondados para ocupar menos espaço. Perde-se um pouco de precisão e ganha-se muito em memória. Para a maioria das tarefas de escritório a diferença não aparece; para cálculo fino ou texto muito técnico, pode aparecer. É por isso que a mesma família tem várias versões na biblioteca: escolha a que cabe na sua máquina e teste.
Modelos de raciocínio
Alguns modelos "pensam antes de responder": escrevem um raciocínio interno e só depois a resposta. São melhores em problemas de várias etapas e piores em velocidade. Para classificar notas fiscais, você não quer isso. Para analisar um contrato cheio de condições cruzadas, talvez queira.
Cuidado
Ranking mede tarefas genéricas, quase sempre em inglês. A sua tarefa é específica, em português, com o vocabulário da sua área. Um modelo bem colocado no ranking pode ir mal no seu caso, e um "menor" pode resolver com folga. Ficha filtra; teste decide.
Licença: o que "aberto" permite
Aberto tem graus. As licenças que você vai encontrar cabem em três grupos:
| Grupo | Exemplos | O que costuma permitir | O que fazer |
|---|---|---|---|
| Permissivas | MIT, Apache 2.0 | Uso comercial livre, modificar, redistribuir, com poucas obrigações (manter o aviso de licença) | Ler uma vez, seguir em frente |
| Próprias da família | Licenças da Llama, termos da Gemma e outras | Uso comercial em geral, mas com condições: limites de escala, usos proibidos, política de uso aceitável | Ler com atenção; anotar as condições no seu registro |
| Restritas | "Só pesquisa", "não comercial" | Testar e estudar; não usar em produto ou atendimento ao cliente | Descartar para uso na empresa |
A lição do Radar de setembro vale repetir: licença MIT permite uso comercial livre; outras têm restrições que precisam ser lidas antes de colocar em produção. E as armadilhas que os guias apontam são justamente estas: pular a leitura da licença, tratar modelo antigo como seguro, e não medir a qualidade continuamente.
Onde ler a ficha
Dois lugares bastam. A biblioteca de modelos em ollama.com mostra, para cada modelo, os tamanhos disponíveis, a janela de contexto, se lê imagem e a licença. O Hugging Face é o repositório maior, onde os laboratórios publicam os pesos com um "cartão do modelo": descrição, idiomas, uso pretendido, limitações e licença. Se a ficha for vaga sobre a licença, isso já é informação: desconfie.
Você pode pedir a um assistente de nuvem para organizar a comparação, mas com uma regra: ele resume, você confere na fonte. Este é o pedido que eu uso:
A coluna "confirmar" é o que separa uso responsável de uso ingênuo. O assistente não sabe o que mudou desde o treino dele; o mercado de modelos muda a cada trimestre. Você abre a ficha e confere.
Prática · 10 min
Escolha dois candidatos para uma tarefa e justifique
- Pegue a tabela da aula 1 e escolha uma tarefa classificada como local ou híbrido. Escreva a tarefa em uma frase.
- Anote a memória do computador em que a tarefa rodaria (Windows: Configurações, Sistema, Sobre; Mac: menu Apple, Sobre este Mac). Isso define o tamanho máximo do modelo, seguindo as referências desta aula.
- Abra a biblioteca de modelos em ollama.com e escolha três famílias diferentes. Para cada uma, abra a ficha e anote: tamanho que cabe na sua máquina, janela de contexto, se lê imagem, licença.
- Elimine o que não serve: licença restrita, modelo grande demais, sem bom suporte a português.
- Fique com dois candidatos. Escreva, para cada um, uma justificativa de duas frases: por que este tamanho e por que esta licença é aceitável para o seu uso.
Resumo da aula
- Modelo é um arquivo com bilhões de parâmetros. Tokens são os pedaços de texto; a janela de contexto é quanto ele segura de uma vez.
- Pesos abertos não é código aberto completo, e a licença continua valendo.
- Famílias principais: Llama, Qwen, Gemma, DeepSeek, Mistral, Phi. Cada uma tem vários tamanhos e versões.
- Referências práticas: 16 GB de memória roda cerca de 8B; placa de 24 GB roda 27 a 30B.
- Parâmetros ativos definem velocidade; totais definem memória. Quantização compacta o modelo.
- Licenças: permissivas (MIT, Apache), próprias da família (leia as condições) e restritas (não use na empresa).
Quiz da aula
Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.
Isaque Victor cursos gratuitos