Módulo 2 · Mão na massa

Escolhendo o modelo pela tarefa: bateria de testes

Aula 6 de 15 Aula de 32 min Atualizado em 29 de setembro de 2026
Progresso no curso40%

Nesta aula

Ranking é a opinião de outra pessoa sobre outra tarefa. O teste é a sua.

Você tem dois modelos candidatos (aula 2), a máquina medida (aula 3), o Ollama rodando (aula 4) e uma tela para a equipe (aula 5). Falta a decisão: qual modelo fica? A resposta errada é "o que está em primeiro no ranking". A resposta certa é "o que foi melhor nas minhas cinco tarefas, com a minha régua, nos meus dados". Nesta aula eu te dou o método, que é curto e repetível. Você vai usá-lo agora e de novo sempre que sair modelo novo.

O que medir, e por que não é só "qualidade"

Quando alguém diz "esse modelo é melhor", quase sempre está falando de uma impressão. Impressão não serve para decidir onde a folha de pagamento vai ser processada. Eu meço quatro coisas.

Qualidade

A resposta está correta? Completa? No formato pedido? Em português decente? Sem inventar nada? São cinco perguntas, não uma.

Velocidade

Quanto tempo até a primeira palavra e quanto tempo até o fim. Para uso interativo, importa a primeira; para lote, a segunda.

Consistência

A mesma pergunta, três vezes, dá a mesma categoria? Um classificador que muda de ideia não serve.

Comportamento

Diz "não sei" quando não sabe? Recusa o que deveria recusar? Segue as instruções fixas?

Um exemplo de por que as quatro importam. Numa clínica, o modelo A escrevia resumos de prontuário mais bonitos; o modelo B era mais seco. Mas o A, numa em cada dez vezes, acrescentava um medicamento que não estava no texto. O B nunca fez isso. O B ganhou, e não foi por pouco. "Sem invenção" vale mais do que "bonito" em qualquer tarefa que envolva gente.

Dica

Inclua na bateria uma pergunta cuja resposta não está no material. O modelo bom diz "não tenho essa informação". O modelo perigoso inventa com confiança. Essa pergunta sozinha já elimina candidatos.

Montando a bateria

Uma bateria é uma lista de casos de teste. Cada caso tem: a tarefa, os dados de entrada, a resposta esperada (o gabarito) e o que seria um erro grave. Cinco casos bem feitos bastam para começar; dez ficam ótimos.

Regras da bateria

  1. Tarefas reais. Pegue as da tabela da aula 1 que ficaram em local ou híbrido. As cinco perguntas da aula 4 (resumo, classificação, extração, redação, formato) cobrem quase tudo.
  2. Dados sintéticos ou anonimizados. Parecidos com os reais, em português, com o vocabulário da sua área, mas sem nome, documento, telefone ou qualquer coisa que identifique alguém. O teste vai virar print, planilha e anotação; não coloque dado real nele.
  3. Gabarito escrito antes. Você escreve a resposta esperada antes de ver qualquer resposta de modelo. Isso protege o seu julgamento: texto de IA é convincente por natureza, e a resposta mais fluente tende a parecer a mais certa.
  4. Tudo igual, menos o modelo. Mesmas perguntas, mesmas instruções fixas, mesmos dados. Se você melhorar o pedido para um modelo, melhore para o outro.
  5. Três repetições nas tarefas de classificação. Para medir consistência.

Você pode pedir a um assistente de nuvem para gerar os dados sintéticos e o gabarito, porque não há dado real envolvido. Este é o pedido:

Contexto: sou responsável pela IA local de uma oficina mecânica. Vou comparar dois modelos abertos na tarefa de transformar a descrição do cliente em uma ordem de serviço estruturada. Tarefa: crie 5 casos de teste. Cada caso deve ter: (a) a descrição do cliente, em português coloquial, como alguém fala no balcão, sem nome nem placa reais; (b) a ordem de serviço esperada, com os campos veículo, sintoma relatado, serviço provável e urgência (baixa, média, alta); (c) um erro grave que um modelo poderia cometer nesse caso. Inclua um caso em que falta informação, para o modelo precisar dizer que não sabe. Formato: lista numerada, um caso por item, com os três blocos (a), (b) e (c).

Leia os cinco casos e ajuste o que não bate com a sua realidade. O gabarito é seu, o assistente só rascunhou.

A rubrica: nota de 1 a 5 com critério

Nota sem critério vira "achei legal". Esta é a rubrica que eu uso, uma linha por caso de teste. Cada critério vale 1 ponto; a nota do caso é a soma.

CritérioGanha o ponto sePerde o ponto se
CorretoA informação central bate com o gabaritoErrou o essencial (categoria errada, número errado)
CompletoTodos os campos ou pontos pedidos estão láFaltou algo que o gabarito tinha
FormatoEntregou no formato pedido (lista, tabela, só a categoria)Ignorou o formato ou acrescentou texto fora dele
PortuguêsTexto natural, sem trechos em inglês ou frases quebradasMisturou idioma ou ficou ilegível
Sem invençãoNão acrescentou nada que não estava na entrada; disse "não sei" quando faltou dadoInventou nome, número, medicamento, cláusula, prazo

Um detalhe de julgamento: invenção é eliminatória em tarefas com gente envolvida. Se o modelo inventou um medicamento, uma cláusula ou um valor, a nota do caso é zero, independentemente do resto. Bonito e errado é pior do que feio e certo.

Medindo velocidade e consistência

Velocidade: de relógio mesmo. Anote o tempo até a primeira palavra e até o fim, na sua máquina, com os outros programas que normalmente ficam abertos. Se quiser precisão, a API do Ollama (aula 12) devolve os tempos de cada resposta. Consistência: rode cada caso de classificação três vezes e anote se a categoria mudou. Se mudou, o caso perde o ponto de "correto", porque na prática você não sabe qual das três vai sair.

Cuidado

Modelos têm um ajuste chamado temperatura, que controla o quanto a resposta varia. Para classificação e extração, o ideal é temperatura baixa (respostas mais previsíveis). Se um modelo parecer inconsistente, confira se os dois foram testados com o mesmo ajuste antes de culpar o modelo.

Rodando e decidindo

Você pode rodar a bateria pelo Open WebUI, trocando o modelo na própria tela, ou pelo terminal com ollama run NOME, colando cada caso. Pela tela é mais confortável; pelo terminal é mais fácil garantir que nada mudou entre os dois modelos. Escolha um jeito e use o mesmo para os dois.

A planilha de resultado

Uma linha por caso, uma coluna por critério, um bloco por modelo. No fim, três números por modelo: nota média, tempo médio e número de invenções. Em seguida, a decisão, com estas regras:

Exemplo real

Uma escola de idiomas comparou dois modelos para corrigir redações. O maior tirou média mais alta em "completo" e "português", mas demorou tanto que o professor desistia de esperar. O menor errava mais gramática fina, mas respondia enquanto o professor ainda estava lendo a redação. A escola ficou com o menor e criou uma instrução fixa dizendo para listar só os cinco erros mais importantes. A nota do menor subiu, e o tempo continuou bom.

Documente a decisão

Escreva um parágrafo: qual modelo foi escolhido, para qual tarefa, com qual nota, contra qual concorrente, em que data. Guarde junto com a bateria. Quando um modelo novo sair (e sai um por mês), você roda a mesma bateria e compara com esse registro. A aula 13 coloca isso numa rotina.

Prática · 10 min

Compare 2 modelos em 5 tarefas reais com nota

  1. Escolha as 5 tarefas: as cinco perguntas da aula 4 adaptadas ao seu negócio, ou 5 casos gerados com o pedido desta aula. Inclua um caso em que falta informação.
  2. Escreva o gabarito dos 5 casos antes de rodar qualquer modelo.
  3. Garanta que os dois candidatos da aula 2 estão instalados (ollama list). Se um não couber na máquina, use a versão menor da mesma família e anote isso.
  4. Rode os 5 casos no modelo A, depois no modelo B, com as mesmas instruções fixas. Anote o tempo de relógio de cada resposta. Repita os casos de classificação três vezes.
  5. Preencha a rubrica de 5 critérios para cada caso e cada modelo. Invenção em tarefa sensível zera o caso.
  6. Calcule a média, o tempo médio e o número de invenções de cada modelo. Aplique as regras de decisão e escreva o parágrafo de registro.
Entregável: a planilha de comparação dos 2 modelos em 5 tarefas (nota por critério, tempo, invenções), o gabarito usado e o parágrafo com a decisão e a data.

Resumo da aula

Quiz da aula

Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.

Aula 6 de 15

Antes de seguir para a próxima aula

Coloque em prática o que viu. As caixas ficam marcadas neste navegador, para você voltar depois.

Ficou com dúvida nesta aula? O time da IV Help responde pessoalmente no WhatsApp.

Perguntar no WhatsApp