Módulo 5 · Governança e projeto final

Custos e limites

Aula 14 de 15 Aula de 32 min Atualizado em 29 de setembro de 2026
Progresso no curso93%

Nesta aula

Agente sem teto de custo é conta surpresa. Agente sem condição de desligar é problema sem dono. As duas coisas se resolvem com uma conta simples e três decisões escritas.

Chegamos à parte que muita gente deixa para depois e se arrepende: quanto custa e quando parar. Eu não vou dar preço em moeda, porque muda mais rápido do que qualquer texto; vou dar o método para você calcular com os preços atuais da página oficial de cada fornecedor. Você vai entender o que é token, por que o contexto encarece, como escolher o modelo por tarefa, que tetos configurar e, principalmente, como escrever a condição de desligar antes de ligar.

Token: a unidade que você paga

Modelos de linguagem não leem palavras; leem tokens. Um token é um pedaço de texto: às vezes uma palavra curta inteira, às vezes parte de uma palavra, às vezes um sinal de pontuação. Em português, uma palavra costuma virar mais de um token, porque os modelos foram treinados com mais inglês. A regra prática que eu uso para estimar: um texto em português tem, grosso modo, uma quantidade de tokens um pouco maior do que a de palavras, e para conta de padaria isso basta. Se precisar de precisão, os fornecedores oferecem contadores de tokens.

Quase todo fornecedor cobra por milhão de tokens, com dois preços: entrada (o que o modelo lê) e saída (o que ele escreve). Saída costuma custar mais que entrada. Plataformas prontas, como as de agente de WhatsApp, às vezes embutem isso num preço por conversa ou por mês; nesse caso a conta é mais simples, mas o que está por trás é a mesma.

O que entra na conta de cada resposta

Aqui está o ponto que surpreende. A cada resposta que o agente dá, o modelo lê de novo tudo isto:

E escreve a resposta. Ou seja: uma conversa de dez trocas não custa dez vezes uma resposta. Custa mais, porque a décima resposta carrega as nove anteriores. Instrução de três páginas, base de vinte páginas coladas inteiras e conversas longas são os três vilões de custo. Instrução enxuta, base consultada por trecho (a maioria das plataformas faz isso) e teto de trocas por conversa são os três remédios.

Dica

Antes de reduzir qualidade para economizar, reduza contexto. Corte exemplo repetido, regra que nunca dispara, parágrafo de apresentação da empresa que o agente não usa. Instrução mais curta é mais barata e, quase sempre, funciona melhor.

O modelo certo por tarefa

Cada fornecedor oferece modelos de tamanhos diferentes: os pequenos são rápidos e baratos e resolvem bem tarefas simples; os grandes são mais capazes e custam várias vezes mais. O erro comum é usar o mais capaz para tudo "por segurança". O acerto é separar as tarefas do agente e dar a cada uma o modelo que ela pede.

Numa clínica, o agente de WhatsApp faz pelo menos três coisas: classifica a mensagem (dúvida, agendamento, reclamação, fora do escopo), responde perguntas simples da base e, de vez em quando, redige uma resposta mais elaborada sobre convênio ou política. A primeira é simples e acontece em toda mensagem: modelo pequeno. A segunda é simples também: modelo pequeno ou médio. A terceira é a única que pede o modelo mais capaz, e acontece numa fração das conversas. Se a plataforma permite escolher o modelo por etapa, essa separação pode reduzir o custo de forma expressiva sem perder qualidade onde importa. Se não permite, escolha o menor modelo que passa no roteiro de teste da aula 12.

TarefaVolumeDificuldadeModelo
Classificar mensagem por estágio ou assuntoToda mensagemBaixaPequeno
Responder pergunta que está na baseMaioriaBaixaPequeno ou médio
Extrair campos de um documentoMédioMédiaMédio
Redigir resposta delicada, comparar políticas, decidir caso ambíguoPoucasAltaMais capaz
Analisar planilha grande com códigoRaroAltaMais capaz

E teste. O modelo pequeno de hoje resolve o que o grande de dois anos atrás resolvia. A única forma de saber se o pequeno serve para a sua tarefa é rodar o roteiro de teste com ele.

A conta: estimando o custo mensal

Vou mostrar a conta com uma padaria que recebe encomendas pelo WhatsApp, usando variáveis em vez de números de preço, para você preencher com os valores atuais. Os passos:

  1. Conversas por mês. Conte nas últimas quatro semanas. A padaria: cerca de 400 conversas por mês.
  2. Trocas por conversa. Média de respostas do agente por conversa. Leia dez conversas e tire a média. A padaria: 4 respostas por conversa.
  3. Contexto por resposta. Some os tokens das instruções, dos trechos da base que entram e do histórico médio. Use um contador de tokens do fornecedor. A padaria: instruções mais base em torno de 2.000 tokens, histórico médio de 500, mensagem nova 50. Total de entrada por resposta: cerca de 2.550 tokens.
  4. Saída por resposta. Resposta de três linhas: uns 80 tokens.
  5. Tokens por mês. Entrada: 400 conversas × 4 respostas × 2.550 = 4.080.000 tokens. Saída: 400 × 4 × 80 = 128.000 tokens.
  6. Custo. Multiplique cada total pelo preço por milhão de tokens de entrada e de saída do modelo escolhido, na página oficial, hoje. Some. Se a plataforma cobra por conversa ou por mês, multiplique as 400 conversas pelo preço por conversa, ou use o plano mensal, e compare.

Repare no que a conta ensina: a entrada domina (4 milhões contra 128 mil). Cortar as instruções de 2.000 para 1.200 tokens reduz o custo de entrada em quase um terço, sem tocar na qualidade da resposta. E dobrar o número de trocas por conversa mais que dobra o custo. É por isso que teto de trocas e instrução enxuta são decisões de custo, não só de segurança.

Exemplo real

Um escritório contábil estimou o agente de triagem de e-mails e descobriu que a instrução tinha 5.000 tokens, com uma descrição de duas páginas sobre a história do escritório que o agente nunca usava. Cortaram para 1.500. O custo estimado caiu para menos da metade antes de o agente ir ao ar, e o roteiro de teste passou igual. A conta feita antes evitou pagar durante meses por texto inútil.

Tetos e a condição de desligar

Tetos

Três tetos, todos configurados antes de ligar, com aviso quando batem:

Quando desligar

Desligar não é fracasso. É a parte do desenho que quase ninguém escreve e que evita o pior tipo de problema: o agente que continua rodando errado porque ninguém decidiu parar. Três condições, escritas antes, com o nome de quem tem autoridade para apertar o botão sem pedir permissão:

Erro subindo

A taxa de erro nas conversas lidas (aula 12) passou de um limite que você definiu, ou apareceu um erro grave (dado de terceiro, promessa indevida, opinião fora do escopo). Pausa, correção, roteiro de teste, religa.

Gasto estourando

O alerta de gasto disparou muito antes do previsto, ou o teto diário bateu mais de uma vez na semana. Pausa e investiga: laço, ataque, crescimento real. Religa com o teto ajustado.

Ninguém cuidando

Faz mais de duas semanas que ninguém lê as conversas nem atualiza a base. Um agente abandonado degrada em silêncio. Ou alguém assume, ou pausa até alguém assumir.

Cuidado

A condição de desligar precisa de dono com autoridade real. Se quem lê as conversas precisa pedir permissão ao dono da empresa para pausar, e o dono está viajando, o agente errado fica no ar dois dias. Quem lê, pausa. Explica depois.

Prática · 10 min

Estime o custo mensal do seu agente e escreva os tetos

  1. Conte as conversas do processo nas últimas quatro semanas (WhatsApp, e-mail, o que for o canal). Leia dez e calcule a média de respostas que o agente daria em cada uma.
  2. Cole as instruções atuais e um trecho típico da base num contador de tokens do fornecedor (ou estime pelo número de palavras com folga). Anote o contexto por resposta e a saída média.
  3. Faça a conta dos seis passos: tokens de entrada e saída por mês, multiplicados pelo preço atual da página oficial do modelo ou pelo preço por conversa da plataforma. Anote a fonte e a data do preço.
  4. Identifique o maior vilão (instrução longa, base inteira, conversas longas) e escreva uma redução concreta. Refaça a conta com a redução.
  5. Escreva os três tetos com números (gasto mensal com alerta na metade, respostas por dia, trocas por conversa) e as três condições de desligar com o nome de quem aperta o botão.
  6. Compare o custo estimado com o tempo de pessoa que o agente economiza por mês (horas × custo da hora). Anote a conclusão em uma frase.
Entregável: o documento "Custo e limites do agente" com a estimativa mensal (com fonte e data do preço), a redução aplicada, os três tetos com números, as três condições de desligar com responsável e a comparação com o tempo economizado.

Resumo da aula

Quiz da aula

Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.

Aula 14 de 15

Antes de seguir para a próxima aula

Coloque em prática o que viu. As caixas ficam marcadas neste navegador, para você voltar depois.

Ficou com dúvida nesta aula? O time da IV Help responde pessoalmente no WhatsApp.

Perguntar no WhatsApp