Nesta aula
Agente sem teto de custo é conta surpresa. Agente sem condição de desligar é problema sem dono. As duas coisas se resolvem com uma conta simples e três decisões escritas.
Chegamos à parte que muita gente deixa para depois e se arrepende: quanto custa e quando parar. Eu não vou dar preço em moeda, porque muda mais rápido do que qualquer texto; vou dar o método para você calcular com os preços atuais da página oficial de cada fornecedor. Você vai entender o que é token, por que o contexto encarece, como escolher o modelo por tarefa, que tetos configurar e, principalmente, como escrever a condição de desligar antes de ligar.
- Ao final, você vai saber o que é token e como o custo de uma conversa se forma.
- Vai entender como escolher o modelo por tarefa e quais tetos configurar.
- Vai sair com um entregável: a estimativa de custo mensal do seu agente, com tetos e condição de desligar.
Token: a unidade que você paga
Modelos de linguagem não leem palavras; leem tokens. Um token é um pedaço de texto: às vezes uma palavra curta inteira, às vezes parte de uma palavra, às vezes um sinal de pontuação. Em português, uma palavra costuma virar mais de um token, porque os modelos foram treinados com mais inglês. A regra prática que eu uso para estimar: um texto em português tem, grosso modo, uma quantidade de tokens um pouco maior do que a de palavras, e para conta de padaria isso basta. Se precisar de precisão, os fornecedores oferecem contadores de tokens.
Quase todo fornecedor cobra por milhão de tokens, com dois preços: entrada (o que o modelo lê) e saída (o que ele escreve). Saída costuma custar mais que entrada. Plataformas prontas, como as de agente de WhatsApp, às vezes embutem isso num preço por conversa ou por mês; nesse caso a conta é mais simples, mas o que está por trás é a mesma.
O que entra na conta de cada resposta
Aqui está o ponto que surpreende. A cada resposta que o agente dá, o modelo lê de novo tudo isto:
- As instruções completas (persona, regras, recusas, formato, exemplos).
- A base de conhecimento ou os trechos dela que a plataforma inclui.
- O histórico da conversa até ali, inteiro.
- A mensagem nova da pessoa.
E escreve a resposta. Ou seja: uma conversa de dez trocas não custa dez vezes uma resposta. Custa mais, porque a décima resposta carrega as nove anteriores. Instrução de três páginas, base de vinte páginas coladas inteiras e conversas longas são os três vilões de custo. Instrução enxuta, base consultada por trecho (a maioria das plataformas faz isso) e teto de trocas por conversa são os três remédios.
Dica
Antes de reduzir qualidade para economizar, reduza contexto. Corte exemplo repetido, regra que nunca dispara, parágrafo de apresentação da empresa que o agente não usa. Instrução mais curta é mais barata e, quase sempre, funciona melhor.
O modelo certo por tarefa
Cada fornecedor oferece modelos de tamanhos diferentes: os pequenos são rápidos e baratos e resolvem bem tarefas simples; os grandes são mais capazes e custam várias vezes mais. O erro comum é usar o mais capaz para tudo "por segurança". O acerto é separar as tarefas do agente e dar a cada uma o modelo que ela pede.
Numa clínica, o agente de WhatsApp faz pelo menos três coisas: classifica a mensagem (dúvida, agendamento, reclamação, fora do escopo), responde perguntas simples da base e, de vez em quando, redige uma resposta mais elaborada sobre convênio ou política. A primeira é simples e acontece em toda mensagem: modelo pequeno. A segunda é simples também: modelo pequeno ou médio. A terceira é a única que pede o modelo mais capaz, e acontece numa fração das conversas. Se a plataforma permite escolher o modelo por etapa, essa separação pode reduzir o custo de forma expressiva sem perder qualidade onde importa. Se não permite, escolha o menor modelo que passa no roteiro de teste da aula 12.
| Tarefa | Volume | Dificuldade | Modelo |
|---|---|---|---|
| Classificar mensagem por estágio ou assunto | Toda mensagem | Baixa | Pequeno |
| Responder pergunta que está na base | Maioria | Baixa | Pequeno ou médio |
| Extrair campos de um documento | Médio | Média | Médio |
| Redigir resposta delicada, comparar políticas, decidir caso ambíguo | Poucas | Alta | Mais capaz |
| Analisar planilha grande com código | Raro | Alta | Mais capaz |
E teste. O modelo pequeno de hoje resolve o que o grande de dois anos atrás resolvia. A única forma de saber se o pequeno serve para a sua tarefa é rodar o roteiro de teste com ele.
A conta: estimando o custo mensal
Vou mostrar a conta com uma padaria que recebe encomendas pelo WhatsApp, usando variáveis em vez de números de preço, para você preencher com os valores atuais. Os passos:
- Conversas por mês. Conte nas últimas quatro semanas. A padaria: cerca de 400 conversas por mês.
- Trocas por conversa. Média de respostas do agente por conversa. Leia dez conversas e tire a média. A padaria: 4 respostas por conversa.
- Contexto por resposta. Some os tokens das instruções, dos trechos da base que entram e do histórico médio. Use um contador de tokens do fornecedor. A padaria: instruções mais base em torno de 2.000 tokens, histórico médio de 500, mensagem nova 50. Total de entrada por resposta: cerca de 2.550 tokens.
- Saída por resposta. Resposta de três linhas: uns 80 tokens.
- Tokens por mês. Entrada: 400 conversas × 4 respostas × 2.550 = 4.080.000 tokens. Saída: 400 × 4 × 80 = 128.000 tokens.
- Custo. Multiplique cada total pelo preço por milhão de tokens de entrada e de saída do modelo escolhido, na página oficial, hoje. Some. Se a plataforma cobra por conversa ou por mês, multiplique as 400 conversas pelo preço por conversa, ou use o plano mensal, e compare.
Repare no que a conta ensina: a entrada domina (4 milhões contra 128 mil). Cortar as instruções de 2.000 para 1.200 tokens reduz o custo de entrada em quase um terço, sem tocar na qualidade da resposta. E dobrar o número de trocas por conversa mais que dobra o custo. É por isso que teto de trocas e instrução enxuta são decisões de custo, não só de segurança.
Exemplo real
Um escritório contábil estimou o agente de triagem de e-mails e descobriu que a instrução tinha 5.000 tokens, com uma descrição de duas páginas sobre a história do escritório que o agente nunca usava. Cortaram para 1.500. O custo estimado caiu para menos da metade antes de o agente ir ao ar, e o roteiro de teste passou igual. A conta feita antes evitou pagar durante meses por texto inútil.
Tetos e a condição de desligar
Tetos
Três tetos, todos configurados antes de ligar, com aviso quando batem:
- Gasto mensal. A maioria dos fornecedores e plataformas permite um alerta ou um limite de gasto. Coloque em algo próximo da estimativa mais uma margem, e o alerta na metade. Se o alerta dispara no dia 10, você tem tempo de olhar.
- Respostas por dia. O teto diário da aula 12, que também é teto de custo: se algo der errado, o estrago tem tamanho conhecido.
- Trocas por conversa. Depois de um número de respostas na mesma conversa, o agente encaminha para uma pessoa. Conversa que não resolve em oito ou dez trocas raramente resolve em vinte, e custa cada vez mais.
Quando desligar
Desligar não é fracasso. É a parte do desenho que quase ninguém escreve e que evita o pior tipo de problema: o agente que continua rodando errado porque ninguém decidiu parar. Três condições, escritas antes, com o nome de quem tem autoridade para apertar o botão sem pedir permissão:
Erro subindo
A taxa de erro nas conversas lidas (aula 12) passou de um limite que você definiu, ou apareceu um erro grave (dado de terceiro, promessa indevida, opinião fora do escopo). Pausa, correção, roteiro de teste, religa.
Gasto estourando
O alerta de gasto disparou muito antes do previsto, ou o teto diário bateu mais de uma vez na semana. Pausa e investiga: laço, ataque, crescimento real. Religa com o teto ajustado.
Ninguém cuidando
Faz mais de duas semanas que ninguém lê as conversas nem atualiza a base. Um agente abandonado degrada em silêncio. Ou alguém assume, ou pausa até alguém assumir.
Cuidado
A condição de desligar precisa de dono com autoridade real. Se quem lê as conversas precisa pedir permissão ao dono da empresa para pausar, e o dono está viajando, o agente errado fica no ar dois dias. Quem lê, pausa. Explica depois.
Prática · 10 min
Estime o custo mensal do seu agente e escreva os tetos
- Conte as conversas do processo nas últimas quatro semanas (WhatsApp, e-mail, o que for o canal). Leia dez e calcule a média de respostas que o agente daria em cada uma.
- Cole as instruções atuais e um trecho típico da base num contador de tokens do fornecedor (ou estime pelo número de palavras com folga). Anote o contexto por resposta e a saída média.
- Faça a conta dos seis passos: tokens de entrada e saída por mês, multiplicados pelo preço atual da página oficial do modelo ou pelo preço por conversa da plataforma. Anote a fonte e a data do preço.
- Identifique o maior vilão (instrução longa, base inteira, conversas longas) e escreva uma redução concreta. Refaça a conta com a redução.
- Escreva os três tetos com números (gasto mensal com alerta na metade, respostas por dia, trocas por conversa) e as três condições de desligar com o nome de quem aperta o botão.
- Compare o custo estimado com o tempo de pessoa que o agente economiza por mês (horas × custo da hora). Anote a conclusão em uma frase.
Resumo da aula
- Token é a unidade de cobrança: entrada (o que o modelo lê) e saída (o que escreve). Em português, mais tokens por palavra.
- Cada resposta relê instruções, base e histórico inteiro. Entrada domina o custo; instrução enxuta e teto de trocas são as maiores economias.
- Modelo certo por tarefa: pequeno para classificar e responder o simples, mais capaz só para o difícil. Teste o menor que passa.
- A conta tem seis passos e usa o preço da página oficial, com fonte e data. Nunca preço de memória.
- Três tetos antes de ligar: gasto mensal com alerta, respostas por dia, trocas por conversa.
- Três condições de desligar, escritas, com dono que pausa sem pedir permissão: erro subindo, gasto estourando, ninguém cuidando.
Quiz da aula
Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.
Isaque Victor cursos gratuitos